Kimi K3真有网上吹的那么牛?深度实测几天后,我发现…

熊猫办公
AI MODEL · 深度实测

2026.07

国产模型只能跟跑?发布48小时即断售,重铸国产之光2.8 万亿参数开源

3D 导览 · 名场面 · 肉鸽卡牌 · 企业后台 · 游戏厅

Kimi K3真有网上吹的那么牛?深度实测几天后,我发现...
Kimi K3 · 发布 48 小时断售

3DCODE
大家好啊,我是在 WAIC 累瘫的甲木……这几天在上海 WAIC 逛麻了,17 号直播了一下午「机器人和 TA 的朋友们」,直播完嗓子就说不出话来,18 号又陪 360 周总逛展了一天,结束之后人麻了……感受就剩一句:逛 WAIC 拼的是身体素质……但周四晚上!月之暗面发布了 Kimi K3,2.8 万亿参数、原生多模态、百万级上下文。WAIC 本来就热闹,现在展馆内外都在聊它。

Kimi K3真有网上吹的那么牛?深度实测几天后,我发现...

实在是忍不住,我还是在间隙里测了一轮。先说结论:K3 的效果远超出我的预期,超过 Opus 4.8 的水平。有几个场景,我甚至觉得它跟 Fable 5 打成了平手。真的,非常非常非常的吊!而且马上就会开源,即将成为全球最大开源大模型!先来看看 AA 给的智能排行榜,虽然 Kimi K3 的整体表现仍落后于最强的闭源模型 Claude Fable 5 和 GPT-5.6 Sol,但是在很多场景我觉得是有非常经验的水平的……

Kimi K3真有网上吹的那么牛?深度实测几天后,我发现...

我们不看榜单,直接上实战,在场景里面看一下 K3 的效果到底怎么样~先看看 Kimi 社区朋友们做的 case:

Kall of Duty 演示视频

接下来,给大家看看我的实测,因为时间零散,这些 Case 全是我随手想的,没有设计复杂提示词。Case 分两类:一些在手机上想到什么测什么,一些用 Kimi Code 跑。官方这次格外强调 K3 的 3D 能力:按官方的说法,它能把概念、图像和视频直接变成可以玩的交互体验。官方 demo 里就有 3D 模拟长征十号火箭发射回收、3D 开放世界游戏,黑洞卡冈图雅可视化还直接放出了网页版。

黑洞卡冈图雅可视化演示

那就从 3D 开始测。

📦 5 Parts + Conclusion👉 滑动
PART 01WAIC 3D人在展馆搬上网
PART 02一句话名场面亮剑×古董店
PART 03做游戏能玩的没几个
PART 04后端能力不止于视觉
PART 05电视游戏厅十三盘卡带
PART ///写在最后三条使用口诀
01PART

人在 WAIC,让它把 WAIC 搬上网3D TOUR · CASE 01

周五中午,我正在世博展览馆里探展。走得累了,刷到上面这些别人做的 case,我就顺手打开 Kimi,简单地想了个任务:给我做一个 WAIC 的线上 3D 导览。

Kimi K3真有网上吹的那么牛?深度实测几天后,我发现...

出来的东西是这样的:

Kimi K3真有网上吹的那么牛?深度实测几天后,我发现...

每个地方都能点进去:展位能交互,连地图都能走进去,还有小机器人,非常美观。

乐高 3D 模型演示视频

当然展馆布局和展馆信息跟实际有些出入,AI 还原真实场很难做到完全正确。但它把不少信息收进了场景,而且交付的是成品。之前做这类东西,第一轮往往启动不了容易报错,这次拿到手直接就能打开、能逛。

02PART

一句话,一个名场面SCENE REBUILD · CASE 02

WAIC 的导览做完,晚上回酒店,我又随手测了两个名场面。亮剑相信大家都看过,我让 Kimi「做一个《亮剑》平安县城的 3D 互动场景」。出来的东西,建模是对的,场景是对的,剧情还是连贯的——你可以在 Kimi 里再体验一次「意大利炮」那段名场面。

Kimi K3真有网上吹的那么牛?深度实测几天后,我发现...

来看看实际交互。

平安县城实际交互演示

《亮剑》看完,再比如《成龙历险记》的老爹古董店。

成龙历险记老爹古董店演示(含录屏素材)

前面 case 都是一把过,可以看到那个地方网页的部署编号是 V1,但也不是说每一个 case 都是一次过,古董店这个 case,E 键卡死过一回。想修倒也简单,直接跟它说一声:这个地方按 E 会卡住。

Kimi K3真有网上吹的那么牛?深度实测几天后,我发现...

两个名场面,简单一两句话,K3 都稳稳接住了。官方给这个能力起了个名字,叫「视觉闭环」:

Kimi K3真有网上吹的那么牛?深度实测几天后,我发现...

具体实现上,应该是——

模型一边生成,一边给自己定验收标准

验收时截个图,看达没达标;开发中也时不时截图,看看自己做出的画面;再结合控制台的信息,不对就跟着调。

Kimi K3真有网上吹的那么牛?深度实测几天后,我发现...
信息收集看导览收进场景的真实展位
3D 开发看名场面立住的建模、场景和剧情
工程化开发通过优秀的计划任务、工程调度,使得用户第一版就能生成出打开的成品——E 键卡死,一句话就修好了
03PART

做游戏:好看的遍地都是,能玩的没几个GAME DEV · CASE 03

游戏开发也是官方这次主推的方向。这块我重点测了。很多人有个误区,以为 AI 做个小游戏很简单,界面确实简单,但游戏难的不在界面,在机制。一个游戏要成立,模型得同时交付三样东西:规则要好玩,机制要完整,流程要能从开局一路玩到结算。缺任何一样,出来的就是个好看的 demo。

Kimi K3真有网上吹的那么牛?深度实测几天后,我发现...

我以前用别的模型做游戏,经常卡在这:页面漂亮,玩不下去。第一个 case,我让它做一款扑克牌形式的肉鸽卡牌,对标《小丑牌》。

Kimi K3真有网上吹的那么牛?深度实测几天后,我发现...

它直接给我交付了一整套游戏:斗地主的牌型底子,Balatro 的肉鸽卡牌机制,商店、成长、结算体系都在。

Kimi K3真有网上吹的那么牛?深度实测几天后,我发现...

朋友们,重点是,这东西真的能一直玩下去,机制是完整的,不是只交给你一个界面。

小丑牌玩法演示视频

做完复刻,我又出了一道更难的题:第二个 case,给它一个游戏提案,让它独立开发。

游戏提案相关素材

第一版交上来,是个平面。我就说了一句话:改成 2.5D。

Kimi K3真有网上吹的那么牛?深度实测几天后,我发现...

它改好了,不仅仅画面更精细,还有下雨天的效果,而且这个细节做的非常好,雨天顾客还会撑伞。这几天我忙,测得也零散,都是挤时间测的:它改完一版我接着追问,想到哪说到哪,Kimi 都发挥得很好。

04PART

不止于视觉,后端能力非常强BACKEND · CASE 04

其实 Kimi 的 K3,除了视觉向,在整个后端的设计和交付上面也非常牛批……Coding 能力放在哪个 case 都成立:比如让它帮你做一个企业后台,很多 AI只交付一个前端,根本没法用。浅举个例子,让它给我做一个内训交付管理后台。我自己做企业培训,客户、项目、课表、签到、成绩、结营报告,全是我每周真在跑的事。

Kimi K3真有网上吹的那么牛?深度实测几天后,我发现...

内训交付管理后台截图

来看看 Kimi 给我设计的业务逻辑:

Kimi K3真有网上吹的那么牛?深度实测几天后,我发现...

业务逻辑设计截图

Kimi K3真有网上吹的那么牛?深度实测几天后,我发现...

可以看到,在设计上 K3 做的是相对细致的,签到表上直接写死了「一个人一节课一条记录」,超卖这种事,从表结构上就被封死了。而且交付的时候,还做了非常丰富的测试,从 9 个维度去验收,测试的内容我就不贴了,直接看下图吧

Kimi K3真有网上吹的那么牛?深度实测几天后,我发现...

9 个维度验收测试截图

这几天我忙,测得也零散,都是挤时间测的:它改完一版我接着追问,想到哪说到哪,Kimi 都发挥得很好。

05PART

十三盘卡带,一台电视机RETRO TV · CASE 05

case 越攒越多,周末我干脆做了个合集:做了一台复古电视游戏厅,把所有游戏装了进去。

Kimi K3真有网上吹的那么牛?深度实测几天后,我发现...

这台电视机做得跟真的一样:木纹侧板、微凸的玻璃屏、会呼吸的电源灯,摆在客厅里。

Kimi K3真有网上吹的那么牛?深度实测几天后,我发现...

点卡带,卡飞进卡槽,开机白线一闪、雪花一响,游戏开播,换台自动换卡。还有个沉浸模式,镜头直接钻进屏幕里。

电视机沉浸模式录屏

除了前面说过的,还有像素方块、贪吃蛇、坦克大战、8-BIT 音乐台。

电视机游戏合集录屏

它也不是把 13 个游戏简单拼进去就完事:交工前每一个都自己检查过,没有打不开的。

Kimi K3真有网上吹的那么牛?深度实测几天后,我发现...
///LAST

写在最后CONCLUSION · 3 RULES

说说 Kimi K3 这几天用下来的真实感受。

首个全面的编程国产大模型Sonnet 的价格,Opus 的体验

一个 1M 上下文、多模态、长程任务,同时基于“线性优化”架构,K3 相比同级别只需 Sonnet 价格,把 Opus 的价格打下来。

!一个比较蛋疼的地方 🕳不过官方也是这么认为的:K3 细节发散能力极强,导致面对“极简需求”时容易想太多、耗时太久。解法很简单:简单的活儿,记得加约束。
Kimi K3真有网上吹的那么牛?深度实测几天后,我发现...

抛开这点,整体体验堪称惊艳。不需要写特别复杂的提示词,直接口喷序曲,想到什么丢什么,不满意就追问。“名场面”、“王牌地主”还有那台电视机,都是这么搞出来的。总结一下我现在的 K3 使用口诀:

讲清需求一两句话讲清自己需求
追问不满意就追问
加约束简单活儿加约束

随手玩用手机端,做项目上 Kimi Code。综合体验优于 Claude Opus 4.8,审美碾压 GPT-5.6,距 Fable 5 还有微小差距。最牛批的,是它的进化速度。一个 2.8 万亿的开源模型,能把一句话接成一台电视机。老用户都知道,Kimi K2.5 在 Agent in the Loop 上还容易陷入无限调用循环,2.6 对此有针对性优化,2.7 基本不会复现,而如今的 K3直接完成了跨越。国产模型能有这种高光时刻,确实令人惊喜。

Kimi K3真有网上吹的那么牛?深度实测几天后,我发现...

— 赛博鬼打墙:597 次 tool uses 有四十多次是 grep 同一个内容Kimi 的 K3 模型在海外的呼声也非常高……

Kimi K3真有网上吹的那么牛?深度实测几天后,我发现...

写到这的时候,看到官方一条消息,非常离谱,

Kimi K3真有网上吹的那么牛?深度实测几天后,我发现...

发布 48 小时就断售了,而且海外和国内的一起断售,????模型实力如何,大家从这个火爆程度应该能感受到了吧……Kimi 牛批!以上。

我是甲木,热衷于分享一些 AI 干货内容,同时也会分享 AI 在各行业的落地应用。

如果你觉得今天这篇有收获,随手点个赞、在看、转发三连吧,我们下期再见。

点赞

在看

转发

THANKS FOR READING

Kimi K3真有网上吹的那么牛?深度实测几天后,我发现...
© 版权声明

相关文章