OK,照例是先来看看分数,这不对吧不对吧,Fable5不是应该横扫一切吗,你Opus5除了四个项(多学科推理, Agent 编程,法律和健康)怎么都给了Fable5一个大逼兜啊。只能说订阅里的一半额度有去处了,不需要Fable5用完就只能GPT5.6了。就算没有账号用API也能烧得动了,输入5刀/每百万Token,输出25刀/每百万Token ,价格跟Opus 4.8一样。还有快速模式,速度加2.5倍,价格X2。

100万上下文,知识更新到了26年的5月份,属于是新鲜出炉了。在max effort下,距离Fable 5的最高分只有0.5%。而且在high,xhigh,max这几个档位上,它的性能成本比都压过了其他模型。

还有一个最刺眼的评分,ARC-AGI-3分数居然是GPT 5.6的3倍以上,这个测试主要测的就是模型进入完全陌生的环境后,能不能通过试错迅速搞懂规则并完成目标。

具体点说就是,把模型扔进一个从没见过的二维小游戏,只告诉它有哪些按钮,不告诉玩法,规则和胜利条件。模型需要自己建立规则模型,把前几关学到的规律用于后面的关卡。所以现在我的执行路线从Fable5出计划,GPT5.6 sol做长时间执行,Sonnet5做短时间一次性任务执行,幻觉大的Opus4.8路边一条,变成了Fable5出计划,GPT5.6和Opus5并行执行,最后Fable5再整合就行,实测这个积分还是能撑得住,因为很多执行环节现在都可以直接转到Opus5做了。刚刚还学到了一手,用网页版上的GPT-5.6 Sol Pro来做大型代码Review,又省一个额度。Opus 5这次在X上测试最多的就是做这类3D场景的画面游戏。只能说同样提示语下GPT 5.6做出来了完全一坨。
来都来了,我也做了一把3D游戏,Opus 5带关卡的设置和对应的NPC的智能设置置非常大而全,不像之前我们只能跟静物去互动。我做出来的这个逃生游戏,里面的机器人能够随机扫射你的位置,压迫感非常强。大家可以去看看我试玩的那一段,我自从被机器人发现的那一瞬间,就只活了5秒,就被电没了。
最后还是我打了十年游戏的同学给我打到第二关的,我这个出游戏的居然连第一关都打不过。

隔壁的GPT 5.6 Sol做出来的让我没啥试玩的冲动啊,机器人就跟个木头一样,我一个秦王绕柱就绕开了。

最后来测试一下写作能力,我的大Opus4.6会不会拉了,
请写一个短篇故事,题目是《凌晨三点的便利店》。要求:800字以内主角是一名长期失眠的年轻人故事中必须出现:一张过期的彩票、一位奇怪的店员、一通没有来电号码的电话开头要能快速吸引读者中间必须出现一次意外转折结尾要有余韵,但不要故意解释所有谜题人物行为必须合理,避免空洞煽情不要使用网络流行语直接输出故事,不要解释创作思路

再看看下Opus 5,

和Opus4.6的,

我觉得这个千人千味啊,反正我们投票了好几轮。我是觉得Opus 4.6还是版本之子,但是已经开始有朋友觉得Opus 5 在这一篇文章的表达里面,更能把整个故事环境更拧成一条线。简单来说,就是Opus 5写出来的故事更完整,但是 4.6 很会制造整体的悬疑。所以大家觉得哪一个模型现在写作更好呢?我还是会投Opus 4.6的。最后的最后,这次A社还把Claude Code上80%的系统提示语去了,结合之前GPT 5.6 Sol出来了SuperPower这个辅助思考的Skill就可以直接删了,其实可以看到随着模型能力的上来,我们不太需要那么多的条条框框来规定模型的发挥了。

我去看了一下,被删掉的主要是过量示例,硬性的不要做什么,重复约束,以及模型已经能够自行判断的内容。隔壁OpenAI之前测试GPT-5.6 Model Guidance也给过了对照数据,在一组内部coding-agent评测中,更简单的System Prompt反而让评分提高约10–15%,Token减少 41–66%,成本降低 33–67%留下来的Skills越多,模型反而会越懵逼,强行兼容冲突,所以我一开始用GPT 5.6甚至会出现一个简单的问题想了一个小时的情况。A社推荐我们用/doctor来给Claude Code做个大瘦身,能找出来长期未使用但仍有上下文成本的Skill、MCP和插件。我也把我之前给Codex做skill瘦身的提示语改造了一下,因为直接删掉可能有些触发词用习惯了还要重新安装,
## skill分层提示语盘点当前 Agent 环境中的 Skill、插件和 MCP:统计安装数量、去重数量、全局/项目作用域、最近使用时间、实际调用次数,以及它们占用的启动上下文和调用后上下文。不要只看装没装,要结合 session 日志、/doctor、/context、插件 Last used 和必要的 fresh-session A/B,输出一张分析图表。再把所有 Skill 分成三档:-高频常驻:几乎每周或多数相关任务都在用,保留全局启用;-中频项目化:稳定使用但只服务特定项目,改为仅在项目生效;-低频归档:长期未使用,先归档完整内容,不要直接删除。对低频归档项保留一个极小的“触发空壳”,只记录名称、能力摘要、2–5 个自然语言触发词、归档位置、恢复方式和观察截止日。当用户请求命中触发词时,只提示:“这个能力对应的 Skill 已归档,是否要为当前项目临时加载?”未经明确同意,不安装、不启用、不复制、不执行。归档后默认观察 60 天。期间再次触发就恢复到项目级;多项目持续高频才恢复全局。60 天内 0 次触发的非关键 Skill,只能进入可删除候选,仍需用户再次确认后才能删除。发布、回滚、安全、隐私等低频关键 Skill 单独加RARE_CRITICAL 标签,不得仅因使用次数低而归档或删除。

这样的话不会影响日常工作流的同时还会提升模型的效果,所以这次最让我开心的,不是Opus 5又拿了几个第一。是它开始把Fable 5那种贵到有点不想睡觉天天都要打满5小时的能力,往日常默认模型的上拉。以前会觉得,Fable 5当然很强,但额度和价格摆在这,除非任务真的很重要,不然根本舍不得开。我还专门做了一个路由,就是Fable5是全程只需要动脑子不动手的,这样我一周API价格才能控制在3000内现在Opus 5摆在这里,性能已经挤进了同一张桌子,价格却直接砍了一大截。我们的白月光回来了,这次好像还没那么贵了。
