实测Macaron V1,还真给我GLM5.2调成0.8个Fable5了

熊猫办公
完胜了,超越了,逼近了,每次有新模型发布,介绍基本都长一个样。推理更强了,代码更稳了,上下文更长了,Agent更聪明了。榜单一排,柱状图一拉,每一项都比上一代强20%。所以我现在看模型,已经越来越不关心它在某张榜单上高了几分,不涨也不会放出来。我更关心一件事,稳定。哪怕不是个全能水桶模型,只要能在我高频使用场景上一直有效,我很乐意冲个plan,很多时候这比我去openrouter扣扣搜搜挑一个免费模型要好得多得多。还有67小时后Kimi额度才重置,Fable5用着API的我刷X看到了一个新模型Macaron V1,这也是我第一次看到公开的GLM5.2后训练模型,能一句话直出鹈鹕游戏,主打一个前端能力拉满,还把上下文扩展到了原生2M。

🔗macaron. im/mindlab/research/introducing-macaron-v1接入到Claude Code,加上taste skill之后一把出来的效果也挺能证明这模型UI水平的。待会我发发这个离谱的提示语,专门来测模型UI创意力的。

实测Macaron V1,还真给我GLM5.2调成0.8个Fable5了

Macaron V1这次提出了一个新框架,MoL,说穿了做了一件事,把基座模型整个冻住,一个参数都不动。所有后训练全发生在 LoRA 空间里。用人话说,就是同一个公司共用一套知识库,但客服,项目经理,程序员和设计师,各自保留一颗专业脑袋。MoL想做的,就是让相近的任务互相强化,差得太远的任务各练各的。像聊天需要理解你的语气,记住上下文,还要知道什么时候承认自己错了。Agent要拆任务,调工具,处理意外,原来的路走不通了还得自己拐弯。Coding更死板一点,语法,依赖,测试,终端,一个地方出错整段代码都跑不通。UI又是另一种脑回路,视觉得好看,交互得能用,代码还不能只负责把首屏糊出来。以前这些能力都挤在同一组后训练参数里,很容易优化跷跷板,代码提升来了情商就低了,情商上来了写作就都是幻觉了,所以我至今还怀念GPT5.4。Macaron团队甚至专门做了一个插件来给UI打分,也就是测试AI模型的A2UI(Agent-to-User Interface) 能力,测的就是模型在对话中,除了回复文字外,能不能在合适的地方生成UI组件。

实测Macaron V1,还真给我GLM5.2调成0.8个Fable5了
实测Macaron V1,还真给我GLM5.2调成0.8个Fable5了
实测Macaron V1,还真给我GLM5.2调成0.8个Fable5了
实测Macaron V1,还真给我GLM5.2调成0.8个Fable5了

对于不爱用CLI命令行页面的人,马卡龙也一个Skill,也把问题解决了。也就是说我可以直接看到之前的内容还不用/resume的一次次的开新视窗。相当于一个不用下载可装可关的Desktop App了已经。🔗github. com/mindverse-ltd/macaron-artifacts

纸面实力和新插件都看差不多了,是时候上真实任务了。Kimi K3和Macaron V1都说自己UI好UI妙,那我就好奇了,在同样的任务下的表现会是怎么样。所以我给了一段精简提示词,让V1来个自我介绍,没有额外提供技术栈限制,也没有让skill做场外辅助。

创建一个名为 web_design 的文件夹,并制作一个介绍 Macaron-V1-Venti 模型的交互式网页。
确保该网站达到生产级质量标准,并可直接部署上线。

总共花了十分钟左右,从0开始,一个没啥AI味带模块化设计还有可视化图表的介绍站出现了。

实测Macaron V1,还真给我GLM5.2调成0.8个Fable5了

总的来说,里面带的特效,没有压过文字要表达的信息,还嵌入了加入Agent后的聊天UI对话,这是我在其他模型用一样的提示语还没见过的效果,还挺新颖的。

实测Macaron V1,还真给我GLM5.2调成0.8个Fable5了

也是借由Agent聊天框的想法,让我萌生了实测个Agent聊天室吧的想法。一样是短短的几句Prompt

创建一个名为 chat 的新文件夹,并在网页中展示一个多智能体聊天室。
确保各个智能体能够相互交流,同时我可以随时终止它们的对话。
整体氛围可以像一个“AI 议会”,围绕人工智能的未来展开讨论。

再等个十几分钟,它又又又出了结果

实测Macaron V1,还真给我GLM5.2调成0.8个Fable5了

不同Agent各司其职,有统筹者,有研究员,教育家和工程师也都进入了这个对话让他们开始聊天后,消息源源不绝大家都符合自己人设的疯狂表达。

在每轮对话主题过后还都有总结以及意向在边上让我做参考

实测Macaron V1,还真给我GLM5.2调成0.8个Fable5了

从平时自己在家里跟Fable5斗智斗勇到现在看着Agent们内部间辩论的战火朝天,这也就是三行提示词出来的效果。。。再来再来,身为大模型,会点物理不过分吧,那让V1来做一个物理课教学页面,再考考模型的世界知识。

创建一个名为 gravity 的文件夹,并制作一个名为 Gravity Particle Lab(引力粒子实验室) 的精致单页 HTML 交互体验。
仅使用 HTML、CSS 和原生 JavaScript。所有代码都放在同一个 index.html 文件中,不使用任何外部库或框架。

## 核心概念
在一个大型交互式画布中展示动态粒子系统。画布中设有一个可以移动的引力源,用于吸引或排斥粒子。整体体验应更像一个轻量级的交互式物理实验室,而不是单纯的装饰性背景动画。

## 主要交互
在画布中渲染 100~300 个持续运动的粒子。
在画布中心附近放置一个引力源。
用户可以通过鼠标或触控拖动引力源。
粒子会加速朝引力源移动。
添加可选的排斥模式,将粒子推离引力源。
粒子碰到画布边界时应产生柔和的反弹效果。
限制粒子的最大速度,确保模拟过程保持稳定。
防止粒子被困在引力源内部。
保持动画流畅,并确保运动具有足够的稳定性和可预测性,避免出现失控或不稳定的情况。

从运动轨迹到不同参数导致的反应,都展现的稳定还正确。

因为是大项目的缘故,在没有调用任何Skill的情况下,V1还能在接受后还自己加上了个内测。

实测Macaron V1,还真给我GLM5.2调成0.8个Fable5了

而为了继续测它的 Coding 能力,我又想到了一个看着简单,实际上特别容易出Bug的经典大一作业噩梦:2048。这个游戏大家应该都玩过,页面本身并不复杂,无非就是一个 4×4 的格子,几个数字方块,再加上滑动和合并动画。但真要把它写对,里面的坑一点都不少。比如连续四个2应该合成两个4,而不是直接变成8,同一个方块在一轮移动中只能合并一次,无效移动不能生成新方块,好多好多都是之前其他Agent踩过的坑。所以它表面上是个小游戏,实际上更像是一场状态管理和边界条件考试。我给它的提示语还是很直接:

创建一个名为 2048 的新文件夹,并制作一款功能完整且可以正常游玩的 2048 游戏。
使用自适应的4×4棋盘,并正确实现原版 2048 的全部游戏规则。
支持方向键、WASD 键以及移动端滑动手势。加入流畅的方块移动与合并动画,并提供当前分数、持久化保存的最高分、重新开始、获胜、游戏结束和继续游戏等状态。
需要特别注意方块的合并顺序,防止同一回合重复合并,同时正确处理无效移动、重复输入和响应式适配。
确保所有交互均可正常使用,最终完成的游戏中不得包含占位控件或明显错误。

等它一次性生成结束后,整个游戏已经可以直接玩了。从键盘操作,到数字方块移动和合并的反馈都做得很完整。分数,最高纪录,重新开始,胜利提示和游戏结束状态也都有对应处理。

最后的最后,我一个真正的魔王任务来了。这一次,直接把我们一直在做的AI学习网站,LearnPrompt交给它,现在重构之后长这样,

实测Macaron V1,还真给我GLM5.2调成0.8个Fable5了

让它把原本偏内容型的学习页面,重新做成一个具有3D特效,可交互,还能清楚解释课程体系的展示网站。同时,我也允许它根据需要自行调用合适的 Skills。接到任务之后,V1没有说直接套一个常见的科技网站模板,是先读取了现有内容和项目规则,随后主动选择了Taste Skill,把它作为视觉与交互设计上的参考规范。最终生成的结果,就是刚刚我发的第一个case,提示语也就是,

说实话,整体完成度比我预期中高不少,莫名有种我学习之前还可以看一个过场动画的感觉。它使用了大量展开,收缩,切换和空间层级变化,把原本比较平面的学习内容重新组织成可以探索的页面。不同内容之间不是简单地一段接一段往下堆,是通过交互和动画逐步呈现,让我在查看页面时有一种进入课程地图、逐层了解内容的过度感。

实测Macaron V1,还真给我GLM5.2调成0.8个Fable5了
实测Macaron V1,还真给我GLM5.2调成0.8个Fable5了

OK啊,就测到这儿,聊点技术的,Macaron V1的2M上下文是怎么做到的,直接让glm5.2上下文翻了一倍。他们发了个叫LongStraw的训练方法。现在强化学习训练有个硬墙,大概卡在256Ktoken。模型学习的时候要同时记住刚才算了什么,反复比较好几个答案哪个更好,再把经验攒起来一起更新。这三件事同时干的话,上下文再长一点显卡内存根本扛不住。LongStraw的核心想法其实挺直觉的,一道题的题目大家都一样对吧,那题目只读一次,存个快照,后面只重播做题的过程。省下来的内存全拿去撑更长的上下文。实际效果上8 张H20上就把27B模型训到了 2.1M token,32 张H20上,GLM-5.2这种78层256路MoE的满血大模型也跑通了2.1M。还有一个点我觉得有意思但容易被忽略的,他们的训练框架 MindForge 把上线后用的整套 Agent 环境原封不动搬进了训练。路由怎么分发、工具怎么调用、内存怎么排,训练和上线完全一样。这也解决了一个老问题,训练环境和真实环境不一样导致模型上线就拉胯。再说个更骚的,他们搞了个递归自我改进的闭环。模型自己出题,自己做,做完审计轨迹,改进harness配置,再拿优化后的数据更新自己。更新完的模型又能出更难的题。这个循环能一直转下去。左脚踩右脚起飞了属于是。从benchmark上看,Venti在大部分赛道上跟Opus 4.8、GPT5.5、Gemini 3.1 Pro打得有来有回,同时还是开放权重可以自己部署的。而且他们部署的GLM-5.2推理速度比智谱还快,这个我自己体感也对得上。

实测Macaron V1,还真给我GLM5.2调成0.8个Fable5了

问题是现在按 API 调用收费,跑多了钱包扛不住。我直接在线催更,Mint Coding Plan 什么时候出?出了我就是一个订订订。

@ 作者 / 卡尔 & yc星辰


© 版权声明

相关文章