国产 AI 公司最近流行一件事:把自家最好用的那个东西直接开源出去。
9 月 18 日,MiniMax 宣布把 MiniMax Code CLI 的 v0.4.12 版本面向全球开发者开放,并以 MIT 协议正式开源。它是 MiniMax Code 客户端的核心组件,源码放在 GitHub 的 MiniMax-AI/minimax-code 仓库里。
官方给的理由很直白:希望通过优秀的 harness 设计持续释放模型能力、缩短任务等待时间;同时让开发者能够审视工具调用和权限处理是怎么做的,从而构建可靠的企业级应用,也让社区参与发现问题、贡献修复。
一句话概括这次动作的姿态:把代码摊开,欢迎你来挑毛病。
先看它开源了什么
MiniMax Code 是一套跑在终端里的编程 Agent,CLI 是它的核心组件。开源后,安装和源码入口都是公开的:
# 安装
curl -fsSL https://filecdn.minimax.chat/public/install.sh | bash
源码在 GitHub 的 MiniMax-AI/minimax-code,客户端另外提供一个下载入口。协议是 MIT——意味着商用、修改、再发布都基本没有额外约束,这也是它能被企业直接纳入内部工具链的前提。
值得注意的是,MiniMax 特别强调了”审视工具调用和权限处理”这件事。这不是随口一说:就在这个月,AI 编程工具出事基本都出在这两块。先是 恶意 Git 仓库一举攻破 7 款 AI 编程工具,接着有 Claude Code 把 Bash 沙箱收紧到单条命令粒度 的动作。当 Agent 直接握着你的终端权限时,”它到底能干什么”已经从技术细节变成了采购问题。
那组数字该怎么读
官方给出的成绩是:在 FrontierHarness Eval 评测中取得 76.7% 的任务通过率,成功任务耗时中位数为 4 分 33 秒,两项指标均优于报告所列公开基线,同时 token 消耗量位列第二低。
数字好看,但更值得表扬的是 MiniMax 在备注里主动交代了评测口径。这份备注信息量很大:
- 这是第三方评测,评测结果挂在公开仓库的 PR 里,运行轨迹和适配配置也一并公开(PR #13 结果、PR #14 适配配置、可下载的执行轨迹压缩包);
- 本轮评的是 MiniMax Code 0.3.2 搭配 Kimi K3,并不是刚开源的 0.4.12 版本;
- 一共 30 道任务,其中 23 道通过、4 道未通过、3 道超时未评分,通过率是按全部 30 道计算的;
- 供应商、checkpoint 方式以及部分任务的时限口径,都与公开基线存在差异;
- 所以官方明确写了:仅作数值比较,不代表官方榜单排名。
这几行字的含金量,比 76.7% 本身高。
我见过太多”跑分第一”的模型或工具稿,发布时只报分数、不报条件,读者拿到手一跑发现差距巨大,最后反噬的是品牌信任。主动标注”我们评的不是这个版本、任务时限和基线不一样、超时也算在分母里”,说明这家公司清楚自己的数字在什么条件下成立。对准备做技术选型的团队来说,这种透明度比多 3 个百分点更有决策价值。
“harness” 到底是什么
这是理解这类工具的关键概念,也是很多人容易忽略的一层。
模型能力只是原料。你让 Agent 去”把这个项目的测试跑通”,中间还隔着一整套脚手架:怎么把工具描述喂给模型、上下文塞满了怎么压缩、一次工具调用失败后怎么重试、哪些命令需要人工确认、改完代码怎么回滚、多个子任务怎么排队。这一层就是 harness。
同一天发布的消息里,Cognition 的 SWE-2 拿成本和步数做卖点,AWS 的 Pizza Bot 直接用了 DeepAgents + LangGraph 当骨架——大家都在同一层较劲。因为事实已经证明:同一个模型配不同的 harness,任务完成率可以差出十几个百分点。MiniMax 说”好的 harness 设计能释放更多模型能力”,说的就是这件事。
上手建议
如果你打算试,建议按这个顺序来:
第一步,先在你的沙箱仓库里跑,不要上生产代码。 用 curl 装完之后,拿一个能随时丢掉的小项目当实验场。
第二步,先看它的权限模型,再让它干活。 重点确认三件事:哪些命令默认免确认、哪些会弹人工审批、工具权限能不能按项目粒度配置。这套东西决定了你后续敢不敢放开手。
第三步,跑一次真实的多文件重构。 单文件改 bug 体现不出 harness 差距,至少要一个跨 3 个以上文件、需要跑测试验证的任务,才看得出它的上下文管理和回滚能力。
第四步,对比它的失败方式。 比起看它跑成什么,更该看它跑砸时是怎么砸的——是安静地留下半成品,还是明确报告失败并回滚。这一步决定你能不能把它放进自动化流水线。
优缺点与适合人群
优点:MIT 协议、源码可审、权限与工具调用逻辑摊开可查;自带一组口径透明的第三方评测数据;对国内团队而言,中文文档和网络可达性都友好。
缺点:刚开源,社区生态和第三方插件远不如 Claude Code、Codex CLI 成熟;评测里没有覆盖”和主流 harness 在同一条件下的正面对比”,76.7% 这个数字目前只能自己横向对照;版本迭代快,文档可能跟不上。
适合人群:需要把编程 Agent 嵌进内部平台、且对权限可审计有硬要求的企业团队;用国产模型做主力、想要一个可改的 harness 骨架的开发者;以及单纯想读一份真实工业级 Agent 脚手架源码的学习者。
替代方案:要开箱成熟度选 Claude Code 或 Codex CLI;要 IDE 一体化选 Cursor;要在国产模型上跑多协议接入,可以看 Kimi 原生兼容 Codex 和 Claude Code 的做法。如果你的痛点只是”订阅成本失控”,那更该先看 Claude Code 的沙箱与 Copilot 的成本三档 那套思路——省钱的杠杆常常在 harness 的上下文管理里,而不是在换个模型上。
老达点评
这件事真正有意思的地方,不在于 MiniMax 开源了一个 CLI,而在于”harness 层”第一次被当作可以公开竞争的资产。
过去一年,大家比的是模型分数。但从 9 月开始,先有人把回归测试和成本摆上台面,现在有人把整层脚手架交给社区审阅。这说明市场已经意识到:模型能力的差距在收窄,真正决定 Agent 好不好用的,是模型外面那一圈工程细节。
对普通开发者的实际意义是:你现在可以读源码了。以前遇到 Agent”自作主张”,你只能猜它内部发生了什么;现在至少有了一份可以对照的实现参考。哪怕你最终不用 MiniMax Code,把它的权限模型和上下文压缩策略读一遍,对理解自己手头那套工具的脾气也很有帮助。
想继续跟进这条线,可以订阅 AI 编程工具专题 和 AI 工具评测专题,后面这类”开源 harness”的动静只会更多。