最近又把 Kimi K2 拉回来用了一周,重点跑了三个我最常让 AI 干的活:长文档总结、Python 代码生成、联网搜索写稿。下面是真实的体感,附上和老达常用的几个国产/海外模型横评。
为什么又回头测 Kimi
Kimi K2(Moonshot AI)已经发布大半年了,主打开源、MoE 架构、长文本友好。之前测试时它在中文长文档这块确实稳,但代码和工具调用能力偏弱。这半年 K2 陆陆续续更新了几个版本,最近一次版本号更新是上周,索性重新跑一遍。
这次的目标很直接:
- 10 万字的中文 PDF 摘要,能不能保留结构和关键数据
- 写一个中等复杂度的 Python 脚本(带异常处理和单元测试),一次能不能过
- 联网搜近一周的行业新闻,引用源链和时效性够不够用
长文档总结:依然能打
测试用了一份 11.8 万字的行业研究报告 PDF,丢给 Kimi K2 让它”按章节摘要,保留所有数字”。
结果:
- 全文按 7 个章节切分,每个章节 300-500 字摘要,没遗漏关键数字
- 引用原文时定位准确,给到章节标题和页码附近的内容
- 上下文窗口确实够大,不存在”后半段信息丢失”的情况
跟之前的 Kimi 长文本实测:100 万上下文窗口到底有多实用 那篇结论一致,Kimi 在长文本这条线上是国产模型里最稳的之一。
跟 DeepSeek V3 比,V3 在中文长 PDF 上偶尔会出现”后半段开始编”的幻觉;K2 这块没翻车。
代码生成:追上 DeepSeek V3
测试场景:写一个抓取 CSV → 数据清洗 → 写 SQLite → 异常重试的脚本,要求带单元测试。
K2 一次出稿的版本:
- 主流程逻辑正确,重试机制用了指数退避(这点比预想好)
- 单元测试覆盖率约 60%,漏了边界值的 case
- 注释是中文的,可读性 OK
- 跑起来一次过,没报语法错误
跟 DeepSeek V3 比:V3 在这块依然略胜,特别是单元测试补全和边界条件处理。Claude Sonnet 4 写出来最干净,但贵。
参考老达之前写的 AI 编程接口联调怎么做?让 Cursor、Claude Code、Codex 少改错 API,代码模型选型的核心不是”谁最强”,而是”谁最稳不返工”。K2 在这个标准下是合格的。
联网搜索:能用,但不稳
测试场景:搜”近一周国产大模型新版本”,要求给 5 条带源链的整理。
K2 联网搜索的体感:
- 返回速度偏慢,单次查询 8-12 秒
- 信息时效性还行,能搜到 3 天内的新闻
- 引用源链大部分能点开,但有 1-2 条失效
- 多轮追问时偶尔会”忘记”前文已搜过的内容
跟 Perplexity Sonar 比,Sonar 在时效性和源链质量上明显更好,但中文新闻覆盖比 K2 弱。
跟 DeepSeek V4 Flash 正式版上线,AI API 价格战全面开打 里提到的 DeepSeek V4 Flash 比,Flash 的联网更”工具化”,K2 更像”顺手问一句”。
Kimi K2 适合谁用
适合:
- 中文长文档(合同、研究报告、论文)重度用户
- 预算有限、要本地部署或 API 调用的开发者
- 中等复杂度 Python/JS 脚本生成的日常使用
不太适合:
- 联网搜索重度的新闻/调研工作流(用 Perplexity 或 Sonar 更合适)
- 大型项目级代码工程(仍然推荐 Claude Code 或 Codex)
- 需要极低延迟实时对话的场景
老达点评
Kimi K2 不是那种”突然炸场”的模型,但它在中文长文本这块的护城河依然很稳。
这一年大模型卷价格、卷参数、卷 Agent 能力,Kimi 反而是少见的”先把长文本做扎实”的厂商。如果你日常有大量读 PDF、读论文、读合同的需求,K2 仍然是首选之一,参考 老达AI实践专题。
代码能力这次进步明显,从”能写但要返工”升级到”基本能一次过”,但还没到 Claude Sonnet/Codex 那种”复杂工程也能扛”的水平。国产模型对比可以看 DeepSeek专题。
一句话结论:把 Kimi K2 当作”中文长文本主力 + 代码辅助”的双工具组合,比单纯压一个模型更稳。
最后提一句,Kimi 的入口现在 web、App、API 都通,K2 系列在 月之暗面 Moonshot 平台 可以直接开。免费额度对个人用户足够,重度使用再上 API。