Kimi K3、GLM-5.2杀进前列:国产模型该不该换成主力?
国产大模型已经进入全球第一梯队。与其跟着榜单频繁换工具,不如用自己的真实任务做一次三天换模测试。
最近,Kimi K3 和 GLM-5.2 接连冲进多个大模型榜单前列。
更有意思的是,美联社采访到一位 Mozilla 高管:他先用 GLM-5.2 处理日历、文档和邮件,Kimi K3 发布后,又把不少日常工作切了过去。
很多人的问题也随之变成:国产大模型已经这么强了,我们还要不要继续花钱用国外模型?
我的答案是:
值得把国产大模型升为主力之一,但暂时没必要只留一个模型。
真正需要换掉的,是“一个模型包打天下”的用法。
01
这次不是单纯的国产榜单自嗨
截至 7 月 30 日,在 Arena 的 React 开发榜上,Kimi K3 暂列第 2,GLM-5.2 排第 6;在考察工具调用和任务完成的 Agent 榜上,两者分别排第 3 和第 4。
另一家独立评测机构 Artificial Analysis 给出的结果也很有代表性:Kimi K3 的综合能力指数更高,GLM-5.2 的输出速度更快、平均使用成本更低。两者都支持大约 100 万 token 的上下文,可以一次处理很长的资料。
这说明国产模型已经不只是“价格便宜、中文好用”的替代品,而是开始在复杂任务中进入第一梯队。
不过,榜单会变,测试环境也不等于你的工作。
某个模型擅长生成 React 页面,不代表它一定更会写你的公众号;Agent 排名靠前,也不等于它在你常用的软件里就能稳定完成任务。

02
“要不要换”的答案,取决于你拿它做什么
如果你经常做复杂研究、前端页面、图文和视频理解,或者需要 AI 连续调用工具完成多步任务,Kimi K3 值得优先测试。它在前端与 Agent 榜单上的表现更突出,原生多模态也让它能同时处理文字、图片和视频。
如果你的任务量很大,更在意响应速度、成本和长文档处理,GLM-5.2 更有吸引力。官方把 1M 上下文和长程任务作为重点,第三方测试中,它的响应速度和平均价格也更占优势。
至于已经用顺手的国外模型,我不会急着全部停掉。
高难度推理、重要代码和对外发布的关键内容,仍然需要一个经过长期使用验证的备份模型。不是因为国产模型一定做不好,而是重要任务不适合在没有对照测试的情况下直接迁移。

03
别靠感觉换模型,做一次“三天换模测试”
挑出自己最近真实做过的 10 个任务。
最好包括:
- 3 个写作任务,例如列提纲、改写和长文总结;
- 3 个分析任务,例如查资料、做比较和整理表格;
- 3 个执行任务,例如写代码、制作演示或调用工具;
- 1 个你已经知道正确答案的难题。
把相同的资料、提示词和交付格式,分别交给你现在的主力模型、Kimi K3 和 GLM-5.2。
不要问“哪个回答看起来更厉害”,只记五项:
- 结论是否正确;
- 任务有没有做完整;
- 修改几次才能交付;
- 等了多久;
- 实际花了多少钱。
如果国产模型在大部分日常任务上已经能直接交付,速度和费用又更合适,就把这些任务迁过去。剩下少数高难度任务,继续保留原来的模型。

04
以后更实用的方式,是给模型分工
过去,我们习惯讨论“哪个大模型最强”。这个问题越来越像在问:电脑里只能装一个软件,你选哪个?
现实工作并不需要这样的单选题。
写文章可以用一个模型,长资料和批量任务可以用另一个,关键结果再交给第三个复核。只要文件、提示词和验收标准能够迁移,换模型就不再是一场搬家。
因此,我对 Kimi K3 和 GLM-5.2 的判断并不是“国产模型已经全面取代国外模型”,而是:
国产模型已经到了应该被认真测试的阶段,而不是只在发布会和榜单里围观的阶段。
先迁移一个每周都会重复的工作流,跑三天,看结果。
如果它真的更快、更省,而且交付质量没有下降,就让数据替你完成这次换模决定。
资料来源
本文长期归档于 williamzh.com,并同步发布在微信公众号「Lian哥聊钱与AI」。
文中不构成任何投资建议。转载请注明作者与出处。