本站判断 · 基于公开证据
按当前公开综合智能快照,国产模型第一名是 Kimi K3;低成本调用优先 DeepSeek V4 Flash,开放生态与私有部署优先 Qwen。
这是本站按场景解释公开数据后的结论,不是自创总分。Kimi K3 当前 Intelligence Index 为 57;Qwen3.7 Max 为 46;DeepSeek V4 Flash 更适合成本优先的使用方式。
判断置信度:高页面更新:2026-07-23证据快照:2026-07-21
DECISION SHORTLIST
不同场景直接选谁
先给默认选择,再说明在哪些条件下应该换模型。
Kimi K3
当前统一 Intelligence Index 快照中的国产第一名,也是国产 Coding Agent 的领先条目。
DeepSeek V4 Flash
适合高频调用和成本敏感场景;复杂任务还要观察重试与返工后的总成本。
Qwen3.7 Max / Qwen 系列
优先用于需要阿里生态、开放模型选项和私有部署路线的团队。
PUBLIC EVIDENCE
结论依据什么
不同指标保持原单位,不合成为本站自定义总分。
中文模型至少要看四张榜
一张总榜会掩盖任务差异。更可靠的入口是综合能力、中文表达、Coding 和成本性能四个并列视角。
- 综合能力:公开 Intelligence Index
- 中文体验:固定中文任务输出
- 软件工程:Coding Index 与 Agent 数据
- 商业使用:价格、速度与 Provider
国产模型不等于中文模型
国产模型描述机构和生态来源,中文模型描述使用能力。海外模型也可能有很强的中文表现,国产模型也需要按具体版本验证中文任务。两者可以交叉筛选,但不能混为一个标签。
FAQ
常见问题
中文大模型第一名是谁?
按本站当前引用的统一综合智能快照,国产第一名是 Kimi K3。换成写作、Coding、价格或私有部署任务,首选会变化。
为什么不做一个中文综合总分?
不同来源指标的样本、单位和权重不同。强行合并会变成本站自创评估体系,降低可解释性。
国产模型应该从哪里开始看?
先看中国模型分析,再进入国产 Coding、中文测评和具体模型详情核对版本。
本页路径:/rankings/chinese-llm/。模型和工具版本会变化,引用结论时请同时保留页面更新时间与原始来源。