Chinese LLM Ranking

中文大模型排行榜

从公开综合能力、中文固定样本、Coding、成本和速度多个视角比较中文大模型,不把不同评测单位合成为本站总分。

数据快照:2026-07-23

本站判断 · 基于公开证据

按当前公开综合智能快照,国产模型第一名是 Kimi K3;低成本调用优先 DeepSeek V4 Flash,开放生态与私有部署优先 Qwen。

这是本站按场景解释公开数据后的结论,不是自创总分。Kimi K3 当前 Intelligence Index 为 57;Qwen3.7 Max 为 46;DeepSeek V4 Flash 更适合成本优先的使用方式。

判断置信度:高页面更新:2026-07-23证据快照:2026-07-21

DECISION SHORTLIST

不同场景直接选谁

先给默认选择,再说明在哪些条件下应该换模型。

国产综合能力

Kimi K3

当前统一 Intelligence Index 快照中的国产第一名,也是国产 Coding Agent 的领先条目。

低成本 API

DeepSeek V4 Flash

适合高频调用和成本敏感场景;复杂任务还要观察重试与返工后的总成本。

开放生态 / 部署

Qwen3.7 Max / Qwen 系列

优先用于需要阿里生态、开放模型选项和私有部署路线的团队。

PUBLIC EVIDENCE

结论依据什么

不同指标保持原单位,不合成为本站自定义总分。

01

公开智能指数

比较不同国家和机构模型的综合能力,但保留原始来源口径。

模型排行榜
02

中文固定样本

补充通用英文 Benchmark 难以反映的中文表达与产品阅读体验。

中文测评
03

国家与机构视角

单独查看中国机构模型及其在统一智能指数中的位置。

中国模型分析

中文模型至少要看四张榜

一张总榜会掩盖任务差异。更可靠的入口是综合能力、中文表达、Coding 和成本性能四个并列视角。

  • 综合能力:公开 Intelligence Index
  • 中文体验:固定中文任务输出
  • 软件工程:Coding Index 与 Agent 数据
  • 商业使用:价格、速度与 Provider

国产模型不等于中文模型

国产模型描述机构和生态来源,中文模型描述使用能力。海外模型也可能有很强的中文表现,国产模型也需要按具体版本验证中文任务。两者可以交叉筛选,但不能混为一个标签。

FAQ

常见问题

中文大模型第一名是谁?

按本站当前引用的统一综合智能快照,国产第一名是 Kimi K3。换成写作、Coding、价格或私有部署任务,首选会变化。

为什么不做一个中文综合总分?

不同来源指标的样本、单位和权重不同。强行合并会变成本站自创评估体系,降低可解释性。

国产模型应该从哪里开始看?

先看中国模型分析,再进入国产 Coding、中文测评和具体模型详情核对版本。

本页路径:/rankings/chinese-llm/。模型和工具版本会变化,引用结论时请同时保留页面更新时间与原始来源。