Model CoordinateNext

找到最适合你任务的 AI 模型

结合真实任务评测、公开 Benchmark、成本和速度, 帮助开发者与团队做出有证据的模型选择。

公开数据不修改原分数 · 原创评测披露协议与证据 · 推荐说明适用条件

02 · Evidence, not vibes

评测负责证明,任务页面负责帮你选择

模型坐标评测与第三方公开数据分开标注。当前先展示已经完成的中文原创样本,不伪造尚未运行的灯塔 Benchmark。

模型坐标评测已发布 · 2026-07-22

Chinese culture / structured output

命理年度详解

让不同模型解读同一份匿名年度命理样本,比较中文表达、命理依据、现实信号、行动建议与结构化输出稳定性。

匿名样本
1
模型结果
15
AI 复评分
15
专题最高分
94
本专题领先GLM-5V-Turbo、DeepSeek-V4-Flash、GPT-5.6 Terra (max)hy3-preview · 2 轮匿名评分

这是单一匿名固定样本,不代表模型在所有命理任务上的平均水平。

查看协议、完整结果和原始证据 →
01对象精确

结果落到 Model Variant、推理档位、Provider/Harness 和测试日期。

02原生指标

完成率、质量、成本和速度分别呈现,不平均成全站总分。

03证据可查

Prompt、输出、Trace、测试规则、Judge 与限制都能被复核。

04允许无答案

差异小于波动或数据不可比时,不为了排行榜制造唯一冠军。

03 · Decision previews

先给明确判断,再把依据展开

这些是基于现有公开数据的编辑判断,不冒充本站自测。证据日期、置信度和限制都保留在详情页。

01 · Claude Code Model Guide置信度 高

Claude Code 哪个模型最好

只看当前公开 Agent 成绩,Claude Code 的能力首选是 Fable 5(max);日常开发优先 Sonnet,遇到疑难调试和跨模块重构再切 Opus。

这是本站基于公开 Coding Agent 快照与 Anthropic 模型选择说明给出的编辑判断,不是本站自测。Fable 5(max)当前指数 59.2,成本约 11.72 美元/任务;Sonnet 更适合作为日常默认档。

02 · Cursor Model Guide置信度 高

Cursor 用什么模型

不想研究模型时直接用 Cursor Auto;复杂 Agent 任务按当前公开 Cursor CLI 快照首选 GPT-5.5(medium),预算优先选 Composer 2.5。

这是本站基于 Cursor 官方选择说明和同 Harness 公开快照给出的编辑判断,不是本站自测。当前快照中 GPT-5.5(medium)指数 42.8;Composer 2.5 指数 33.9、约 0.08 美元/任务。

03 · Chinese Coding Models置信度 高

国产模型 Coding 能力排行

当前国产 Coding 综合首选 Kimi K3;预算敏感选 DeepSeek V4 Pro;需要开放生态和私有部署时优先看 Qwen Coder 系列。

这是本站基于公开数据的场景化判断,不是本站自测。当前 Agent 快照中 Kimi K3 指数 56.8;同在 Claude Code Harness 下,DeepSeek V4 Pro(high)约 0.27 美元/任务。

Recommendation contract

首选模型 + 适用条件 + 关键证据 + 主要代价 + 替代方案 + 失效条件

05 · Model records

模尼斯记录

有趣负责传播,协议负责可信。趣味测试独立标注,不替代严肃任务评测。

Record 01已发布

神棍指数:命理年度详解

哪个模型更像一位克制、讲依据、能给出现实建议的传统大师?

Record 02待立项

中文互联网理解

模型能否真正理解中文网络语境、隐喻、反讽和时代梗?

正在设计任务与评分锚点协议未发布
Record 03待立项

小说人格保持

长篇互动中,哪个模型最能保持人物设定、语气与关系连续性?

正在设计长上下文样本协议未发布

Build the evidence with us

没找到你的任务?

告诉我们下一项应该测什么、为什么值得测,以及什么结果才算完成。

提交测试任务 →