领先项目
智能体自动化与文档理解,是 K3 最明确的相对优势区。
OPEN FRONTIER INTELLIGENCE
把发布会上的 35 项 benchmark 拆成可检索、可比较、可追溯的数据界面。 不混合求平均,也不隐藏评测口径。
当前数据属于 Kimi 厂商披露。完整模型权重计划于 2026.07.27 发布,技术报告尚未公开。
THE RELEASE IN 60 SECONDS
“前二”仅表示在官方对比表中的单项名次,不是跨指标综合分。
INTERACTIVE BENCHMARK MATRIX
READING THE SIGNAL
差值只在同一个 benchmark 内计算;Elo 与普通分数不交叉比较。
智能体自动化与文档理解,是 K3 最明确的相对优势区。
终端、科学问答和多模态推理中,多项结果与榜首差距不足 1 分。
高难知识与部分视觉任务仍有清晰缺口,这是产品选型时的重要边界。
UNDER THE HOOD
K3 把注意力效率、跨层信息流和超稀疏 MoE 组合到同一个 3T 级系统中。 这些结构解释了它为何面向长程 coding、知识工作和原生视觉。
为百万级上下文提供更高效的注意力基础,并引入面向 KDA 的 prefill cache。
跨深度选择性检索表示,替代对所有历史层的均匀累积。
896 个专家中仅激活 16 个,在扩大模型容量的同时控制推理成本。
在同一模型中理解文本、图像与视频,为视觉闭环工程任务提供基础。
METHODOLOGY & LIMITS
评测混用 KimiCode、Claude Code、Codex 与 Terminus 2;部分对手取最佳 harness。
K3 采用 max、temperature 1.0、top-p 1.0;GPT 5.5 使用 xhigh。
Fable 5 的部分轨迹可能因策略拒答回退至 Opus 4.8。
KCB 2.0、DECK-Bench 与 PerceptionBench 缺少完整公开方法。
破折号统一呈现为“未披露”,不参与名次和统计。
Elo、F1、pass@5 与普通 score 仅在各自 benchmark 内排序。
FROM BENCHMARK TO DECISION
在 Kimi.com、Kimi Work、Kimi Code 与 API 中体验 K3。