2026.07.17 · VENDOR-REPORTED

OPEN FRONTIER INTELLIGENCE

Kimi K3性能坐标系

把发布会上的 35 项 benchmark 拆成可检索、可比较、可追溯的数据界面。 不混合求平均,也不隐藏评测口径。

!

当前数据属于 Kimi 厂商披露。完整模型权重计划于 2026.07.27 发布,技术报告尚未公开。

VISIONAGENTICREASONINGCODING25TOP 2 / 35
2.8T总参数
1M上下文
16/896激活专家

THE RELEASE IN 60 SECONDS

四个维度,一张全景图

“前二”仅表示在官方对比表中的单项名次,不是跨指标综合分。

INTERACTIVE BENCHMARK MATRIX

逐项比较,不做失真平均

35BENCHMARKS
IN VIEW
DOMAIN
MODELS

READING THE SIGNAL

优势很具体,边界也很清楚

差值只在同一个 benchmark 内计算;Elo 与普通分数不交叉比较。

OUTRIGHT LEADS · 7

领先项目

智能体自动化与文档理解,是 K3 最明确的相对优势区。

Program Bench77.8SWE Marathon42BrowseComp91.2DeepSearchQA95Automation Bench30.8
WITHIN 1.0 POINT

贴近前沿

终端、科学问答和多模态推理中,多项结果与榜首差距不足 1 分。

Terminal Bench 2.10.5MCP Atlas0.5GPQA-Diamond0.6MathVision w/ python0.8
LARGEST SCORE GAPS

仍待追赶

高难知识与部分视觉任务仍有清晰缺口,这是产品选型时的重要边界。

HLE-Full9.8HLE-Full w/ tools7.0Office QA Pro6.6

UNDER THE HOOD

2.8T 规模背后的四个支点

K3 把注意力效率、跨层信息流和超稀疏 MoE 组合到同一个 3T 级系统中。 这些结构解释了它为何面向长程 coding、知识工作和原生视觉。

01

Kimi Delta Attention

为百万级上下文提供更高效的注意力基础,并引入面向 KDA 的 prefill cache。

02

Attention Residuals

跨深度选择性检索表示,替代对所有历史层的均匀累积。

03

Stable LatentMoE

896 个专家中仅激活 16 个,在扩大模型容量的同时控制推理成本。

04

Native Vision

在同一模型中理解文本、图像与视频,为视觉闭环工程任务提供基础。

METHODOLOGY & LIMITS

读懂分数之前,先读懂脚注

SOURCE AUDITED
2026.07.17
01

不是统一 harness

评测混用 KimiCode、Claude Code、Codex 与 Terminus 2;部分对手取最佳 harness。

02

推理强度不同

K3 采用 max、temperature 1.0、top-p 1.0;GPT 5.5 使用 xhigh。

03

Fallback 会影响结果

Fable 5 的部分轨迹可能因策略拒答回退至 Opus 4.8。

04

内部榜单不可复现

KCB 2.0、DECK-Bench 与 PerceptionBench 缺少完整公开方法。

05

缺失不等于零分

破折号统一呈现为“未披露”,不参与名次和统计。

06

异构指标不求平均

Elo、F1、pass@5 与普通 score 仅在各自 benchmark 内排序。

PRIMARY SOURCEKimi K3 官方发布页与完整 Benchmark Table访问日期:2026-07-17
OPEN SOURCE ↗

FROM BENCHMARK TO DECISION

数据给出坐标,
场景决定答案。

在 Kimi.com、Kimi Work、Kimi Code 与 API 中体验 K3。