封面提示词:Poster. Illustration. beautiful young redhead pale freckled skin woman sassy, expressive face. intricate dramatic background. drinking soda --chaos 30 --ar 16:9 --exp 30 --raw --sref 2116795492 --profile lbffree --hd --preview

上周精选✦

Kimi K3 发布以及相关的讨论和测评

上次最大的发布居然是 Kimi K3,没想到它会这么爆,基本上所有的讨论都围绕在这块。包括海外、包括美国的一些厂商,也开始反思自己的政策之类。

我自己的测试、他们自己的测试标准以及各种三方的标准来看,这个模型确实是非常强的一个模型,跟 Claude Opus 4.8 打个平手是一点问题没有的。

Kimi K3 是一个 2.8 万亿参数的模型,基于 KDA 混合线性注意力和注意力残差技术构建,原生支持视觉理解,拥有 100 万 token 上下文窗口。它是全球首个开源的 3 万亿级别模型,主要面向长程编程、知识工作和推理等场景。

架构上,K3 结合 KDA、注意力残差和 Stable LatentMoE,可在 896 个专家中激活 16 个,扩展效率相比 K2 提升约 2.5 倍,并采用量化感知训练适配更广泛硬件。

完整的模型权重文件将在 7 月 27 日前开源发布。

发布前那天晚上我跟大家说,尽快买他们的 Token Plan,没想到确实太猛了。到昨天果然就已经限购了,没卡了

看起来他们还准备了一个新的 Token Plan 计划,但是由于估计是没卡了,也没有真正放出来,只放出来一小段,后来也买不了。
An image to describe post

不止他们自己的测试基准上分数很高,在各种三方基准上也都几乎屠榜了

在 Arena.ai(前身 LMArena)的 Frontend Code Arena 前端代码竞技场里,Kimi K3 以 1679 分登顶第一,超过了 Claude Fable 5,并且比上一代 Kimi-K2.6 一口气跳升了 17 个名次(从第 18 名到第 1 名)。这个测试考的是模型写前端代码、生成网页界面的能力。

在 Artificial Analysis 的 Intelligence Index 综合智能指数上,Kimi K3 相比 K2.6 提升了 13 分,是一个很大的跳跃,但代价是成本涨了约三倍。具体来说,它每项任务的成本约 0.94 美元,大概是 Claude Opus 4.8(最大推理档,1.80 美元)的一半,和 GPT-5.6 Sol(最大档,1.04 美元)差不多,但已经是 K2.6(0.33 美元)和 Grok 4.5(0.31 美元)的约三倍。

在 Datacurve 的 DeepSWE 上,Kimi K3 首次亮相就排到第 3 名,成绩接近 Claude Fable 和 GPT-5.6 Sol,是第一个达到前沿级水平的开源权重模型。DeepSWE 考的是软件工程能力,也就是模型作为编码 agent 去理解代码库、修复真实工程问题的本事,侧重于端到端的实际开发任务而非单点写代码。DeepSWE 还是闭源的所以不存在刷榜的问题。

在 AfterQuery 的 SpreadsheetBench 2 上,Kimi K3 排名第一,超过了 Claude Fable 5,成为第一个在该榜上压过所有闭源模型的开源权重模型。

在 Sam Paech 维护的创意写作基准上,Kimi K3 也被加入并领先,与 gpt-5.6、muse-spark-1.1 以及 Thinking Machines 的首个模型 Inkling 同台。这个测试考的是文学性、创意表达和写作质量。不过有个值得注意的细节:K3 在短篇创意写作上大幅领先,但在长篇版本上明显逊色于 Fable 5。

在 Aikido Security(pilvar222)的网络安全基准上,Kimi K3 是目前最强的开源模型,远超 GLM-5.2,性能与 GPT-5.6-terra 相当但成本低约 15%。在 pass@3(允许三次尝试)的设定下,它能在测试框架里重新发现 26 个 CVE 中的 23 个,与前沿模型持平。

An image to describe post

关于时间线上的讨论,除了关于 Kimi(Kimi v3)的一些能力以外,很多美国 AI 从业者和企业家的反思主要集中在两方面:

第一,为什么杨植麟在美国上学,最后却选择回到中国?为什么美国没有留下这样的人才?

第二,OpenAI 的战略分析负责人写了一篇关于 Kimi 的观察(他刚加入 OpenAI 不到两周)。他首先肯定了 Kimi 是一个非常优秀的模型。

接着,他的文章引发了关于“中国模型只是蒸馏美国前沿模型”这一长久论断的反思。他指出,现在不能简单地用“蒸馏”来解释中国模型的崛起。

不过,他文章中比较有争议的观点是关于开源模型的权重。他认为,如果开源模型主导世界,会导致其他国家把 AI 当作免费的公共基础设施提供,他将这种未来形容为“反乌托邦未来”。因此,他呼吁政府和监管机构发布软性法律和安全警示,让美国企业不敢使用中国的开源模型,从而将这些竞争对手清除出美国市场。

这个论点引来了大量的批评和反驳:

  1. 很多人指出,将开源视为“减速主义”的论断非常武断,而且缺乏逻辑。
  2. 另一波人则讽刺他“屁股决定脑袋”——刚进 OpenAI 就急着帮公司说话。

后来,他自己出来做了两轮澄清和反思:

  1. 他表示没意识到自己作为一个前沿实验室的员工,言论会被过度解释和引申。
  2. 他承认自己用词不够精确,并为此道歉,表示不应该把开源模型称为“减速主义”

An image to describe post