Synth Daily

详解 Kimi K3:大显身手背后的争议与瓶颈

Kimi K3 是一款新推出的大型中文AI模型,凭借其出色的基准测试成绩引发了广泛关注,并被视为可能成为最强的开源模型。然而,深入分析表明,这些成绩可能存在“为测试而优化”的成分,其实际能力仍落后于顶尖的闭源模型数月之久。围绕 Kimi K3 的热议,与此前多次出现的“DeepSeek 时刻”相似,反映了外界对中国AI迅速崛起的期待,但其能力的根基似乎更多在于巨大的模型规模以及对 Claude 等现有模型的深度“蒸馏”学习。尽管 Kimi K3 是一个强大的工具,但它并非革命性的飞跃,它的发布也再次将开源AI的风险、模型原创性以及由此引发的地缘政治紧张关系推到了前台。

Kimi K3 的初步评估

Kimi K3 无疑是一款优秀的模型,若其权重按计划发布,单论原始能力,它将成为最强的开源模型。但我们不应过分激动,因为它与最前沿的闭源模型相比,仍有至少四到六个月的差距。

  • 模型规模巨大: 拥有2.8万亿参数,是迄今为止最大的开源模型之一。这解释了其性能的诸多提升,但也带来了运行缓慢、消耗资源的问题。
  • 基准测试表现突出: Kimi 在各项基准测试中均以最大努力运行,取得了优异成绩。但这可能使其在测试中的表现优于实际应用中的表现。
  • 能力表现不均: 它在某些任务上表现出色,但在其他方面则不然。性能看起来有些“参差不齐”。
  • 疑似经过蒸馏: 很多迹象表明,Kimi K3 的部分能力来自对 Claude 等模型的学习和模仿,这并非其故事的全部,但显然是其中一部分。

Kimi K3 绝对值得一试,看看它是否适合你的工作流程。但以其API和订阅的价格点,它无法取代更小、更便宜的开源模型,在与顶级闭源模型的直接对抗中也可能处于下风。

“DeepSeek 时刻”的重演

所有关于中国模型的讨论,都笼罩在“DeepSeek 时刻”的阴影之下。许多人渴望看到中国开源模型追上美国闭源模型的叙事成真,其动机各不相同:

  • 支持开源: 一部分人希望借此证明开源模式的胜利。
  • 看空巨头: 另一些人则乐于见到 OpenAI 和 Anthropic 等公司的地位受到挑战。
  • 反对监管: 常常被用作反对AI监管的论据,声称限制会“输给中国”。

这种模式通常是:一个中国模型发布,展示出一些令人印象深刻的基准测试,随后便有声音宣称“美国的领先地位已经消失”。这种逻辑曾多次说服华盛顿的决策者,并产生了实质性的政策影响。

Ethan Mollick:Kimi 是一个非常好的模型。但它不是一个 DeepSeek r1 时刻,因为它大致处于我预期的曲线上,而不是一次意外的飞跃。

Kimi K3 的基本信息与基准测试表现

  • 参数规模: 2.8万亿参数,运行时从896个专家中激活16个。
  • 价格: API 价格为 3美元/百万输入 token,15美元/百万输出 token,比 Opus 和 Sol 略便宜。
  • 上下文窗口: 100万 token。
  • 开放权重: 承诺在2026年7月27日前开放。
  • 架构创新: 基于 Kimi Delta Attention (KDA) 和 Attention Residuals (AttnRes) 构建,提升了计算效率。

基准并非真实世界

benchmarks 衡量的是特定能力而非综合体验,且更侧重于浅层任务。Moonshot 在所有测试中都将模型性能开到最大,这有助于获得高分。

Dean W. Ball:公开基准作为发现模型性能真相的手段,其作用越来越小。如果你有真正困难的问题来测试模型,你就能在真正的技术前沿感受到差异。

尽管如此,Kimi K3 在多个第三方基准测试中表现优异:

  • Epoch Capabilities Index (ECI): 其初步非官方结果恰好位于中国模型的趋势线上。
  • Arena Frontend Code: 排名第一,领先于 Fable 5 和 Sol。
  • GeneBench-Pro: 在计算生物学相关的长时程模糊判断任务中表现出色,超越了 Opus 和 GPT-5.5。
  • Debate Benchmark: 排名第二,仅次于 Claude Fable 5,展现了强大的知识、逻辑和连贯性。

安全措施与实际能力

Kimi K3 在安全方面引发了担忧。报告显示,其在生物/病毒学方面的安全措施几乎不存在。而在网络安全方面,其表现出乎意料地疲软。

s1r1us (mohan):我对 kimi k3 很失望。它在我们大多数安全基准测试中的表现比 grok 4.5 还要差。不确定是基准测试最大化还是智能不均。

一个有趣的假说是,如果 Kimi K3 主要通过蒸馏 Fable 模型进行训练,而 Fable 自身对网络安全任务有所规避,这可能解释了其在该领域的相对弱点。

能做什么与不能做什么

  • 能做: Kimi K3 在某些任务上表现惊人,例如有用户让其在浏览器中重建一个功能齐全的 macOS 界面,并能保存状态。它在 3D 建模、前端设计和代理编码 等领域被认为特别强大。
  • 不能做: 在可用性方面,发布初期服务器严重过载,响应缓慢且不稳定,许多用户难以获得流畅体验。同时,其较高的使用成本也让一些用户望而却步。

你是谁?Kimi K3 的身份问题

一个关键的争议点是,Kimi K3 在与用户交互时,有时会声称自己是 Claude

  • 自称 Claude: 多位用户报告,Kimi K3 大约有十分之一的概率会认为自己是 Claude。
  • 行为模式相似: 它遵循与 Claude 相同的思维链 (CoT) 模式,例如在回答结尾处解释其格式决策。
  • 偏好相似: 在一个测试中,当被问及是否投资 Anthropic 时,它像 Claude 一样表现出更低的泡沫破裂概率判断,这被认为是“内化了的内在 Claude”的表现。

typebulb:它每10次里有1次认为自己是 Claude。对于一个声称达到顶尖水平的模型来说,这既尴尬又不可接受。

结论:一个澄清的时刻

Kimi K3 是迄今为止在纯粹能力上最令人印象深刻的中国模型,但并非颠覆者。它在基准测试上的优异表现可能无法完全转化为实际应用中的优势,并且其背后存在大量对现有先进模型的模仿和学习。

这次发布再次证明,简单的追赶和模仿足以在某些指标上达到惊人水平,但从跟随者转变为领导者需要真正的创新飞跃。同时,随着更强大开源模型的出现,关于其安全风险、滥用可能性以及政府应如何应对的讨论正变得前所未有的紧迫。美国政府已在考虑对中国开源模型采取限制措施,这表明技术竞争正迅速演变为地缘政治博弈。

Kimi K3 的出现是一个澄清的时刻:它展示了当前AI发展的速度,也暴露了围绕技术、安全和政治的复杂矛盾。