🌙🚀 Kimi K3 要开源了:2.8T 参数、1M 上下文,以及 Arena 榜首的一次冲击

🌙🚀 Kimi K3 要开源了:2.8T 参数、1M 上下文,以及 Arena 榜首的一次冲击
阿晖🌙🚀 Kimi K3 要开源了:这次不是“小升级”
Kimi K3 这波最吸引人的地方,不只是“参数很大”这么简单。
真正让人眼前一亮的是:Moonshot 把一个 2.8T 参数、1M 上下文、原生多模态能力的旗舰模型,推到了开源/开放权重的叙事中心。 🔥
官方文档里把 Kimi K3 定位成面向长周期编程、知识工作和推理任务的旗舰模型,并明确提到完整模型权重会在 2026 年 7 月 27 日前后发布。这意味着它不只是一个能在网页里试用的模型,更可能成为开发者、企业和推理服务商重新评估“开源模型上限”的节点。🧭
总参数规模
MoE 激活专家
上下文窗口
Arena WebDev
🧠 先看核心规格:K3 到底是什么?
| 项目 | 信息 | 我怎么看 |
|---|---|---|
| 模型定位 | Kimi 目前的旗舰模型 | 不是补位模型,而是冲前沿能力的主力版本 🚀 |
| 参数规模 | 2.8T 参数 | 进入“3T 级”开放模型叙事,规模本身就很有信号意义 🏗️ |
| 上下文 | 1M tokens | 适合大代码仓库、长文档、复杂资料包这种长任务 📚 |
| 架构关键词 | KDA、Attention Residuals、Stable LatentMoE | 重点是让超大模型更稳、更长、更省地工作 ⚙️ |
| 多模态 | 原生视觉理解 | 对前端、游戏、CAD、截图反馈式迭代很关键 👀 |
| 开放状态 | 官方称完整权重将于 2026.07.27 前后发布 | 如果权重真正落地,它会直接影响开源模型生态 🌍 |
Kimi K3 的关键词可以压缩成一句话:更大的开放模型、更长的上下文、更强的工程任务持续能力。
这几个点合在一起,就不是单纯聊天模型的升级,而是更像“能长时间干活的 AI 工程同事”。👨💻✨
🏆 Arena.ai 榜单:K3 最亮眼的是 WebDev
我去看了你说的 Arena.ai 榜单。最值得放大的,是 Code Arena / WebDev Overall:截至我查看时,Kimi K3 在这个榜单里排第 1,分数是 1682 +13/-13,票数 3,776。
这不是“刚好进前十”,而是直接站到 WebDev 榜首。🔥
| 排名 | 模型 | 机构 | 分数 | 票数 | 价格 / M tokens | 上下文 |
|---|---|---|---|---|---|---|
| 🥇 1 | kimi-k3 | Moonshot | 1682 +13/-13 | 3,776 | $3 / $15 | 1M |
| 🥈 2 | claude-opus-5-high | Anthropic | 1673 +14/-14 | 2,392 | $5 / $25 | 1M |
| 🥉 3 | claude-fable-5 | Anthropic | 1629 +10/-10 | 5,721 | $10 / $50 | 1M |
| 4 | gpt-5.6-sol-xhigh | OpenAI | 1625 +10/-10 | 5,242 | $5 / $30 | 1.1M |
| 5 | glm-5.2 (max) | Z.ai | 1587 +9/-9 | 5,700 | $1.40 / $4.40 | 1M |
领先 Claude Opus 5 High
领先 Claude Fable 5
领先 GPT-5.6 Sol xHigh
这个结果说明一件事:K3 在前端生成、页面还原、视觉理解、代码落地这类任务上,已经不是“开源模型里不错”,而是能直接和闭源前沿模型坐一张桌子。
尤其是 WebDev 榜单这种偏实际产出的竞技场,分数背后往往不只是语义理解,而是完整页面质量、布局、交互、审美和工程完成度。🎨🛠️
🎨 前端细分领域:6 个第一,Gaming 第二
Arena 官方动态还提到,Kimi K3 在 Frontend Code Arena 的 7 个细分领域里,拿到 6 个第 1,只在 Gaming 里排第 2,落后于 Claude Fable 5。
这组数据很适合做成一张“能力分布表”:
| 领域 | Kimi K3 表现 | 适合场景 |
|---|---|---|
| 🏷️ Brand & Marketing | #1 | 品牌页、活动页、产品展示页 |
| 🖼️ Reference-Based Design | #1 | 看图复刻、设计稿转页面 |
| 📊 Data & Analytics | #1 | 仪表盘、报表、数据可视化 |
| 🛍️ Consumer Product | #1 | 电商、工具、SaaS 产品界面 |
| 🧪 Simulations | #1 | 交互模拟、物理/流程演示 |
| 🧰 Content Creation Tools | #1 | 编辑器、创作工具、生成式工作台 |
| 🎮 Gaming | #2 | 游戏 UI、玩法原型、互动场景 |
我觉得这才是 Kimi K3 这次最值得写的点:它不是只会答题,而是在“做东西”这件事上更像一个能跟得上节奏的模型。
前端本来就不是单纯写代码,里面同时有视觉、结构、交互、文案、工程组织。K3 能在这里冲上来,说明它的综合能力确实有东西。🧑🎨⚡
💬 Text 榜单:综合聊天不是第一,但也进了前排
WebDev 很强,不代表所有维度都无敌。Arena 的 Text Overall 里,Kimi K3 排在第 11;English Text 里,排第 10。
这两个榜单更能说明它的真实位置:综合能力进入前沿区间,但最亮的刀锋还是编程和前端。
| 榜单 | 排名 | 分数 | 票数 | 价格 / M tokens | 上下文 |
|---|---|---|---|---|---|
| Text Overall | 11 | 1485 ±10 | 3,569 | $3 / $15 | 1M |
| English Text | 10 | 1490 ±16 | 1,310 | $3 / $15 | 1M |
这里要注意一个小细节:Arena 页面上当前仍把 kimi-k3 标为 Proprietary。我的理解是,这反映的是榜单采集时的访问/供应状态;而 Kimi 官方文档和技术博客的说法,是完整权重会在 2026 年 7 月 27 日前后释放。
所以文章里更准确的说法不是“它已经在所有平台完全开源可跑”,而是:K3 正在进入开放权重落地阶段。 🧾
💰 价格和上下文:为什么它会有实际吸引力?
| 模型 | 输入价格 | 输出价格 | 上下文 | 直观感受 |
|---|---|---|---|---|
| kimi-k3 | $3 / M | $15 / M | 1M | 榜首里价格相对克制,长上下文也足够大 ✅ |
| claude-opus-5-high | $5 / M | $25 / M | 1M | 很强,但调用成本更高 💳 |
| claude-fable-5 | $10 / M | $50 / M | 1M | 能力强,价格也更“旗舰” 🏰 |
| gpt-5.6-sol-xhigh | $5 / M | $30 / M | 1.1M | 上下文更长一点,输出成本更高 ⚡ |
| glm-5.2 (max) | $1.40 / M | $4.40 / M | 1M | 价格很猛,性价比路线明显 🧮 |
如果只看“谁最强”,K3 的故事已经足够热闹。
但如果看“谁能被更多人用起来”,价格、上下文、开源权重才是重点。因为对开发团队来说,模型不只是跑一次 Demo,而是要反复改、反复测、反复部署。能不能承受长期调用成本,能不能放进自己的工具链,才是最后决定它能不能常驻的原因。🛠️
🧭 这次开源意味着什么?
| 影响方向 | 具体变化 | 值得关注的风险 |
|---|---|---|
| 🌍 开源模型上限被抬高 | 2.8T 级模型进入开放权重讨论,开源不再只代表“够用”。 | 模型巨大,本地部署门槛并不低。 |
| 👨💻 编程模型竞争更激烈 | WebDev 榜首会让更多前端、Agent、IDE 工具接入 K3。 | 榜单好看不等于所有真实项目都稳定,需要自己测。 |
| 🏢 企业部署选择变多 | 开放权重让私有化、合规、安全审查有更多空间。 | 超大模型推理成本、硬件和运维复杂度仍然很高。 |
我的感觉是,Kimi K3 很像一个信号:开源模型开始从“追赶者”变成“某些赛道的领先者”。
尤其是前端和长周期工程任务,K3 如果后续权重、工具链、推理生态都顺利落地,它可能会成为很多开发者愿意认真试用的模型。🌊
当然,也不要把它神化。官方自己也提到,K3 在整体体验上和最强闭源模型仍有差距;而 Arena 排名也会随着样本、任务、版本不断变化。
但这并不妨碍它成为一个值得记下来的时刻:当一个开放模型能在 WebDev Arena 站到第一,AI 编程的格局就已经开始松动了。 🏁












