K2 Horizon:迄今最大的全开放模型舰队——0.9B 到 375B,权重、数据与配方全公开
💡 工具推荐:计划本地部署 K2 Horizon?用 Evergreen Tools 的 YAML 转 JSON 工具在 compose 文件与 API 配置间切换、JSON 格式化工具校验请求载荷,并用 API 测试工具冒烟自建端点。 YAML 转 JSON 工具, JSON 格式化工具, API 测试工具
2026 年 9 月 3 日,位于阿布扎比、由穆罕默德·本·扎耶德人工智能大学(MBZUAI)孵化的基础模型研究院(IFM)发布了 K2 Horizon:一组覆盖 0.9B 到 375B 参数的六款基础模型。与过去一年充斥头条的「开放权重」不同,K2 Horizon 整个家族在 Apache 2.0 下同时公开权重、代码、训练数据与方法论——IFM 称之为 AI 历史上规模最大的全开放模型发布。对工程团队,这意味着「先在手表上跑通、再无缝升到企业旗舰」的模型路线第一次有了完整实现。 舰队里的每个模型共享同一接口与同一条部署路径,所以决策不再是「选一个赢家」,而是「每个负载该放在哪里跑」。
1. 全开放不是开放权重
过去几周的行业讨论大多围绕「开放权重」,K2 Horizon 直接把这个门槛抬高:不只是权重,训练数据、训练代码、数据配方与评估都在 Apache 2.0 下公开。创始人 Eric Xing 说得直白:「开源远不止开放权重。科学只有在别人能看到数据、跟随方法、复现结果并加以改进时才成立。」对合规与审计要求高的团队,这是把「可复现」写进采购合同的少数选择之一。
// The K2 Horizon fleet: six sizes, one shared architecture,
// vocabulary, and toolchain. Route by deployment target, then
// scale up without changing your workflow.
const FLEET = [
{ size: "0.9B", target: "watches, constrained devices" },
{ size: "3.7B", target: "phones, on-device apps" },
{ size: "7B", target: "phones, on-device apps" },
{ size: "32B", target: "local hosting, on-premise servers" },
{ size: "36B-A4B", target: "on-premise, cost-aware serving" },
{ size: "375B-A23B", target: "enterprise reasoning workloads" },
];
function pickModel(budget) {
if (budget.memoryMb < 2048) return "k2-horizon-0.9b";
if (budget.device === "phone") return "k2-horizon-7b";
if (budget.onPrem) return "k2-horizon-32b";
return "k2-horizon-375b-a23b";
}2. 六款型号,一条工具链
舰队布局清晰:0.9B 面向手表等高度受限设备;3.7B 与 7B 把进阶能力带到手机端侧;稠密 32B 与稀疏 36B-A4B 面向本地与本地服务器;375B-A23B MoE 旗舰面向企业级推理。六款共享同一核心架构、词表(0.9B 除外)、训练方法论、接口与部署工具链——意味着从原型到生产不需要换工作流。IFM 的动态模型路由会把任务导向最具成本效益的型号。 路由层同样是开放的——你可以检查任务在被分发前如何归类,再按自己的流量特征调整阈值。
# Serve the 7B model on a laptop-class box with vLLM. The whole
# fleet shares one deployment toolchain, so swapping to 32B is a
# one-line image change.
services:
k2-7b:
image: vllm/vllm-openai:latest
command:
- --model
- ifm/k2-horizon-7b
- --max-model-len
- "32768"
ports:
- "8000:8000"
deploy:
resources:
reservations:
devices:
- driver: nvidia
count: 1
capabilities: [gpu]3. 两项值得抄的技术
IFM 公布了两个底层创新:一是「扩散蒸馏」,并行生成成块的 token,解码速度大约提升 3 倍且不损失响应质量;二是「混合价值注意力」,在不增加算力的前提下改善推理。对自托管团队,前者的直接收益是更低的单位 token 成本;后者则说明推理质量的提升不一定等于更大的模型或更贵的硬件。
// Every model exposes an OpenAI-compatible endpoint, so your
// existing client code works unchanged from 0.9B to 375B.
const request = {
model: "k2-horizon-32b",
messages: [
{
role: "user",
content: "Explain why this query plan is slow and fix it.",
},
],
max_tokens: 1024,
temperature: 0.2,
};
// curl localhost:8000/v1/chat/completions -d request.json4. 从原型到生产的路由
开发流程可以是:先用 7B 在笔记本上验证提示词与工具调用,再用 32B 做本地服务,最后把最重的推理负载放到 375B 旗舰——全程接口不变。vLLM/SGLang 直接支持,OpenAI 兼容端点让你现有的客户端代码原样可用。对不想自建硬件的团队,Compass、Cerebras、Nebius 等推理伙伴今天就能提供 API。
5. 复现:从跑分到自证
IFM 为每个型号都发布了评测脚本与数据配方:拉下仓库、装依赖、跑 eval,就能在自家硬件上验证 coding/reasoning/agentic 成绩。对「能不能信厂商跑分」已经疲倦的团队,这是把信任从宣传材料转移到可执行证据上的机会。尤其当你要用模型做 agentic 任务时,本地复现比任何基准榜单都更接近你的真实负载。
# Reproducibility is the point: weights, code, training data and
# recipes ship together. Verify claims on your own hardware.
git clone https://github.com/ifm/k2-horizon
cd k2-horizon && pip install -r requirements.txt
python eval/run_eval.py --model ifm/k2-horizon-32b --tasks coding,reasoning,agentic
# Diffusion distillation speeds decoding roughly 3x by generating
# blocks of tokens in parallel; mixture of value attention cuts
# the compute needed for the same reasoning quality.6. 落地建议
第一,按部署目标选型号,而不是按参数大小选:手表选 0.9B、手机选 7B、本地服务器选 32B、企业旗舰选 375B。第二,小模型先验证、大模型再上线,动态路由能帮你把大部分请求留在成本最低的型号。第三,全开放不等于免治理:允许名单、审计与预算上限照旧。最后,把「可复现」当成特性——在切换任何闭源 API 之前,先问一句:如果供应商明天涨价,我们能不能在自己的机架上复现这条工作流? 全开放旗舰的存在改变的不仅是部署方式,还有议价能力:即使团队继续使用托管 API,也握有一个能在自家硬件上运行的可靠备选方案。
// Fully open does not mean zero governance. Keep the same policy
// layer you use for hosted models: allowlists, audit, and caps.
const modelPolicy = {
allowlist: [
"k2-horizon-7b",
"k2-horizon-32b",
"k2-horizon-375b-a23b",
],
defaultRoute: "k2-horizon-32b",
dataGuard: "all requests stay on-premise",
audit: "log model, prompt hash, tokens, and latency",
costCap: "infra_budget_only",
};📌 常见问题 FAQ
K2 Horizon 与普通开源模型有什么区别?
普通「开放权重」只公开权重;K2 Horizon 在 Apache 2.0 下同时公开权重、代码、训练数据与方法论,被 IFM 称为 AI 历史上规模最大的全开放模型发布,可完整复现。
K2 Horizon 与普通开源模型有什么区别?
普通「开放权重」只公开权重;K2 Horizon 在 Apache 2.0 下同时公开权重、代码、训练数据与方法论,被 IFM 称为 AI 历史上规模最大的全开放模型发布,可完整复现。
K2 Horizon 与普通开源模型有什么区别?
普通「开放权重」只公开权重;K2 Horizon 在 Apache 2.0 下同时公开权重、代码、训练数据与方法论,被 IFM 称为 AI 历史上规模最大的全开放模型发布,可完整复现。
K2 Horizon 与普通开源模型有什么区别?
普通「开放权重」只公开权重;K2 Horizon 在 Apache 2.0 下同时公开权重、代码、训练数据与方法论,被 IFM 称为 AI 历史上规模最大的全开放模型发布,可完整复现。
K2 Horizon 与普通开源模型有什么区别?
普通「开放权重」只公开权重;K2 Horizon 在 Apache 2.0 下同时公开权重、代码、训练数据与方法论,被 IFM 称为 AI 历史上规模最大的全开放模型发布,可完整复现。
六款模型分别适合什么场景?
0.9B 面向手表等受限设备;3.7B/7B 面向手机端侧;稠密 32B 与稀疏 36B-A4B 面向本地与本地服务器;375B-A23B MoE 旗舰面向企业级推理负载。
六款模型分别适合什么场景?
0.9B 面向手表等受限设备;3.7B/7B 面向手机端侧;稠密 32B 与稀疏 36B-A4B 面向本地与本地服务器;375B-A23B MoE 旗舰面向企业级推理负载。
六款模型分别适合什么场景?
0.9B 面向手表等受限设备;3.7B/7B 面向手机端侧;稠密 32B 与稀疏 36B-A4B 面向本地与本地服务器;375B-A23B MoE 旗舰面向企业级推理负载。
六款模型分别适合什么场景?
0.9B 面向手表等受限设备;3.7B/7B 面向手机端侧;稠密 32B 与稀疏 36B-A4B 面向本地与本地服务器;375B-A23B MoE 旗舰面向企业级推理负载。
六款模型分别适合什么场景?
0.9B 面向手表等受限设备;3.7B/7B 面向手机端侧;稠密 32B 与稀疏 36B-A4B 面向本地与本地服务器;375B-A23B MoE 旗舰面向企业级推理负载。
diffusion distillation 是什么?
IFM 公布的解码加速技术:并行生成成块的 token,速度大约提升 3 倍且不损失响应质量;另有 mixture of value attention 在不增加算力的情况下改善推理。
diffusion distillation 是什么?
IFM 公布的解码加速技术:并行生成成块的 token,速度大约提升 3 倍且不损失响应质量;另有 mixture of value attention 在不增加算力的情况下改善推理。
diffusion distillation 是什么?
IFM 公布的解码加速技术:并行生成成块的 token,速度大约提升 3 倍且不损失响应质量;另有 mixture of value attention 在不增加算力的情况下改善推理。
diffusion distillation 是什么?
IFM 公布的解码加速技术:并行生成成块的 token,速度大约提升 3 倍且不损失响应质量;另有 mixture of value attention 在不增加算力的情况下改善推理。
diffusion distillation 是什么?
IFM 公布的解码加速技术:并行生成成块的 token,速度大约提升 3 倍且不损失响应质量;另有 mixture of value attention 在不增加算力的情况下改善推理。
如何部署 K2 Horizon?
模型已上 Hugging Face,并支持 vLLM 与 SGLang;不想自建硬件的团队可通过 Compass、Cerebras、Nebius 等推理伙伴的 API 使用。
如何部署 K2 Horizon?
模型已上 Hugging Face,并支持 vLLM 与 SGLang;不想自建硬件的团队可通过 Compass、Cerebras、Nebius 等推理伙伴的 API 使用。
如何部署 K2 Horizon?
模型已上 Hugging Face,并支持 vLLM 与 SGLang;不想自建硬件的团队可通过 Compass、Cerebras、Nebius 等推理伙伴的 API 使用。
如何部署 K2 Horizon?
模型已上 Hugging Face,并支持 vLLM 与 SGLang;不想自建硬件的团队可通过 Compass、Cerebras、Nebius 等推理伙伴的 API 使用。
如何部署 K2 Horizon?
模型已上 Hugging Face,并支持 vLLM 与 SGLang;不想自建硬件的团队可通过 Compass、Cerebras、Nebius 等推理伙伴的 API 使用。
全开放模型还需要治理吗?
需要。允许名单、审计、数据边界与预算上限仍然适用;全开放改变的是供应链透明度与可复现性,而不是治理义务。
全开放模型还需要治理吗?
需要。允许名单、审计、数据边界与预算上限仍然适用;全开放改变的是供应链透明度与可复现性,而不是治理义务。
全开放模型还需要治理吗?
需要。允许名单、审计、数据边界与预算上限仍然适用;全开放改变的是供应链透明度与可复现性,而不是治理义务。
全开放模型还需要治理吗?
需要。允许名单、审计、数据边界与预算上限仍然适用;全开放改变的是供应链透明度与可复现性,而不是治理义务。
全开放模型还需要治理吗?
需要。允许名单、审计、数据边界与预算上限仍然适用;全开放改变的是供应链透明度与可复现性,而不是治理义务。