小米开源 MiMo-V2.6:万亿参数的全模态模型登顶开源榜
💡 工具推荐:AI Token 计数器、AI 代码解释器、AI 提示词模板
2026 年 9 月 21 至 22 日,小米发布并开源了 MiMo-V2.6 系列:两个原生全模态模型 MiMo-V2.6-Pro 与 MiMo-V2.6-Flash,外加一个面向低延迟场景的 Pro-UltraSpeed。用小米自己的话说,Pro 是其最强的旗舰推理模型,且是「万亿参数」。两个模型都以文本、图像、视频、音频为输入,拥有 100 万 token 的上下文窗口,最高可输出 12.8 万 token。权重开放,API 同时兼容 OpenAI 与 Anthropic 协议,而小米的说法很直接:MiMo-V2.6-Pro 在 Artificial Analysis 的综合智能指数上取得 46.32 分,是小米所称的「当今最强开源模型」。宣称是廉价的,所以下面把可核实的部分和有实际影响的部分讲清楚。
一、来自官方页面的规格
官方模型页列出:100 万 token 上下文窗口、最高 128K 输出、每分钟 100 次请求、每分钟 1000 万 token。输入是文本,并通过全模态能力支持图像、视频与音频;输出为文本。能力清单包括工具调用、流式输出、网页搜索、结构化输出、上下文缓存,以及可开关的深度思考模式。小米把 Pro 定位在长周期、高风险的任务上——编码、研究、网络安全、计算机操作——把 Flash 定位为在智能、成本与 token 效率之间取得平衡的高频调用型号。第三个型号 Pro-UltraSpeed 则面向对延迟敏感的工作负载。
# The migration path is deliberately boring: the API is OpenAI-compatible,
# so pointing an existing tool at MiMo is a base URL and a model name.
from openai import OpenAI
client = OpenAI(
api_key="MIMO_API_KEY",
base_url="https://api.xiaomimimo.com/v1", # official endpoint
)
resp = client.chat.completions.create(
model="mimo-v2.6-flash", # or mimo-v2.6-pro
messages=[
{"role": "system", "content": "You are MiMo, an AI assistant developed by Xiaomi."},
{"role": "user", "content": "Review this function for edge cases."},
],
max_tokens=1024,
)
print(resp.choices[0].message.content)小米称 MiMo-V2.6-Pro 为万亿参数旗舰
二、定价才是真正的头条
开源权重夺人眼球,但价格表才真正改变采购决策。按小米的美元按量计费价,MiMo-V2.6-Pro 在缓存未命中时为每百万输入 token 0.435 美元,缓存命中时为 0.0036 美元,输出为每百万 token 0.87 美元。Flash 则是未命中每百万输入 0.14 美元、命中 0.0028 美元、输出每百万 0.28 美元。缓存命中的数字不是四舍五入的细节:Agent 工作流会反复重发同一段系统提示、工具 schema 与仓库上下文,所以成本其实由命中率决定。命中价大约是未命中价的一百二十分之一,这正好奖励了 Agent 天然产生的调用模式。
# The same endpoint also speaks the Anthropic protocol, which is what makes
# a CLI agent swap a two-line change. Xiaomi documents Claude Code and Cline.
# Claude Code / Cline environment variables
export ANTHROPIC_BASE_URL="https://api.xiaomimimo.com"
export ANTHROPIC_AUTH_TOKEN="$MIMO_API_KEY"
export ANTHROPIC_MODEL="mimo-v2.6-pro"
# Keep the model name in a variable so you can A/B it:
# ANTHROPIC_MODEL="mimo-v2.6-flash" # cheaper, higher throughput
claude "summarise the failing test and propose a fix"
三、为什么「原生全模态」不只是个标签
「原生全模态」意味着同一套权重联合处理文本、图像、视频与音频,而不是把每种模态路由到一个独立的专家模型、再在路由后面缝起来。对开发者而言,实际差别是更少的活动部件、以及需要管理的单一上下文。小米自己的演示说明了它想覆盖的范围:从图像、视频或文本出发,协调多个 Agent 搭建一个 3D 开放世界游戏;一个材料研究副驾,能检索文献、提出假设、模拟结合强度并给出候选清单;以及代码驱动的内容创作,把傅里叶分解这类概念变成动画。并非每个团队都需要这些,但值得注意的模式是:模型被要求去规划和协调,而不只是回答。
# Native omnimodality means one set of weights handles images, video and
# audio jointly -- no router stitching separate specialist models together.
import base64, httpx
def describe(image_path: str, question: str) -> str:
with open(image_path, "rb") as fh:
b64 = base64.b64encode(fh.read()).decode()
r = httpx.post(
"https://api.xiaomimimo.com/v1/chat/completions",
headers={"Authorization": "Bearer MIMO_API_KEY"},
json={
"model": "mimo-v2.6-pro",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": question},
{"type": "image_url",
"image_url": {"url": "data:image/png;base64," + b64}},
],
}],
}, timeout=120)
return r.json()["choices"][0]["message"]["content"]官方演示里,它把任务拆成子任务并协调多个 Agent
四、MIT 开源权重,以及一份实打实的技术报告
权重以 MIT 许可发布,允许商业使用与继续训练。小米还随模型一起发布了技术报告,独立分析也已开始。Sebastian Raschka 对架构的解读有一种清爽的务实:Pro 大体是一个常规设计——分组查询注意力配上一层很小窗口的滑动窗口注意力——而收益主要来自数据与后训练配方的改进,而不是奇特的注意力变体。报告还描述了跨多个 Agent harness 的训练,以及一个会检查执行轨迹、而不只是核对最终答案的 agentic grader。如果你关心 Agent 质量,那个细节——奖励轨迹而非只奖励答案——才是可迁移的思路。
# Cache hits are where the bill is decided in agent loops, because the same
# system prompt and tool schemas get resent on every step. Check your rate
# before you move traffic -- a hit costs roughly a hundredth of a miss.
PRICES = { # USD per 1M tokens, Xiaomi pay-as-you-go
"mimo-v2.6-pro": {"in_miss": 0.435, "in_hit": 0.0036, "out": 0.87},
"mimo-v2.6-flash": {"in_miss": 0.14, "in_hit": 0.0028, "out": 0.28},
}
def run_cost(model, in_miss, in_hit, out, steps=8):
total = 0.0
for _ in range(steps): # each step resends the cached prefix
total += (in_miss * PRICES[model]["in_miss"]
+ in_hit * PRICES[model]["in_hit"]
+ out * PRICES[model]["out"]) / 1e6
return round(total, 4)
print(run_cost("mimo-v2.6-pro", 12_000, 12_000, 800))
print(run_cost("mimo-v2.6-flash", 12_000, 12_000, 800))五、怎么在不承诺的前提下试它
迁移路径刻意做得无聊,这是褒义。小米的 API 同时兼容 OpenAI 与 Anthropic 协议,所以把已有工具指过去,通常只是改一个 base URL 和一个模型名;小米文档明确列出支持 Claude Code 与 Cline。示例 1 展示 OpenAI 兼容的替换方式,示例 2 展示 CLI Agent 用的 Anthropic 风格环境变量。在迁移真实流量之前,先做两件事:在你的真实任务上做基准测试,而不是相信一个综合指数;把同一个提示跑两次,量出你实际拿到的缓存命中率,因为那才是你的账单会反映的数字。示例 4 就是一个小巧的混合成本计算器。
# Route by task, not by habit: keep the cheap model for the bulk of routine
# calls and spend the flagship only where the task actually needs it.
ROUTES = {
"classify": "mimo-v2.6-flash",
"summarise": "mimo-v2.6-flash",
"extract": "mimo-v2.6-flash",
"code_review": "mimo-v2.6-pro",
"long_plan": "mimo-v2.6-pro",
"multimodal_doc": "mimo-v2.6-pro",
}
def pick(task: str, complexity: float) -> str:
base = ROUTES.get(task, "mimo-v2.6-flash")
if complexity > 0.8 and base.endswith("flash"):
return "mimo-v2.6-pro" # escalate only when the task earns it
return base
for job in ["classify", "code_review", "long_plan"]:
print(job, "->", pick(job, 0.9))MIT 权重,加上缓存感知的 API 价格
六、它对开源权重竞争意味着什么
一家手机厂商,以 MIT 许可发布一个万亿参数的全模态模型,附带技术报告与缓存感知定价,这本身就是关于开源权重市场当下运作方式的一个论断。能力不再是唯一的轴;许可、上下文经济学与工具兼容性同样是。对团队而言这是好消息:决策不再是「要么前沿、要么一无所有」。你可以用一个有能力的开源模型承担大部分例行工作,把托管模型留给困难的长尾,并在同一个协议后面切换。收益最大的,是那些把提示词、工具与评估保持在「能扛住换模型」形状里的团队——那是一种设计习惯,不是一次采购。
📌 常见问题 FAQ
小米发布了什么?
2026 年 9 月 21 至 22 日发布的 MiMo-V2.6 系列:MiMo-V2.6-Pro、MiMo-V2.6-Flash 以及 Pro-UltraSpeed,权重开源,同时提供 API。
上下文窗口有多大?
官方页面列出 100 万 token 上下文窗口,最高 128K 输出 token。
真的是开源的吗?
是的,权重以 MIT 许可发布,允许商业使用与继续训练;小米还随模型发布了技术报告。
API 价格是多少?
按小米美元按量计费价:Pro 缓存未命中输入每百万 0.435 美元、缓存命中 0.0036 美元、输出 0.87 美元;Flash 分别为 0.14、0.0028 与 0.28 美元。
能用在现有工具里吗?
可以,小米 API 同时兼容 OpenAI 与 Anthropic 协议,官方文档列出了 Claude Code 与 Cline 等工具。
🔧 推荐工具
📚 参考资料
- Xiaomi MiMo — MiMo-V2.6-Pro official model page (specs and pricing)
- Xiaomi MiMo — MiMo-V2.6-Flash official model page
- Xiaomi MiMo — V2.6 model blog
- Hugging Face — XiaomiMiMo organisation (open-weight checkpoints and technical report)
- Sebastian Raschka — MiMo-V2.6 Pro Architecture and Training Notes (Sep 22, 2026)