小米开源 MiMo-V2.6:万亿参数的全模态模型登顶开源榜

·阅读约11分钟·Evergreen Tools Team

2026 年 9 月 21 至 22 日,小米发布并开源了 MiMo-V2.6 系列:两个原生全模态模型 MiMo-V2.6-Pro 与 MiMo-V2.6-Flash,外加一个面向低延迟场景的 Pro-UltraSpeed。用小米自己的话说,Pro 是其最强的旗舰推理模型,且是「万亿参数」。两个模型都以文本、图像、视频、音频为输入,拥有 100 万 token 的上下文窗口,最高可输出 12.8 万 token。权重开放,API 同时兼容 OpenAI 与 Anthropic 协议,而小米的说法很直接:MiMo-V2.6-Pro 在 Artificial Analysis 的综合智能指数上取得 46.32 分,是小米所称的「当今最强开源模型」。宣称是廉价的,所以下面把可核实的部分和有实际影响的部分讲清楚。

一、来自官方页面的规格

官方模型页列出:100 万 token 上下文窗口、最高 128K 输出、每分钟 100 次请求、每分钟 1000 万 token。输入是文本,并通过全模态能力支持图像、视频与音频;输出为文本。能力清单包括工具调用、流式输出、网页搜索、结构化输出、上下文缓存,以及可开关的深度思考模式。小米把 Pro 定位在长周期、高风险的任务上——编码、研究、网络安全、计算机操作——把 Flash 定位为在智能、成本与 token 效率之间取得平衡的高频调用型号。第三个型号 Pro-UltraSpeed 则面向对延迟敏感的工作负载。

# The migration path is deliberately boring: the API is OpenAI-compatible,
# so pointing an existing tool at MiMo is a base URL and a model name.

from openai import OpenAI

client = OpenAI(
    api_key="MIMO_API_KEY",
    base_url="https://api.xiaomimimo.com/v1",   # official endpoint
)

resp = client.chat.completions.create(
    model="mimo-v2.6-flash",                    # or mimo-v2.6-pro
    messages=[
        {"role": "system", "content": "You are MiMo, an AI assistant developed by Xiaomi."},
        {"role": "user", "content": "Review this function for edge cases."},
    ],
    max_tokens=1024,
)
print(resp.choices[0].message.content)
万亿参数的全模态模型

小米称 MiMo-V2.6-Pro 为万亿参数旗舰

二、定价才是真正的头条

开源权重夺人眼球,但价格表才真正改变采购决策。按小米的美元按量计费价,MiMo-V2.6-Pro 在缓存未命中时为每百万输入 token 0.435 美元,缓存命中时为 0.0036 美元,输出为每百万 token 0.87 美元。Flash 则是未命中每百万输入 0.14 美元、命中 0.0028 美元、输出每百万 0.28 美元。缓存命中的数字不是四舍五入的细节:Agent 工作流会反复重发同一段系统提示、工具 schema 与仓库上下文,所以成本其实由命中率决定。命中价大约是未命中价的一百二十分之一,这正好奖励了 Agent 天然产生的调用模式。

# The same endpoint also speaks the Anthropic protocol, which is what makes
# a CLI agent swap a two-line change. Xiaomi documents Claude Code and Cline.

# Claude Code / Cline environment variables
export ANTHROPIC_BASE_URL="https://api.xiaomimimo.com"
export ANTHROPIC_AUTH_TOKEN="$MIMO_API_KEY"
export ANTHROPIC_MODEL="mimo-v2.6-pro"

# Keep the model name in a variable so you can A/B it:
#   ANTHROPIC_MODEL="mimo-v2.6-flash"   # cheaper, higher throughput
claude "summarise the failing test and propose a fix"

三、为什么「原生全模态」不只是个标签

「原生全模态」意味着同一套权重联合处理文本、图像、视频与音频,而不是把每种模态路由到一个独立的专家模型、再在路由后面缝起来。对开发者而言,实际差别是更少的活动部件、以及需要管理的单一上下文。小米自己的演示说明了它想覆盖的范围:从图像、视频或文本出发,协调多个 Agent 搭建一个 3D 开放世界游戏;一个材料研究副驾,能检索文献、提出假设、模拟结合强度并给出候选清单;以及代码驱动的内容创作,把傅里叶分解这类概念变成动画。并非每个团队都需要这些,但值得注意的模式是:模型被要求去规划和协调,而不只是回答。

# Native omnimodality means one set of weights handles images, video and
# audio jointly -- no router stitching separate specialist models together.

import base64, httpx

def describe(image_path: str, question: str) -> str:
    with open(image_path, "rb") as fh:
        b64 = base64.b64encode(fh.read()).decode()
    r = httpx.post(
        "https://api.xiaomimimo.com/v1/chat/completions",
        headers={"Authorization": "Bearer MIMO_API_KEY"},
        json={
            "model": "mimo-v2.6-pro",
            "messages": [{
                "role": "user",
                "content": [
                    {"type": "text", "text": question},
                    {"type": "image_url",
                     "image_url": {"url": "data:image/png;base64," + b64}},
                ],
            }],
        }, timeout=120)
    return r.json()["choices"][0]["message"]["content"]
Agent 协作与多模态

官方演示里,它把任务拆成子任务并协调多个 Agent

四、MIT 开源权重,以及一份实打实的技术报告

权重以 MIT 许可发布,允许商业使用与继续训练。小米还随模型一起发布了技术报告,独立分析也已开始。Sebastian Raschka 对架构的解读有一种清爽的务实:Pro 大体是一个常规设计——分组查询注意力配上一层很小窗口的滑动窗口注意力——而收益主要来自数据与后训练配方的改进,而不是奇特的注意力变体。报告还描述了跨多个 Agent harness 的训练,以及一个会检查执行轨迹、而不只是核对最终答案的 agentic grader。如果你关心 Agent 质量,那个细节——奖励轨迹而非只奖励答案——才是可迁移的思路。

# Cache hits are where the bill is decided in agent loops, because the same
# system prompt and tool schemas get resent on every step. Check your rate
# before you move traffic -- a hit costs roughly a hundredth of a miss.

PRICES = {                      # USD per 1M tokens, Xiaomi pay-as-you-go
    "mimo-v2.6-pro":   {"in_miss": 0.435, "in_hit": 0.0036, "out": 0.87},
    "mimo-v2.6-flash": {"in_miss": 0.14,  "in_hit": 0.0028, "out": 0.28},
}

def run_cost(model, in_miss, in_hit, out, steps=8):
    total = 0.0
    for _ in range(steps):      # each step resends the cached prefix
        total += (in_miss * PRICES[model]["in_miss"]
                  + in_hit * PRICES[model]["in_hit"]
                  + out * PRICES[model]["out"]) / 1e6
    return round(total, 4)

print(run_cost("mimo-v2.6-pro", 12_000, 12_000, 800))
print(run_cost("mimo-v2.6-flash", 12_000, 12_000, 800))

五、怎么在不承诺的前提下试它

迁移路径刻意做得无聊,这是褒义。小米的 API 同时兼容 OpenAI 与 Anthropic 协议,所以把已有工具指过去,通常只是改一个 base URL 和一个模型名;小米文档明确列出支持 Claude Code 与 Cline。示例 1 展示 OpenAI 兼容的替换方式,示例 2 展示 CLI Agent 用的 Anthropic 风格环境变量。在迁移真实流量之前,先做两件事:在你的真实任务上做基准测试,而不是相信一个综合指数;把同一个提示跑两次,量出你实际拿到的缓存命中率,因为那才是你的账单会反映的数字。示例 4 就是一个小巧的混合成本计算器。

# Route by task, not by habit: keep the cheap model for the bulk of routine
# calls and spend the flagship only where the task actually needs it.

ROUTES = {
    "classify":       "mimo-v2.6-flash",
    "summarise":      "mimo-v2.6-flash",
    "extract":        "mimo-v2.6-flash",
    "code_review":    "mimo-v2.6-pro",
    "long_plan":      "mimo-v2.6-pro",
    "multimodal_doc": "mimo-v2.6-pro",
}

def pick(task: str, complexity: float) -> str:
    base = ROUTES.get(task, "mimo-v2.6-flash")
    if complexity > 0.8 and base.endswith("flash"):
        return "mimo-v2.6-pro"   # escalate only when the task earns it
    return base

for job in ["classify", "code_review", "long_plan"]:
    print(job, "->", pick(job, 0.9))
开源与定价

MIT 权重,加上缓存感知的 API 价格

六、它对开源权重竞争意味着什么

一家手机厂商,以 MIT 许可发布一个万亿参数的全模态模型,附带技术报告与缓存感知定价,这本身就是关于开源权重市场当下运作方式的一个论断。能力不再是唯一的轴;许可、上下文经济学与工具兼容性同样是。对团队而言这是好消息:决策不再是「要么前沿、要么一无所有」。你可以用一个有能力的开源模型承担大部分例行工作,把托管模型留给困难的长尾,并在同一个协议后面切换。收益最大的,是那些把提示词、工具与评估保持在「能扛住换模型」形状里的团队——那是一种设计习惯,不是一次采购。

📌 常见问题 FAQ

小米发布了什么?

2026 年 9 月 21 至 22 日发布的 MiMo-V2.6 系列:MiMo-V2.6-Pro、MiMo-V2.6-Flash 以及 Pro-UltraSpeed,权重开源,同时提供 API。

上下文窗口有多大?

官方页面列出 100 万 token 上下文窗口,最高 128K 输出 token。

真的是开源的吗?

是的,权重以 MIT 许可发布,允许商业使用与继续训练;小米还随模型发布了技术报告。

API 价格是多少?

按小米美元按量计费价:Pro 缓存未命中输入每百万 0.435 美元、缓存命中 0.0036 美元、输出 0.87 美元;Flash 分别为 0.14、0.0028 与 0.28 美元。

能用在现有工具里吗?

可以,小米 API 同时兼容 OpenAI 与 Anthropic 协议,官方文档列出了 Claude Code 与 Cline 等工具。