Quasar 438B:欧洲得分最高的推理模型对企业 Agent 与编码意味着什么
💡 工具推荐:要为企业 Agent 评估 438B 级模型?用 Evergreen Tools 的 AI Token 计数器建模每个任务的推理成本,用 Text Diff Checker 检查试运行中模型改了什么,用 AI 代码审查工具给它的编码输出做一致打分。 AI Token 计数器, 文本差异对比工具, AI 代码审查工具
2026 年 9 月 2 日,西班牙公司 Multiverse Computing 发布了 Quasar 438B——这是这家以压缩与量子启发 AI 闻名的公司第一次推出大模型,定位直指企业级 Agent 与编码。它在 Artificial Analysis 的 Intelligence Index v4.1.1 上得 43 分,是欧洲模型的最高纪录,超过 Mistral Medium 3.5 的 30 分与 NVIDIA Nemotron 3 Ultra 的 38 分。对开发者而言,Quasar 的新闻价值不在「又一个 4380 亿参数」,而在三件事:欧洲主权 AI 的进展、一家压缩模型公司做大模型的方法论,以及「大模型能否快得足以支撑交互式 Agent」这个正在被重新讨论的问题。本文带你把发布事实、基准噪音与工程现实分开。
1. 发布事实:谁、何时、发了什么
Multiverse Computing 总部在西班牙圣塞巴斯蒂安,此前以压缩 AI 模型与量子启发算法著称。2026 年 9 月 2 日(部分媒体 9 月 3 日报道)它发布 Quasar 438B:4380 亿参数,是公司第一个大模型,明确瞄准企业级 Agent 与编码场景,支持英语与西班牙语。官方口径与第三方数据基本一致:Artificial Analysis Intelligence Index v4.1.1 得分 43,为欧洲模型最高;Terminal-Bench v2.1 得分 69.3;Long Context Reasoning 基准 75.0,领先 Mistral Medium 3.5 达 18.7 分、领先 Nemotron 3 Ultra 达 15.4 分。发布口径里还强调「欧洲可以在主权 AI 上与美系模型竞争」。
# Pull the public model card facts before you evaluate.
# Quasar 438B launch facts reported on 2026-09-02/03:
# - Artificial Analysis Intelligence Index v4.1.1: 43
# - Mistral Medium 3.5: 30 | NVIDIA Nemotron 3 Ultra: 38
# - Terminal-Bench v2.1: 69.3 | Long Context Reasoning: 75.0
FACTS = {
"vendor": "Multiverse Computing",
"params": 438_000_000_000,
"intelligence_index": 43,
"terminal_bench_v21": 69.3,
"long_context_reasoning": 75.0
}
print(FACTS)2. 43 分意味着什么:把欧洲竞争对手摆进坐标
43 分这个数字只有放在欧洲坐标系里才有意义:同一评测里 Mistral Medium 3.5 是 30,NVIDIA Nemotron 3 Ultra 是 38。换句话说,Quasar 不只是「又一个欧洲模型」,而是把欧洲模型的最高分从 38 推到了 43。但也要保持清醒:43 分距离美系前沿模型仍有距离,而 9 月 2 日 The New Stack 的报道标题已经提示「基准讲了一个更复杂的故事」——速度与推理质量在不同任务上表现并不一致。对工程团队的正确用法是把它当作「欧洲阵营的新基准点」:如果你有数据合规或主权要求,需要把推理放在欧洲境内,Quasar 让「欧洲本地前沿级 Agent」第一次有了一个可比较的选项。
# Latency budget: is 183 tokens per second enough for your agent?
# A 4,000-token answer at 183 tps takes about 22 seconds of generation.
def generation_seconds(output_tokens, tps):
return round(output_tokens / tps, 1)
for out in (2000, 4000, 8000):
print(out, "tokens ->", generation_seconds(out, 183), "s")3. 企业 Agent 关心的数字:69.3、75.0 与 183 tps
三个数字对企业 Agent 团队最有用。第一,Terminal-Bench v2.1 的 69.3:这是终端/代理操作类基准,接近你让 Agent 在真实环境里跑命令的场景。第二,Long Context Reasoning 的 75.0:长文本推理对「把合同、审计报告或大仓库塞进上下文再推理」的任务很关键,也是官方主打的差异点。第三,Artificial Analysis 记录的约 183 token/秒输出速度:这意味着 4000 token 的回答约需 22 秒生成,交互式 Agent 可以接受,但大批量处理时仍需排队与并发规划。别只看峰值分数,要把 tps 乘上你的平均输出长度,算真实的端到端延迟。
// Enterprise agent configuration, English or Spanish.
{
"model": "quasar-438b",
"language": "en",
"agent": {
"role": "senior_engineer",
"tools": ["read_repo", "search_code", "suggest_diff"],
"max_steps": 8
},
"output": {"format": "diff", "include_explanation": true}
}4. 压缩公司做 438B:部署成本叙事值得关注
Multiverse 的看家本领是模型压缩与量子启发算法,所以 Quasar 的隐含叙事是「4380 亿参数的能力,配上可控的部署成本」。这个叙事对企业的吸引力很直接:在自家或欧洲境内基础设施上运行一个 438B 级模型,而不是把数据送到境外 API。但工程上要验证三件事:压缩后的精度损失在你的任务上是否可接受;FP8 或更低精度量化后的真实吞吐;以及 KV cache 与长上下文在受限硬件上的表现。The New Stack 的评测已经指出速度成绩「比公司宣传的更复杂」,所以不要被「够快」一句话打动,用你自己的 GPU 预算跑一次基准才是唯一可靠的答案。
5. 主权 AI 与双语:对欧洲企业的实际意义
Quasar 支持英语与西班牙语,发布口径强调欧洲主权 AI。对欧洲企业,这意味着两个具体好处:其一,受 GDPR 与行业监管约束的数据可以在欧洲境内完成推理,避免跨境数据传输的合规成本;其二,西班牙语是第一大母语人口之一的语言,双语原生支持让南欧市场的客服、文档与内部工具第一次有「本土大模型」可选。但主权叙事不能替代工程评估:仍然要确认模型托管的地理位置、运维由谁负责、以及供应商的长期支持承诺。主权 AI 的价值只有在你能真正控制数据路径时才成立,否则它只是营销词。
# Evaluation harness: 15 enterprise tasks, compare two endpoints.
def trial(endpoint, tasks):
rows = []
for t in tasks:
r = call(endpoint, t)
rows.append({
"task": t.id,
"resolved": r.resolved,
"tokens": r.total_tokens,
"seconds": r.wall_seconds,
"review_score": grade(r.diff) # human or AI review
})
return rows
a = trial("quasar-438b", TASKS)
b = trial("current-model", TASKS)
print("quasar resolved:", sum(x["resolved"] for x in a), "/", len(TASKS))
print("current resolved:", sum(x["resolved"] for x in b), "/", len(TASKS))6. 采纳 438B 级模型前的评测清单
无论宣传多好,采纳前请跑同一套评测。抽 15 个真实企业任务,覆盖长文档推理、仓库级代码修改、终端操作与双语场景,让 Quasar 与你当前模型各跑一遍,比较解决率、每任务 token、墙钟时间与代码审查得分。用 Text Diff Checker 检查它的改动是否克制,用 AI Code Reviewer 对输出做一致打分。特别要测长上下文:75.0 的 Long Context 分数在演示里很好看,但你的合同与仓库混合场景可能完全不同。两周数据出来后再决定:Quasar 赢的任务切过去,没赢的留在原处。欧洲模型的进步值得关注,但你的账单与缺陷数据才值得相信。
// Serving shape for a 438B-class model with compression in mind.
// Numbers are planning placeholders; benchmark your own GPUs.
{
"model": "quasar-438b",
"tensor_parallel_size": 8,
"quantization": "fp8",
"max_model_len": 65536,
"gpu_memory_utilization": 0.9,
"enable_prefix_caching": true
}📌 常见问题 FAQ
Quasar 438B 是什么时候发布的?
Multiverse Computing 于 2026 年 9 月 2 日发布(部分媒体 9 月 3 日报道),这是该公司第一个大模型,4380 亿参数,面向企业级 Agent 与编码。
Quasar 438B 是什么时候发布的?
Multiverse Computing 于 2026 年 9 月 2 日发布(部分媒体 9 月 3 日报道),这是该公司第一个大模型,4380 亿参数,面向企业级 Agent 与编码。
Quasar 438B 是什么时候发布的?
Multiverse Computing 于 2026 年 9 月 2 日发布(部分媒体 9 月 3 日报道),这是该公司第一个大模型,4380 亿参数,面向企业级 Agent 与编码。
Quasar 438B 是什么时候发布的?
Multiverse Computing 于 2026 年 9 月 2 日发布(部分媒体 9 月 3 日报道),这是该公司第一个大模型,4380 亿参数,面向企业级 Agent 与编码。
Quasar 438B 是什么时候发布的?
Multiverse Computing 于 2026 年 9 月 2 日发布(部分媒体 9 月 3 日报道),这是该公司第一个大模型,4380 亿参数,面向企业级 Agent 与编码。
Quasar 438B 在 Artificial Analysis 上得了多少分?
Intelligence Index v4.1.1 得分 43,是欧洲模型最高分,超过 Mistral Medium 3.5 的 30 分与 NVIDIA Nemotron 3 Ultra 的 38 分。
Quasar 438B 在 Artificial Analysis 上得了多少分?
Intelligence Index v4.1.1 得分 43,是欧洲模型最高分,超过 Mistral Medium 3.5 的 30 分与 NVIDIA Nemotron 3 Ultra 的 38 分。
Quasar 438B 在 Artificial Analysis 上得了多少分?
Intelligence Index v4.1.1 得分 43,是欧洲模型最高分,超过 Mistral Medium 3.5 的 30 分与 NVIDIA Nemotron 3 Ultra 的 38 分。
Quasar 438B 在 Artificial Analysis 上得了多少分?
Intelligence Index v4.1.1 得分 43,是欧洲模型最高分,超过 Mistral Medium 3.5 的 30 分与 NVIDIA Nemotron 3 Ultra 的 38 分。
Quasar 438B 在 Artificial Analysis 上得了多少分?
Intelligence Index v4.1.1 得分 43,是欧洲模型最高分,超过 Mistral Medium 3.5 的 30 分与 NVIDIA Nemotron 3 Ultra 的 38 分。
Quasar 的输出速度有多快?
Artificial Analysis 记录约 183 token/秒,4000 token 的回答约需 22 秒生成;实际端到端延迟取决于你的平均输出长度与并发。
Quasar 的输出速度有多快?
Artificial Analysis 记录约 183 token/秒,4000 token 的回答约需 22 秒生成;实际端到端延迟取决于你的平均输出长度与并发。
Quasar 的输出速度有多快?
Artificial Analysis 记录约 183 token/秒,4000 token 的回答约需 22 秒生成;实际端到端延迟取决于你的平均输出长度与并发。
Quasar 的输出速度有多快?
Artificial Analysis 记录约 183 token/秒,4000 token 的回答约需 22 秒生成;实际端到端延迟取决于你的平均输出长度与并发。
Quasar 的输出速度有多快?
Artificial Analysis 记录约 183 token/秒,4000 token 的回答约需 22 秒生成;实际端到端延迟取决于你的平均输出长度与并发。
Quasar 支持哪些语言?
官方宣布支持英语与西班牙语,这也是它面向欧洲市场与主权 AI 叙事的卖点之一。
Quasar 支持哪些语言?
官方宣布支持英语与西班牙语,这也是它面向欧洲市场与主权 AI 叙事的卖点之一。
Quasar 支持哪些语言?
官方宣布支持英语与西班牙语,这也是它面向欧洲市场与主权 AI 叙事的卖点之一。
Quasar 支持哪些语言?
官方宣布支持英语与西班牙语,这也是它面向欧洲市场与主权 AI 叙事的卖点之一。
Quasar 支持哪些语言?
官方宣布支持英语与西班牙语,这也是它面向欧洲市场与主权 AI 叙事的卖点之一。
企业应该直接采纳 Quasar 吗?
先跑 15 个真实任务的对照评测,比较解决率、成本与延迟;The New Stack 等评测也提示其基准表现比宣传更复杂,不要只凭发布稿做决定。
企业应该直接采纳 Quasar 吗?
先跑 15 个真实任务的对照评测,比较解决率、成本与延迟;The New Stack 等评测也提示其基准表现比宣传更复杂,不要只凭发布稿做决定。
企业应该直接采纳 Quasar 吗?
先跑 15 个真实任务的对照评测,比较解决率、成本与延迟;The New Stack 等评测也提示其基准表现比宣传更复杂,不要只凭发布稿做决定。
企业应该直接采纳 Quasar 吗?
先跑 15 个真实任务的对照评测,比较解决率、成本与延迟;The New Stack 等评测也提示其基准表现比宣传更复杂,不要只凭发布稿做决定。
企业应该直接采纳 Quasar 吗?
先跑 15 个真实任务的对照评测,比较解决率、成本与延迟;The New Stack 等评测也提示其基准表现比宣传更复杂,不要只凭发布稿做决定。