目前,OpenRouter 将 Muse Spark 1.3 的价格列为每百万输入 token 1.25 美元、每百万输出 token 4.25 美元。不过,决定是否采用它,不能只看单价。对于长上下文编程和智能体任务,它展现出了相当大的潜力;但这次发布还很新,发布初期 max reasoning 尚未上线,而且首 token 延迟可能很高。
Muse Spark 1.3 是什么?“可用”又意味着什么?
Muse Spark 1.3 是 Meta 面向长时间运行的智能体任务、编程和多模态场景打造的专有推理模型。Meta 于 2026 年 9 月 2 日宣布该模型,并表示它将陆续接入 Muse Code 和 Meta Model API;现有推理模式会率先开放,max reasoning 则需要完成额外的安全测试。(Meta AI Research 的公告)
发布图中包含 max 结果,但 max reasoning 当时仍需额外安全测试。因此,买家不应默认这些结果在首日就能稳定复现。
Meta 表示,Muse Spark 1.3 在长任务中保持约束、处理同一线程里的任务中断、主动提出澄清问题、在执行有重大影响的操作前请求确认,以及承认自己陷入困境等方面都有改进。Meta 还声称,在内部编程对比中,它相比 Muse Spark 1.2 的工具调用次数减少约 20%,token 用量减少 25%。不过,这些都是厂商自行报告的数据,既没有可复现的任务集,也没有误差范围。
发布文章将开放权重列为未来路线图上的工作。本文核查的资料只把 Muse Spark 1.3 列为托管/API 专用模型,没有说明可下载的检查点、已确认的许可证、参数量或硬件要求。
API 单价很直观,但实际成本没那么简单
目前最清晰的公开价目表来自 OpenRouter Muse Spark 1.3 页面,而不是 Meta 的发布文章。OpenRouter 列出的标准输入和输出价格分别为每百万 token 1.25 美元和 4.25 美元,此外还有单独的缓存读取和网页搜索费用。
| 用量类型 | 标价 | 需要注意 |
|---|---|---|
| 输入 | 每 1M token 1.25 美元 | 新提交的提示词和上下文 token |
| 输出 | 每 1M token 4.25 美元 | 约为输入价格的 3.4 倍 |
| 缓存读取 | 每 1M token 0.15 美元 | 适合重复使用智能体上下文 |
| 网页搜索 | 每 1,000 次调用 2.50 美元 | 与 token 费用分开计算 |
如果一次请求包含 100,000 个新输入 token 和 20,000 个输出 token,在不计算缓存或网页搜索费用的情况下,成本约为0.21 美元:输入费用为 0.125 美元,输出费用为 0.085 美元。但在实际智能体任务中,循环调用、重试和重复传入上下文都会推高完整任务的成本。
Artificial Analysis 的报告显示,在缓存命中、输入和输出分别占 7:2:1 的组合下,混合价格为每百万 token 0.78 美元。使用全新上下文或输出量较大的工作流,实际成本会更高,因此应把这个数字视为某种场景下的估算,而不是通用价格。
不要把Muse Spark 1.2 API 价格指南中的 Contributor 假设自动套用到 Muse Spark 1.3。1.3 的公开列表已经确立了上面的标准价格,但本文核查的资料并没有确认一份完整的 1.3 Contributor 合同,涵盖数据使用、速率限制或区域可用性。在供应商明确说明之前,建议按标准价格做预算。
现有证据说明它是强力编程模型,但还谈不上全面领先
目前的证据足以支持这样一个判断:Muse Spark 1.3 是一款强大的编程和长上下文模型,但不是所有任务上的通用冠军。下表采用Meta 提供的评测方法中的分数。不同基准的量表并不相同,分数只有在同一行内才适合比较。
| 评测项目 | Muse 1.3 max | Muse 1.3 xhigh | Muse 1.2 xhigh | GPT-5.6 Sol | Claude Opus 5 | 表中最高分 |
|---|---|---|---|---|---|---|
| MRCR 512K–1M | 98.1 | 93.1 | 55.5 | 73.8 | — | Muse 1.3 max |
| DeepSWE v1.1 | 75.4 | — | 55.0 | 73.0 | 74.0 | Muse 1.3 max |
| SWE-Atlas Codebase QnA | 59.4 | 54.0 | 46.2 | 53.5 | 52.7 | Muse 1.3 max |
| Terminal-Bench 2.1 | 88.8 | 89.2 | 82.9 | 88.8 | 86.7 | Muse 1.3 xhigh |
| OSWorld 2.0 | 66.9 | 57.2 | 47.6 | 62.7 | 68.3 | Claude Opus 5 |
| DeepSearchQA | 89.4 | 89.4 | 85.9 | 93.0 | 90.4 | GPT-5.6 Sol |
| GDPVal-AA v2 | 1754 | 1709 | 1615 | 1710 | 1824 | Claude Opus 5 |
Muse Spark 1.3 最突出的优势在长上下文编程:在 512K–1M 上下文的 MRCR 测试中,max 结果达到98.1;DeepSWE 得分为75.4。相比之下,Muse Spark 1.2 xhigh 的对应分数分别为 55.5 和 55.0。但同一张表也显示,在部分专业工作、电脑操作和浏览类评测中,其他模型表现更强。
Meta 的方法说明指出,表格中的数据可能来自 Meta 自行评测、官方排行榜,或供应商自行报告的结果。编程测试使用了受限工具,且不允许访问外部互联网,因此这些结果可以作为有价值的信号,却不能视为一次由独立机构完整复测的横向比较。
Artificial Analysis 的报告给出了61 分的 Intelligence Index,在 196 个可比较模型中排名第 10,而可比较模型的中位数为 36。ModelCap 显示,它的 ModelCap Index 为 81.7,排行榜位置为第 4,但支持度只有 20%,且仅有一次公开基准观察。不同评测系统得出的结果共同指向一个谨慎结论:目前的证据基础仍然偏薄。
如果要放进真实工作流,建议先在代码仓库探索、长时间运行的终端智能体,以及代码库问答任务上测试 Muse Spark 1.3。不要把这些结果直接推广到所有重度依赖浏览或专业电脑操作的任务。
速度上的矛盾:生成很快,开始很慢
Muse Spark 1.3 在真正开始生成后似乎很快,但用户看到第一个答案可能要等更久。因此,它更适合持续运行或批处理任务,而不是要求每一轮都立刻响应的交互式编程循环。
Artificial Analysis 报告称,它的输出速度为每秒 181.7 个 token,而可比较模型的中位数为 68.1。该报告还显示,它的首 token 延迟为 27.51 秒,对比中位数为 3.04 秒;在其工作负载下,生成 500 个 token 的响应预计需要41.26 秒。其供应商页面显示,首次答案 token 的耗时为38.51 秒,每个 Intelligence Index 任务的成本为 0.55 美元。
OpenRouter 展示的是另一组 P50 数据:每秒 62 个 token和1.83 秒延迟。这些指标不能直接横向比较,因为两个页面采用了不同的工作负载和定义;此外,Artificial Analysis 的首次答案指标还包含推理时间。实际接入时,最好在自己的测试框架中同时记录首 token 延迟和完整任务耗时。
“既然有几个人在问,这是我的初步感受(现在还在跑):感觉很机械(非常适合干活,但不确定是否适合策略任务),能力很强。看起来非常快。”——u/NewYak4281,r/singularity
这条未经控制的早期反馈,与测得的取舍基本一致:开始生成后速度很快,但前面可能需要等待较长时间,而且交互风格可能显得机械。它可以作为背景信息参考,却不能替代受控测试。
正式上线前,先确认 API 能力与发布限制
Muse Spark 1.3 具备现代智能体模型通常需要的集成功能,但一些生产环境细节仍取决于供应商,或者尚未公开。当前最有力的 API 证据来自 OpenRouter 的实时模型页面和 Artificial Analysis 的供应商跟踪页,而不是发布文章中一份完整的 Meta 官方规格说明。
| 能力或限制 | 当前证据 | 对生产环境的影响 |
|---|---|---|
| 上下文窗口 | OpenRouter 和 ModelCap 列出1,048,576 个 token | 确认实际调用端点的有效上限 |
| 最大输出 | ModelCap 列出944K token | 供应商级别的输出限制可能更低 |
| 输入类型 | 文本、图片、视频和文件;音频虽被列出,但带有警告 | 应将音频理解视为尚不完整 |
| 输出类型 | 文本 | 按文本中介工作流进行规划 |
| 工具调用 | 标记为支持 | 在所用 SDK 中测试 schema 和工具错误处理 |
| 结构化输出 | 列出了 JSON-schema 响应格式 | 测试严格 schema 下的失败情况 |
| 供应商覆盖 | OpenRouter 页面和 Artificial Analysis 跟踪页目前只显示一个 Meta 供应商 | 不要默认存在故障转移冗余 |
| 模型权重 | 仅提供 API;未列出可下载权重 | 尚未建立自托管路径 |
ModelCap 提醒,单个供应商实际开放的上下文或输出上限,可能低于公开的最大值。OpenRouter 的可用性面板显示,过去三天的正常运行时间为 99.97%,但在 72 小时和 24 小时视图中显示的可用性更低。由于这些是页面上的不同指标,生产流量路由时应结合最新状态数据和自己的错误日志进行判断。
Meta 在发布文章中没有公布参数量、架构、正式 API 速率限制、许可条款或详细的安全测试结果。Meta 确实声称模型对提示注入的抵抗力更强,也更善于判断不可逆操作,但没有给出攻击成功率或可复现的红队测试方案。
现在适合使用 Muse Spark 1.3 吗?
如果你的任务是长上下文编程或大量使用工具的智能体,而且低 token 成本和持续生成能力比即时首响应更重要,那么 Muse Spark 1.3 值得现在就开始测试。但对于对延迟敏感、重度依赖音频、涉及隐私,或必须具备高冗余能力的系统,它还不适合作为唯一的生产模型。
| 你的场景 | 建议 |
|---|---|
| 大型代码仓库、代码库问答、长时间终端任务 | 优先测试 Muse Spark 1.3 |
| 看重输出速度的批处理智能体任务 | 值得尝试,但要测量完整任务成本 |
| 交互式结对编程 | 只有在能接受首 token 延迟时才使用 |
| 音频驱动的工作流 | 等待,或选择已确认支持音频的方案 |
| 敏感客户代码或受监管数据 | 先确认数据处理协议 |
| 需要故障转移的关键任务服务 | 保留第二个模型和路由方案 |
与其再看一张排行榜截图,不如进行一次低风险的小规模上线:
- 从非敏感代码仓库开始,准备五到十个固定任务。
- 将 shell、文件写入、网络和破坏性工具限制在最低权限。
- 记录完成率、工具调用次数、首 token 延迟、耗时、token 用量和账单成本。
- 用当前基线模型执行同一批任务,并为超时或低置信度修改保留备用方案。
可以先通过实验开关将 Muse Spark 1.3 接入编程智能体,然后根据代码仓库测试结果做决定,而不是依据发布当天的排名。它的价格和长上下文成绩足以证明测试价值;但较慢的初始响应、有限的供应商资源、尚不完整的音频支持,以及仍处于初步阶段的基准测试,都说明现在不宜完全押注于它。
Muse Spark 1.3 API 与价格常见问题
Muse Spark 1.3 已正式发布吗?
是的。Meta 在 2026 年 9 月 2 日的公告中表示,Muse Spark 1.3 已开始接入 Muse Code 和 Meta Model API。max reasoning 当时仍在等待额外的安全测试。
在哪里可以访问 Muse Spark 1.3?
Meta 提到了 Muse Code 和 Meta Model API。OpenRouter 也列出了 meta/muse-spark-1.3;实际能否访问,可能取决于供应商、账户和所在地区。
Muse Spark 1.3 的价格是多少?
OpenRouter 列出的价格为:每百万输入 token 1.25 美元、每百万输出 token 4.25 美元、每百万缓存读取 token 0.15 美元,以及每 1,000 次网页搜索调用 2.50 美元。除非你的直接供应商确认了自己的价目表,否则应将这些视为本文引用的 OpenRouter 价格。
Muse Spark 1.3 有一百万 token 的上下文窗口吗?
OpenRouter 和 ModelCap 列出1,048,576 个 token,而 Artificial Analysis 将其四舍五入为 1 million。请确认你实际调用的端点所支持的上下文和输出上限。
它支持视觉、视频、工具和 JSON 输出吗?
OpenRouter 列出了文本、图片、视频和文件输入,同时支持工具调用和 JSON-schema 结构化输出。它也列出了音频输入,但特别警告音频理解尚未得到完整支持。
Muse Spark 1.3 是开源模型,或可以自行托管吗?
本文核查的资料没有确认可下载权重或自托管软件包。Meta 将开放权重描述为未来路线图上的工作,而不是已经提供的 Muse Spark 1.3 产物。
max reasoning 已经可以使用了吗?
Meta 表示,现有推理模式会先开放,max reasoning 则要等额外安全测试完成后推出。公告没有给出明确日期。
可以假设 Muse Spark 1.2 的 Contributor 价格适用于 1.3 吗?
不可以。1.2 的 Contributor 条款另有文档说明,但本文核查的资料没有确认一份完整的 1.3 Contributor 合同。在供应商确认不同的层级、数据政策和速率限制之前,应按标准 1.3 价格做预算。
在投入生产环境前,先对一个小型、非敏感的代码仓库进行基准测试:用当前模型执行同一批任务,同时记录首 token 延迟、完成的修改、工具调用次数和成本。相比发布当天的排名,这些数据更能可靠地回答是否适合部署。