AIREITER
QwenText Chat

Qwen3.8 Flash

Qwen3.8 Flash 是一款专为编程、Agent 及长文档打造的高速模型。支持 1M 上下文。每百万 Token 输入约 $0.057,输出约 $0.193。

输入官方 $0.1143 每 100 万 TokensAIReiter $0.0571 每 100 万 Tokens输出官方 $0.3857 每 100 万 TokensAIReiter $0.1929 每 100 万 Tokens缓存读取官方 $0.0143 每 100 万 TokensAIReiter $0.0071 每 100 万 Tokens缓存创建官方 $0.1429 每 100 万 TokensAIReiter $0.0714 每 100 万 Tokens
使用 API 运行

输入

输出

Example
Generated in
42.7 seconds
输入 Token
134
输出 Token
2354
Tokens per second
55.13 tokens / second
Time to first token
-

模型详情

在 Playground、API 请求和内部工作流中使用相同的模型 key。

模型 ID
qwen3.8-flash
供应商
Qwen
协议
OpenAI Chat Completions
上下文窗口
1,000,000 Token
最大输出
131,072 Token
输入 Token
5.7143 credits / 1M Token
输出 Token
19.2857 credits / 1M Token
缓存读取
0.7143 credits / 1M Token
缓存写入
7.1429 credits / 1M Token

专为编程与长文本工作打造的高速 Qwen 模型

Qwen3.8 Flash 是阿里巴巴 Qwen3.8 系列的高速版本,专为编程、工具调用 Agent 以及无法在简短对话中容纳的长文档而设计。

大模型,低成本

总参数量达 1250 亿,每个 Token 仅激活约 60 亿参数。这也是它能保持超快响应且足够经济、轻松应对高并发任务的原因。

100 万 Token 上下文

单次请求即可放入超长规范文档、海量文件或完整的 Agent 运行轨迹。单次回复最长可达 131,072 个 Token。

支持图像与文本输入

模型不仅支持纯文本,还能理解屏幕截图、图表及各类文档。非常适合从屏幕画面开始的任务。

约 $0.057 / $0.193

每百万 Token 输入约 $0.057,输出约 $0.193,大约是官方公开定价的一半。缓存输入更便宜。上方价格栏显示的是实时费率。

Qwen3.8 Flash 的核心优势

根据 Qwen 随 2026 年 8 月版本发布的官方模型文档,Flash 在所对比的模型中,编程与工具调用能力表现最为优异。

代码库级任务

SWE-bench Pro 得分 62.5,SWE-bench Multilingual 得分 81.0。可用于定位 Bug、编辑多个文件并验证结果。

工具调用 Agent

DeepSWE 58.7,Toolathlon 73.5。能够稳定维持多步循环流程:分析失败原因、调用工具并重试。

代码与高难度问题

LiveCodeBench v6 为 91.9,GPQA Diamond 为 91.7。竞赛级编程与科学类难题皆能游刃有余。

屏幕视觉理解

OSWorld 部分得分 52.3;MathVision 得分 90.6(可运行代码时达 95.7)。可将屏幕截图和图表连同问题一起输入。

Flash 还是 Max?

Flash 适合全天候持续运行;当任务难度远比预算更关键时,Max 则是旗舰之选。
01

选择 Flash

适用于编程 Agent、测试与修复循环、长文档,以及任何注重预算成本的工作负载。1M 窗口支持完整涵盖超长轨迹,无需拆分。

02

选择 Max

Qwen3.8 Max 是拥有 2.4 万亿参数的旗舰模型。当您需要最强性能的 Qwen 且 Token 成本居于次要时,请选择它。可在 /chat/qwen3-8-max 体验。

03

相同的请求格式

两款模型均采用标准的 chat completion 请求格式。使用 Flash 时,将 model 设置为 qwen3.8-flash。当回答需要较长轨迹时,可调高 max_tokens(默认值为 8,192,上限为 131,072)。

常见问题

上下文、价格、图像支持以及与 Max 的对比。

/ 01

Qwen3.8 Flash 的用途是什么?

快速编程、工具调用智能体和长文档处理。它是更经济、更迅速的 Qwen3.8,而不是 Max 的简单缩小版。

/ 02

上下文长度是多少?

100 万 tokens。单次回复上限可达 131,072 个 tokens。

/ 03

费用是多少?

每百万 token 输入约 $0.057,输出约 $0.193,约为官方标价的一半。从缓存读取成本更低。每次工具调用不收取额外费用。价格栏显示的是实时费率。

/ 04

它能读取图像吗?

可以。截图、图表和文档图像与文本一样均受该模型原生支持。

/ 05

什么时候应该改用 Qwen3.8 Max?

当您需要旗舰级性能且愿意为每个 token 支付更高费用时。Max 是 2.4T 模型,而 Flash 则更适合大批量、高吞吐的调用场景。