Qwen3.7-Flash API 指南:Flash 价位的多模态推理模型
Qwen3.7-Flash 实用指南 — Qwen3.7 系列首款 Flash 档位模型。涵盖 API 接入、多模态输入、思考模式、定价,以及通过 TheRouter 路由。
Qwen3.7-Flash 是阿里巴巴 Qwen3.7 系列的首款 Flash 档位模型。2026 年 7 月 25 日在百炼(DashScope)上线,它以 Flash 定价提供多模态推理能力 — 支持文本、图片和视频理解。如果你需要百万 token 上下文、思考模式和完整的 function calling 支持,又不想付 Max 或 Plus 的价格,从这里开始。
我们写这篇指南是因为 Qwen3.7-Flash 补全了 3.7 系列的拼图。我们之前的 百炼 Qwen3.7 系列完整指南 覆盖了 Max(文本推理)和 Plus(多模态),当时 Flash 尚未发布。现在它来了 — 而且它是即将下线的 qwen-turbo 系列的指定低成本替代方案。完整下线时间表见 2026 年 10 月百炼大规模模型下线迁移指南。
OpenAI 兼容指供应商提供一个 chat-completions 接口,其请求与响应结构与 OpenAI API 契约足够接近——只需替换三个值(API key、base URL、模型名),原来的 OpenAI SDK 调用即可直接工作。最小实践面是POST /v1/chat/completions 带 messages、model, 并返回 OpenAI 形式的流式响应。
Qwen3.7-Flash 一览
| Qwen3.7-Flash | Qwen3.7-Plus | Qwen3.7-Max | |
|---|---|---|---|
| 模态 | 文本 + 图片 + 视频 → 文本 | 文本 + 图片 + 视频 → 文本 | 文本 → 文本 |
| 上下文窗口 | 1,000,000 tokens | 1,000,000 tokens | 1,000,000 tokens |
| 最大输出 | 16,384 tokens | 32,768 tokens | 65,536 tokens |
| 思考模式 | 支持 | 支持 | 支持 |
| Function Calling | 支持 | 支持 | 支持 |
| 内置工具 | 支持(搜索、代码解释器) | 支持 | 支持 |
| 结构化输出 | 支持 | 支持 | 不支持 |
| 输入价格 | ¥0.5 /百万 tokens | ¥2 /百万 tokens(≤256K) | ¥12 /百万 tokens(限时 5 折) |
| 输出价格 | ¥2 /百万 tokens | ¥8 /百万 tokens(≤256K) | ¥36 /百万 tokens(限时 5 折) |
| Model ID | qwen3.7-flash、qwen3.7-flash-2026-07-15 | qwen3.7-plus | qwen3.7-max |
价格为华北2(北京)区域。国际区域有加价系数。来源:百炼模型定价、模型总览,获取于 2026-07-27。
3 分钟快速开始
第一步 — 获取 API Key
在阿里云百炼控制台注册并创建 API Key。新用户有 100 万 token 免费额度,有效期 90 天。
第二步 — 安装 OpenAI SDK
pip install openai
第三步 — 发送第一个请求
from openai import OpenAI
client = OpenAI(
api_key="sk-your-dashscope-key",
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
model="qwen3.7-flash",
messages=[
{"role": "user", "content": "介绍 Qwen3.7 系列 Flash 和 Plus 模型的区别。"}
],
)
print(response.choices[0].message.content)
就这么简单。百炼端点兼容 OpenAI — 同样的 SDK、同样的请求格式,只需改 base_url 和 model。
多模态输入:Flash 价位的图片和视频理解
Qwen3.7-Flash 可以在文本旁边接收图片和视频帧。相比前代 qwen3.6-flash(纯文本),这是一次重大升级。你可以直接在 content 数组中传入图片 URL:
response = client.chat.completions.create(
model="qwen3.7-flash",
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "这张图片里展示的是什么产品?提取价格和促销文案。"},
{"type": "image_url", "image_url": {"url": "https://example.com/product-photo.jpg"}},
],
}
],
)
对于视频输入,百炼支持传入 video 类型的 content,附带视频文件 URL。模型会处理采样帧并返回文本分析结果。
Flash 多模态的典型场景
- 商品图信息提取 — 从电商截图中提取 SKU、价格、促销文案
- 单据理解 — 收据、发票、名片、表单
- UI/截图分析 — 提取文本、布局结构、描述界面元素
- 视频帧摘要 — 短视频片段分析、监控帧描述
对于复杂的视觉推理(架构图、多步视觉问答、截图转代码),Qwen3.7-Plus 仍然更合适。Flash 在吞吐量和成本上优化,而非视觉推理深度。
思考模式:逐步推理
Qwen3.7-Flash 支持思考模式 — 模型在输出最终答案前先生成内部的思维链。通过 enable_thinking 参数开启:
response = client.chat.completions.create(
model="qwen3.7-flash",
messages=[
{"role": "user", "content": "一家商店苹果 3 元一个,买 5 送 1。18 个苹果多少钱?"}
],
extra_body={
"enable_thinking": True,
"thinking_budget": 4096,
},
)
# 思维链在 response.choices[0].message.reasoning_content
# 最终答案在 response.choices[0].message.content
thinking_budget 参数(token 数)控制模型在回答前可以使用多少推理空间。更高的 budget 产生更充分的推理,但成本也更高。省略该参数时模型使用默认 budget。
对于速度优先的任务 — 简单问答、文本提取、分类 — 关闭思考模式。对于数学、逻辑题和多步规划,打开它。
支持的 Model ID 和快照
| Model ID | 说明 |
|---|---|
qwen3.7-flash | 最新版本(当前指向 qwen3.7-flash-2026-07-15) |
qwen3.7-flash-2026-07-15 | 2026 年 7 月 15 日快照 |
生产环境建议使用无版本号的 qwen3.7-flash 以自动获取更新。需要可复现输出时(例如评测管线或合规场景),固定使用快照 ID qwen3.7-flash-2026-07-15。
来源:百炼模型上下架与更新,获取于 2026-07-27。
常见错误与解决方法
| 错误 | 原因 | 解决 |
|---|---|---|
model_not_found | Model ID 拼写错误或区域不匹配 | 使用准确的 ID qwen3.7-flash。确认 API Key 对应北京区域(或使用对应区域的 base URL)。 |
context_length_exceeded | 输入 + 输出超过 1M tokens | 裁剪上下文或拆分为多个请求。 |
rate_limit_exceeded | 每分钟请求数超限 | 实现指数退避。考虑升级百炼账户层级以提高 RPM 限制。 |
invalid_request_error(图片相关) | 图片 URL 从百炼服务器无法访问 | 使用公开可访问的 URL 或通过百炼文件 API 上传。也支持 base64 编码图片。 |
| 思维链内容为空 | 未设置 enable_thinking 或模型处于非思考模式 | 在 extra_body 中传入 enable_thinking: true。 |
生产环境 Checklist
速率限制
百炼的速率限制因账户层级而异。免费层级足够开发使用。生产环境建议升级到付费层级或购买 Token Plan 以获得更高的 RPM 和 TPM 额度。在百炼控制台查看当前限制。
上下文缓存
百炼对 Qwen 模型支持上下文缓存(显式和隐式)。对于有重复系统提示词或固定知识库的场景,开启缓存可将输入成本降低最多 90%。缓存命中的输入 token 按标准价格的一小部分计费。详见百炼上下文缓存文档。
批量 API
对于非延迟敏感的场景(批量文档处理、离线分析),使用百炼 Batch API。输入和输出 token 价格为实时推理的 50%。详见百炼批量推理。
结构化输出
Qwen3.7-Flash 支持结构化输出(JSON 模式)。设置 response_format: {"type": "json_object"} 可保证返回合法的 JSON — 适用于数据提取管线。
迁移:qwen-turbo → qwen3.7-flash
Qwen3.7-Flash 是即将下线的 qwen-turbo 系列的指定替代方案。如果你当前使用 qwen-turbo 或任何 qwen-turbo-* 快照,迁移只需改一行 Model ID:
- model="qwen-turbo"
+ model="qwen3.7-flash"
提升点:
- 上下文窗口从 128K 提升到 1M tokens
- 新增多模态输入(图片、视频)
- 支持思考模式和结构化输出
- 支持 Function Calling 和内置工具
注意事项:
- 最大输出 token 数不同(检查你的
max_tokens参数) - 定价结构可能不同 — 在定价页面核实
- 批量 API 折扣结构相同(实时价格的 50%)
完整的模型下线时间表和推荐替代方案,见 2026 年 10 月百炼大规模模型下线迁移指南 和 Qwen3 到 Qwen3.7 升级迁移指南。
TheRouter 集成
我们通过 OpenAI 兼容网关 路由百炼模型 — 包括 Qwen3.7-Flash。如果你使用 TheRouter,可以对 qwen3.7-flash 请求实现 provider fallback 和统一计费:
from openai import OpenAI
client = OpenAI(
api_key="your-therouter-key",
base_url="https://therouter.ai/v1",
)
response = client.chat.completions.create(
model="qwen/qwen3.7-flash",
messages=[
{"role": "user", "content": "总结这份文档。"}
],
)
TheRouter 路由 OpenAI 兼容请求到配置的 provider,并支持模型 fallback — 如果百炼触发速率限制,请求可以自动切换到托管兼容模型的其他 provider。
说明: 截至本文撰写时,Qwen3.7-Flash 尚未录入我们的模型目录。我们预计在 provider 数据更新后添加。Model ID qwen/qwen3.7-flash 遵循标准的百炼命名规范。
如何选择 Flash、Plus 还是 Max
| 场景 | 推荐 |
|---|---|
| 高吞吐文本提取、分类、简单问答 | Flash — 最低成本,最快响应 |
| 需要深度视觉推理的多模态任务,截图转代码 | Plus — 完整多模态,更高输出上限 |
| 复杂文本推理,大型代码库,法律/金融分析 | Max — 最强推理,最高输出上限 |
| 预算有限的多模态原型 | Flash — Plus 约 1/4 价格的多模态 |
| 有大量重复提示词的生产环境 | Flash + 上下文缓存 — 输入成本降 90% |
完整的 Qwen3.7 系列对比,见 百炼 Qwen3.7 系列完整指南。
本文引用来源:
- 阿里云百炼 — 模型上下架与更新(获取于 2026-07-27)
- 阿里云百炼 — 模型调用计费(获取于 2026-07-27)
- 阿里云百炼 — 文本生成模型(获取于 2026-07-27)
- 阿里云百炼 — OpenAI 兼容接口(获取于 2026-07-27)
- 阿里云百炼 — 上下文缓存(获取于 2026-07-27)
- Qwen3.7 Max/Plus/Flash 对比(阿里云开发者社区)(获取于 2026-07-27)