← 全部文章

Qwen3.8-Omni-Flash API 指南:DashScope 上的原生音频、视频、图像与文本理解

通过 DashScope 的 OpenAI 兼容接口集成 Qwen3.8-Omni-Flash 的实用指南。涵盖模型 ID、全模态输入(文本 + 图像 + 音频 + 视频)、思考模式、函数调用、实时 WebSocket 变体、按模态计费方式,以及通过 TheRouter 进行路由。

· TheRouter

Qwen3.8-Omni-Flash 是 Qwen 系列中第一个原生全模态模型。2026 年 9 月 17 日在 DashScope 上线后,它能够在一次 API 调用中同时接受文本、图像、音频和视频输入,返回文本输出。配套的实时变体 qwen3.8-omni-flash-realtime 增加了 WebSocket 和 WebRTC 流式传输能力,支持实时音视频对话。本指南从第一个 API 调用讲到生产环境路由,全面覆盖两个模型的使用方法。

Qwen3.8-Omni-Flash 有何不同

大多数多模态模型的做法是将视觉能力嫁接到文本骨干网络上。Qwen3.8-Omni-Flash 从底层开始就按全模态智能体模型来设计,四种模态输入统一处理,在单次前向传播中完成跨模态推理。

Qwen 官方博客 和 DashScope 模型列表 列出了以下核心规格

  • 输入模态 涵盖文本、图像、音频、视频
  • 输出 为文本(实时变体额外支持音频输出)
  • 上下文窗口 达 100 万 token
  • 思考模式 已支持(链式思考推理)
  • 函数调用 已支持
  • 联网搜索 已支持
  • 上下文缓存 已支持
  • API 兼容性 方面,通过 DashScope 支持 OpenAI Chat Completions 和 Responses API

这个模型瞄准的是真实场景下的智能体生产力。它不仅能理解多模态内容,还能通过函数调用和联网搜索来采取行动,再用思考模式对复杂任务进行逐步推理。

两个模型 ID,两种接入方式

DashScope 通过两个模型 ID 提供 Qwen3.8-Omni-Flash 的服务,分别对应不同的使用场景。

模型 ID协议输入输出适用场景
qwen3.8-omni-flashHTTP (Chat Completions / Responses)文本、图像、音频、视频文本批量分析、文档处理、异步工作流
qwen3.8-omni-flash-realtimeWebSocket、WebRTC流式音频、视频帧、文本文本 + 音频实时对话、语音助手、视频通话

离线模型(qwen3.8-omni-flash)使用你熟悉的 OpenAI 兼容 HTTP API。实时模型(qwen3.8-omni-flash-realtime)需要持久连接,持续流式传输输入和输出。

快速上手离线 API

第一步:获取 API 密钥

在阿里云百炼平台注册账号,从控制台生成 DashScope API 密钥。

第二步:配置 OpenAI SDK

from openai import OpenAI

client = OpenAI(
    api_key="your-dashscope-api-key",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
)

国际地区用户请使用 https://dashscope-intl.aliyuncs.com/compatible-mode/v1。

第三步:文本 + 图像理解

response = client.chat.completions.create(
    model="qwen3.8-omni-flash",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "text", "text": "这张架构图中展示了哪些组件?"},
                {"type": "image_url", "image_url": {"url": "https://example.com/architecture.png"}},
            ],
        }
    ],
)
print(response.choices[0].message.content)

第四步:音频理解

response = client.chat.completions.create(
    model="qwen3.8-omni-flash",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "text", "text": "请转录并总结这段会议录音。"},
                {"type": "audio_url", "audio_url": {"url": "https://example.com/meeting.mp3"}},
            ],
        }
    ],
)
print(response.choices[0].message.content)

第五步:视频分析

response = client.chat.completions.create(
    model="qwen3.8-omni-flash",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "text", "text": "描述这个产品演示中发生了什么。"},
                {"type": "video_url", "video_url": {"url": "https://example.com/demo.mp4"}},
            ],
        }
    ],
)
print(response.choices[0].message.content)

三种模式用的是同一个 Chat Completions 端点。模型自动识别输入模态并进行原生处理,不需要走单独的管线。

思考模式

Qwen3.8-Omni-Flash 支持显式推理模式,先产出链式思考过程再给出最终答案。当处理复杂的多模态查询,需要模型逐步分析视觉或听觉证据时,这个功能很有用。

启用方式请参考 DashScope 思考模式文档。参数格式可能有变化,请以 DashScope 当前文档为准。

函数调用

模型支持 OpenAI 兼容的函数调用。你可以定义工具,让 Qwen3.8-Omni-Flash 根据多模态上下文自主决定是否调用。

tools = [
    {
        "type": "function",
        "function": {
            "name": "search_inventory",
            "description": "根据视觉描述搜索产品库存",
            "parameters": {
                "type": "object",
                "properties": {
                    "description": {"type": "string"},
                    "category": {"type": "string"}
                },
                "required": ["description"]
            }
        }
    }
]

response = client.chat.completions.create(
    model="qwen3.8-omni-flash",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "text", "text": "在库存中查找这件商品。"},
                {"type": "image_url", "image_url": {"url": "https://example.com/item.jpg"}},
            ],
        }
    ],
    tools=tools,
)

模型还可以将联网搜索作为内置工具使用,检索最新信息来补充多模态理解。

实时变体

qwen3.8-omni-flash-realtime 于 2026 年 9 月 21 日上线,比离线模型晚四天。它支持三种连接协议。

  • WebSocket,标准双向流式传输
  • WebRTC,为浏览器端音视频优化
  • AOQ,阿里巴巴自有的低延迟协议

实时模型在基础模型能力之上增加了多通道音频聚合、视频帧聚合和远程 MCP 工具调用。它同时输出文本和音频,适用于语音助手和视频通话应用。

实时变体的 API 文档请参见 DashScope 实时模型指南。

计费

Qwen3.8-Omni-Flash 属于 DashScope Flash 计费档位。文本 token 费率来自第三方聚合平台,已与 OpenRouter 和 DashScope 定价页 交叉验证。

模态输入 (每百万 token)输出 (每百万 token)
文本约 $0.15约 $0.47
音频高于文本(按模态单独计价)不适用(仅文本输出)
视频高于文本(按模态单独计价)不适用(仅文本输出)
图像与视觉模型相同(按模态单独计价)不适用(仅文本输出)

实时变体的音频输出在文本输出费率之外单独计费。人民币标价的详细费率见官方定价页,美元金额为近似值,取决于汇率。

上下文缓存对已缓存的输入 token 有折扣,规则与 DashScope 上的其他 Qwen3.8 模型一致。

对比:Omni-Flash vs Qwen3.8-Flash vs GPT-4o

特性Qwen3.8-Omni-FlashQwen3.8-FlashGPT-4o
文本输入支持支持支持
图像输入支持支持支持
音频输入支持不支持支持
视频输入支持支持(帧)有限
音频输出仅实时变体不支持仅 Realtime API
上下文窗口100 万100 万128K
思考模式支持支持不支持(需用 o3/o4)
函数调用支持支持支持
联网搜索支持支持通过工具
实时流式WebSocket/WebRTC/AOQ不支持WebSocket
文本输入定价约 $0.15/1M约 $0.15/1M$2.50/1M

Qwen3.8-Omni-Flash 在多模态工作负载的成本上比 GPT-4o 有明显优势。相应的取舍在于生态成熟度。OpenAI 的工具链和第三方集成更广泛,DashScope 的 OpenAI 兼容端点覆盖了核心 API 接口。

对于已经在用 Qwen3.8-Flash 处理文本和图像任务的团队,Omni-Flash 在不改变 API 集成方式的前提下增加了音频和视频理解能力。唯一需要改的代码就是模型 ID。

通过 TheRouter 路由

如果你通过 TheRouter 路由 OpenAI 兼容请求,可以将 DashScope 配置为供应商,把全模态请求导向 qwen3.8-omni-flash,同时将纯文本请求导向更便宜的模型。

TheRouter 通过已配置的供应商路由 OpenAI 兼容请求,在产品路径支持的情况下提供供应商/模型路由和回退功能,并在已实现的范围内提供统一的计费/记账界面。

按模态路由是一种合理的策略。将包含音频或视频内容的请求发送到 Omni-Flash,将纯文本或文本+图像的请求根据复杂度路由到 Qwen3.8-Flash 或 Qwen3.8-Max。这样既能保证简单查询的成本最低,又能确保多模态请求到达有能力的模型。

回退配置详见模型回退指南。

常见问题

Qwen3.8-Omni-Flash 能生成音频或图像吗?

离线模型(qwen3.8-omni-flash)只输出文本。实时变体(qwen3.8-omni-flash-realtime)可以在文本之外输出音频。两者都不能生成图像或视频。

支持哪些音频格式?

模型通过 URL 接受 MP3、WAV 等常见音频格式。完整的支持格式和大小限制请查阅 DashScope 文档。

100 万 token 上下文窗口在音频和视频场景下如何运作?

音频和视频的 token 化方式与文本不同。一分钟的音频片段或一段短视频可能会占用上下文窗口中可观的份额。具体的 token/时长换算比例取决于编码方式,可在 DashScope 模型卡中查阅。

海外地区能使用这个模型吗?

可以。DashScope 在新加坡地区(ap-southeast-1)可用,使用国际端点。将 https://dashscope-intl.aliyuncs.com/compatible-mode/v1 设为 base URL 即可。

能配合 Claude Code 或 OpenAI Codex 使用吗?

DashScope 提供 OpenAI 兼容端点,任何支持自定义 base_url 的工具都可以指向 DashScope 并使用 qwen3.8-omni-flash 作为模型 ID。但全模态特性(音频/视频输入)要求工具在 messages 数组中传递这些内容类型,目前大多数编码智能体还做不到这一点。

Omni-Flash 和 Qwen3.5-Omni 有什么区别?

Qwen3.8-Omni-Flash 是后继者。它基于 Qwen3.8 架构构建,改进了智能体能力,增强了函数调用,集成了联网搜索,多模态任务的基准测试分数也更高。Qwen3.5-Omni 系列仍然可用,但新项目建议选择 3.8 Omni-Flash。

参考来源

帮助与联系