返回模型列表

Doubao 1.5 Vision Pro 32k

doubaodoubao/doubao-1-5-vision-pro-32k

Doubao 1.5 Vision Pro (32k context) — extended-context vision-language variant.

Doubao-1.5-vision-pro-32k 是字节于 2025 年 1 月随 Doubao 1.5 Pro 同期发布的旗舰视觉语言模型(模型 ID 后缀 250115)。它在 1.5 Pro 稀疏 MoE 架构基础上,对多模态数据处理、动态分辨率和细粒度图文对齐进行了全面升级,在富文本图像理解与视觉推理任务上表现突出。

对 TheRouter 路由层用户而言,Doubao-1.5-vision-pro-32k 是一个性价比高的中文优先多模态端点,支持标准 OpenAI vision chat 格式。它在文档问答、图表/表格提取、OCR 重度工作流和 GUI 理解场景上表现优异,价格远低于 GPT-4o 或 Claude 3.5 Sonnet 视觉版。该模型通过 api.therouter.ai/v1 完全可达,并使用与纯文本 1.5 Pro 兄弟模型相同的生产级推理栈(PD 分离、W4A8 量化)。

适合使用
  • • 中文文档问答、发票/合同提取、图表与表格理解,尤其需要原生中文 OCR 和版面理解的场景。
  • • GUI / 移动 App 理解与视觉 agent 工作流,需要对中文界面截图进行细粒度推理的场景。
不适合使用
  • • 纯英文高分辨率图像描述或艺术图像生成,Gemini-2.5 或 GPT-4o 视觉版在当前基准上领先。
上下文长度
33K
最大输出
16K
输入价格每百万 tokens
$0.486每百万 Tokens
输出价格每百万 tokens
$1.46每百万 Tokens

模态能力

文本图像→文本

能力

视觉理解

价格明细

类型费率
输入$0.486 每百万 Tokens
输出$1.46 每百万 Tokens

支持参数

temperaturemax_tokenstop_ptoolstool_choiceresponse_formatstop

模型规格

发布日期2025-01-15www.aibase.com ↗已核实
架构稀疏 MoE 视觉语言模型(Doubao-1.5-pro 的视觉扩展)team.doubao.com ↗已核实
输入模态文本 + 图像(无原生视频)www.volcengine.com ↗已核实
许可封闭(仅 API)已核实
训练数据截止未公开披露未知

基准成绩

BenchmarkDistributionScoreSource
DocVQA
富文本文档理解能力强;在 2025 年 MLLM 中报告分数最高之一。
96.7%%arxiv.org ↗
InfoVQA
信息图与图表推理表现优秀。
89.3%%arxiv.org ↗
VisuLogic
该视觉推理基准中对比模型中的最高分(仍比人类低 23+ 分)。
28.1%%arxiv.org ↗
ChartQA
图表与表格提取能力具有竞争力;OCR-Reasoning 论文中报告了具体数值。
Strongarxiv.org ↗

API 使用示例

所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。

cURL
curl https://api.therouter.ai/v1/chat/completions   -H "Content-Type: application/json"   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -d '{
    "model": "doubao/doubao-1-5-vision-pro-32k",
    "messages": [
      {"role": "user", "content": "Summarize the key points from this input."}
    ]
  }'

API 使用指南

视觉对话调用

cURL
curl https://api.therouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model":"doubao/doubao-1-5-vision-pro-32k",
    "messages":[{"role":"user","content":[
      {"type":"text","text":"请用中文描述这张图片中的表格内容。"},
      {"type":"image_url","image_url":{"url":"https://therouter.ai/assets/vision-sample.png"}}
    ]}]
  }'

doubao 其他模型

同类模型

跨供应商的相似能力档位

动态与变更

2025-01-15

字节随 Doubao 1.5 Pro 发布 Doubao-1.5-vision-pro

字节发布 Doubao 视觉理解模型 Doubao-1.5-vision-pro,在多模态数据处理与动态分辨率上进行全面升级。该模型针对富文本图像推理与中文文档工作流,定价与纯文本 1.5 Pro 兄弟模型保持一致的激进策略。

TheRouter 编辑重写aibase.com ↗

常见问题

Doubao-1.5-vision-pro-32k 是否支持标准 OpenAI image_url 格式?

支持。它接受与其他通过 TheRouter 暴露的 OpenAI 兼容视觉模型相同的 chat.completions 载荷结构(含 image_url 内容块)。

事实档案 — 本页每条断言可在此回溯来源
来源URL采集于
发布日期www.aibase.com ↗2026-05-26已核实
架构team.doubao.com ↗2026-05-26已核实
输入模态www.volcengine.com ↗2026-05-26已核实
许可——已核实
训练数据截止——未知
DocVQAarxiv.org ↗2026-05-26已核实
InfoVQAarxiv.org ↗2026-05-26已核实
VisuLogicarxiv.org ↗2026-05-26已核实
ChartQAarxiv.org ↗2026-05-26待核实
字节随 Doubao 1.5 Pro 发布 Doubao-1.5-vision-proaibase.com ↗2026-05-26已核实
Doubao-1.5-vision-pro-32k 是否支持标准 OpenAI image_url 格式?src ↗2026-05-26待核实
帮助与联系