2025-01-15
字节随 Doubao 1.5 Pro 发布 Doubao-1.5-vision-pro
字节发布 Doubao 视觉理解模型 Doubao-1.5-vision-pro,在多模态数据处理与动态分辨率上进行全面升级。该模型针对富文本图像推理与中文文档工作流,定价与纯文本 1.5 Pro 兄弟模型保持一致的激进策略。
TheRouter 编辑重写aibase.com ↗
Doubao 1.5 Vision Pro (32k context) — extended-context vision-language variant.
Doubao-1.5-vision-pro-32k 是字节于 2025 年 1 月随 Doubao 1.5 Pro 同期发布的旗舰视觉语言模型(模型 ID 后缀 250115)。它在 1.5 Pro 稀疏 MoE 架构基础上,对多模态数据处理、动态分辨率和细粒度图文对齐进行了全面升级,在富文本图像理解与视觉推理任务上表现突出。
对 TheRouter 路由层用户而言,Doubao-1.5-vision-pro-32k 是一个性价比高的中文优先多模态端点,支持标准 OpenAI vision chat 格式。它在文档问答、图表/表格提取、OCR 重度工作流和 GUI 理解场景上表现优异,价格远低于 GPT-4o 或 Claude 3.5 Sonnet 视觉版。该模型通过 api.therouter.ai/v1 完全可达,并使用与纯文本 1.5 Pro 兄弟模型相同的生产级推理栈(PD 分离、W4A8 量化)。
| 类型 | 费率 |
|---|---|
| 输入 | $0.486 每百万 Tokens |
| 输出 | $1.46 每百万 Tokens |
| 发布日期 | 2025-01-15www.aibase.com ↗ | 已核实 |
| 架构 | 稀疏 MoE 视觉语言模型(Doubao-1.5-pro 的视觉扩展)team.doubao.com ↗ | 已核实 |
| 输入模态 | 文本 + 图像(无原生视频)www.volcengine.com ↗ | 已核实 |
| 许可 | 封闭(仅 API) | 已核实 |
| 训练数据截止 | 未公开披露 | 未知 |
| Benchmark | Distribution | Score | Source |
|---|---|---|---|
DocVQA 富文本文档理解能力强;在 2025 年 MLLM 中报告分数最高之一。 | 96.7%% | arxiv.org ↗ | |
InfoVQA 信息图与图表推理表现优秀。 | 89.3%% | arxiv.org ↗ | |
VisuLogic 该视觉推理基准中对比模型中的最高分(仍比人类低 23+ 分)。 | 28.1%% | arxiv.org ↗ | |
ChartQA 图表与表格提取能力具有竞争力;OCR-Reasoning 论文中报告了具体数值。 | Strong | arxiv.org ↗ |
所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。
curl https://api.therouter.ai/v1/chat/completions -H "Content-Type: application/json" -H "Authorization: Bearer $THE_ROUTER_API_KEY" -d '{
"model": "doubao/doubao-1-5-vision-pro-32k",
"messages": [
{"role": "user", "content": "Summarize the key points from this input."}
]
}'curl https://api.therouter.ai/v1/chat/completions \
-H "Authorization: Bearer $THEROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model":"doubao/doubao-1-5-vision-pro-32k",
"messages":[{"role":"user","content":[
{"type":"text","text":"请用中文描述这张图片中的表格内容。"},
{"type":"image_url","image_url":{"url":"https://therouter.ai/assets/vision-sample.png"}}
]}]
}'字节发布 Doubao 视觉理解模型 Doubao-1.5-vision-pro,在多模态数据处理与动态分辨率上进行全面升级。该模型针对富文本图像推理与中文文档工作流,定价与纯文本 1.5 Pro 兄弟模型保持一致的激进策略。
支持。它接受与其他通过 TheRouter 暴露的 OpenAI 兼容视觉模型相同的 chat.completions 载荷结构(含 image_url 内容块)。
| 来源 | URL | 采集于 | |
|---|---|---|---|
| 发布日期 | www.aibase.com ↗ | 2026-05-26 | 已核实 |
| 架构 | team.doubao.com ↗ | 2026-05-26 | 已核实 |
| 输入模态 | www.volcengine.com ↗ | 2026-05-26 | 已核实 |
| 许可 | — | — | 已核实 |
| 训练数据截止 | — | — | 未知 |
| DocVQA | arxiv.org ↗ | 2026-05-26 | 已核实 |
| InfoVQA | arxiv.org ↗ | 2026-05-26 | 已核实 |
| VisuLogic | arxiv.org ↗ | 2026-05-26 | 已核实 |
| ChartQA | arxiv.org ↗ | 2026-05-26 | 待核实 |
| 字节随 Doubao 1.5 Pro 发布 Doubao-1.5-vision-pro | aibase.com ↗ | 2026-05-26 | 已核实 |
| Doubao-1.5-vision-pro-32k 是否支持标准 OpenAI image_url 格式? | src ↗ | 2026-05-26 | 待核实 |