返回模型列表

Doubao Seed 1.6 Vision

doubaodoubao/doubao-seed-1-6-vision

Doubao Seed 1.6 Vision — vision-language Seed 1.6 variant for multimodal understanding.

Doubao Seed 1.6 Vision(doubao-seed-1.6-vision-250815)是字节跳动通过火山引擎提供的通用多模态模型,属于 Seed1.6 系列稀疏 MoE 家族(230B 总参数 / 23B 激活参数)。该系列在预训练阶段即融入多模态理解,并支持 256K 上下文窗口(上游)。Vision 变体原生支持 VisualCoT——模型可在思维链中对图像进行裁剪、旋转、缩放与标注。

对 TheRouter 路由层用户而言,Doubao Seed 1.6 Vision 是性价比高的中文 provider 视觉模型,在 GUI Agent、Grounding 与视频理解场景表现突出。通过 api.therouter.ai/v1 完全兼容 OpenAI 接口,支持 temperature、max_tokens、top_p、tools/tool_choice、response_format 与 stop,与 standard-models.yaml 中列出的参数一致。

适合使用
  • • GUI Agent 与 Grounding 任务——模型需与截图、PDF 或网页 UI 交互并产生可视化推理痕迹。
  • • 视频理解与长上下文多模态工作流(教育、图像审核、巡检、安防、AI 搜索),中文语境为主的场景。
不适合使用
  • • 需要开源权重自托管的场景——Seed1.6 Vision 仅提供 API;需要权重时请选择 Qwen3-VL、InternVL 等开源 VLM。
  • • 纯英文多模态负载——Gemini 2.5 Pro 或 Claude Sonnet 4.6 在英文 VLM 基准上通常更高。
上下文长度
131K
最大输出
33K
输入价格每百万 tokens
$0.1296每百万 Tokens
输出价格每百万 tokens
$1.30每百万 Tokens

模态能力

文本图像→文本

能力

视觉理解

价格明细

类型费率
输入$0.1296 每百万 Tokens
输出$1.30 每百万 Tokens

支持参数

temperaturemax_tokenstop_ptoolstool_choiceresponse_formatstop

模型规格

发布日期2025 年 8 月(250815 快照)ohmygpt.com ↗已核实
架构230B 总参数 / 23B 激活 MoE,多模态预训练seed.bytedance.com ↗已核实
VisualCoT原生基于工具的视觉思维链(裁剪、旋转、缩放、标注)developer.volcengine.com ↗已核实
许可专有(火山引擎 API)www.volcengine.com ↗已核实
训练数据截止未公开披露未知
推理后端火山引擎(专有)www.volcengine.com ↗已核实

基准成绩

BenchmarkDistributionScoreSource
MME-SCI (image-only)
科学导向的多模态基准;闭源 Doubao-Seed-1.6 超过多数开源 VLM,但落后于顶尖 Gemini 级别模型。
41.32%%arxiv.org ↗
Gaokao 2025 (multimodal)
Seed1.6-Thinking 在 2025 山东高考六科总分中,理科排名第 2、文科排名第 1。
676 (science) / 683 (humanities)seed.bytedance.com ↗

API 使用示例

所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。

cURL
curl https://api.therouter.ai/v1/chat/completions   -H "Content-Type: application/json"   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -d '{
    "model": "doubao/doubao-seed-1-6-vision",
    "messages": [
      {"role": "user", "content": "Summarize the key points from this input."}
    ]
  }'

API 使用指南

完整 API 参考 →

Chat 调用

cURL
curl https://api.therouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"doubao/doubao-seed-1-6-vision","messages":[{"role":"user","content":[{"type":"text","text":"描述这张图片"},{"type":"image_url","image_url":{"url":"https://therouter.ai/assets/vision-sample.png"}}]}]}'

doubao 其他模型

同类模型

跨供应商的相似能力档位

动态与变更

2025-06-11

字节跳动 FORCE 大会发布 Seed1.6 系列

字节跳动 Seed 团队发布 Seed1.6 家族,支持 256K 上下文、多模态预训练、AdaCoT 自适应思考,并在 Gaokao/JEE 测评中表现突出。Vision 变体随后数月内跟进。

TheRouter 编辑重写seed.bytedance.com ↗
2025-08

Doubao-Seed-1.6-vision 公开文档(250815)

火山引擎文档与开发者评测重点强调原生 VisualCoT、256K 上下文,以及在 GUI Grounding 与视频理解场景的强表现。

TheRouter 编辑重写volcengine.com ↗

常见问题

Doubao Seed 1.6 Vision 的上下文窗口与上游 256K 模型一致吗?

上游火山引擎端点支持 256K。TheRouter 按 standard-models.yaml 中配置的 context_length(131072 tokens)暴露该模型。生产容量规划请以 YAML 数值为准。

TheRouter 编辑重写www.volcengine.com ↗
VisualCoT 与标准视觉工具调用有何不同?

VisualCoT 是原生的:模型在思维链中自行决定何时以及如何裁剪/旋转/标注图像,并将处理后的图像作为可见 CoT 的一部分返回,无需额外的视觉工具微服务。

TheRouter 编辑重写developer.volcengine.com ↗
事实档案 — 本页每条断言可在此回溯来源
来源URL采集于
发布日期ohmygpt.com ↗2026-05-25已核实
架构seed.bytedance.com ↗2026-05-25已核实
VisualCoTdeveloper.volcengine.com ↗2026-05-25已核实
许可www.volcengine.com ↗2026-05-25已核实
训练数据截止——未知
推理后端www.volcengine.com ↗2026-05-25已核实
MME-SCI (image-only)arxiv.org ↗2026-05-25待核实
Gaokao 2025 (multimodal)seed.bytedance.com ↗2026-05-25待核实
字节跳动 FORCE 大会发布 Seed1.6 系列seed.bytedance.com ↗2026-05-25已核实
Doubao-Seed-1.6-vision 公开文档(250815)volcengine.com ↗2026-05-25已核实
Doubao Seed 1.6 Vision 的上下文窗口与上游 256K 模型一致吗?www.volcengine.com ↗2026-05-25待核实
VisualCoT 与标准视觉工具调用有何不同?developer.volcengine.com ↗2026-05-25待核实
帮助与联系