返回模型列表

GLM 4.6V Flash

zhipuzhipu/glm-4.6v-flash

Zhipu AI GLM 4.6V Flash — free-tier vision model supporting image, video, and document understanding.

GLM-4.6V-Flash 是智谱 AI(Z.ai)于 2025 年 12 月 8 日发布的免费轻量级视觉语言模型,是 GLM-4.6V 系列中的 9B 参数版本(另一成员为 106B MoE 旗舰版)。该模型专为本地部署和低延迟应用场景优化,与旗舰版共享 128K token 上下文窗口,经原生长多模态序列训练,可在单次推理中处理约 150 页密集文档、200 张幻灯片或 1 小时视频。权重以 THUDM / Z.ai 模型家族名义在 Hugging Face 开源。

GLM-4.6V-Flash 最核心的技术突破是原生多模态函数调用——这在 GLM 视觉家族中尚属首次。传统多模态工具调用需先将图像转换为文本再传入工具,会损失空间和色彩信息。GLM-4.6V-Flash 可将图像、截图和文档页面直接作为工具输入传递,并在同一推理链中消化视觉工具输出(图表、渲染网页、图片搜索结果等)。对 TheRouter 路由层用户而言,这使其成为视觉驱动 Agent 流水线的首选免费选项:支持图像、视频和 PDF 输入,通过标准 OpenAI 兼容 /v1/chat/completions 端点返回文本。

适合使用
  • • 零成本多模态 Agent 流水线:原生函数调用让模型直接对视觉输入采取行动——截图到操作、图表读取到工具调用——无需经过有损的图像到文本转换步骤
  • • 长文档和视频理解:128K 上下文窗口可在单次调用中处理约 150 页文档、200 张幻灯片或 1 小时视频,适用于零成本的财务分析、报告摘要和会议回顾
  • • 前端截图转代码工作流:模型经过调优,可从 UI 截图进行像素级精确的 HTML/CSS/JS 重建,并支持自然语言驱动的视觉编辑;免费层消除了迭代设计循环中的每次调用成本
  • • 中文视觉任务:GLM-4.6V-Flash 在中英双语语料上训练,对企业和政府工作流中常见的中文文档布局、表单和视觉内容有充分覆盖
  • • 本地和边缘部署:9B 密集架构可在单张消费级 GPU 上运行(已通过 vLLM ≥ 0.12.0 和 SGLang ≥ 0.5.6 测试);数据驻留或延迟限制不允许云 API 调用时的理想选择
不适合使用
  • • 纯文本推理任务:团队自述纯文本 QA 性能落后于视觉优先的训练重点;纯语言工作负载请使用 zhipu/glm-4-flash 或专用文本模型
  • • 精确计数和细粒度对象识别:已知局限包括计数准确性和特定个体识别——精度要求严苛的任务应路由到无此已知缺陷的模型,或通过后处理验证
  • • 需要 SLA 保证的大规模生产工作负载:免费层没有正式 SLA;业务关键型流水线请路由到付费 VLM(zhipu/glm-4.6v 或 zhipu/glm-4.6v-flashx)
  • • 图像生成或编辑:GLM-4.6V-Flash 是视觉语言模型(文本 + 图像 → 文本),不产生图像输出;文生图任务请使用 zhipu/cogview-4 或 zhipu/cogview-3-flash
上下文长度
131K
最大输出
16K

模态能力

文本图像视频PDF→文本

能力

视觉理解

价格明细

暂无定价信息。

支持参数

temperaturemax_tokenstop_ptoolstool_choicestop

模型规格

发布日期2025-12-08huggingface.co ↗已核实
参数量9B(密集)huggingface.co ↗已核实
架构密集 Transformer(GLM-V 系列);与 106B MoE 旗舰版同属 GLM-4.6V 系列huggingface.co ↗已核实
上下文窗口128K token(131,072)— 原生该长度训练docs.z.ai ↗已核实
最大输出 token 数16,384 tokenhuggingface.co ↗已核实
输入模态文本、图像、视频、PDF(可在单次请求中混合传入)docs.z.ai ↗已核实
输出模态仅文本(不生成图像)docs.z.ai ↗已核实
定价免费 — 通过 TheRouter 和 Z.ai 平台每 token 费用为 $0(输入和输出)docs.z.ai ↗已核实
原生函数调用是 — GLM 视觉家族首款;图像和视觉工具输出可原生传递,无需文本转换huggingface.co ↗已核实
训练数据截止未公开披露未知
许可GLM-4 模型许可证(Z.ai / THUDM)— 开放权重;商业使用须符合许可条款huggingface.co ↗待核实
本地部署支持vLLM ≥ 0.12.0;SGLang ≥ 0.5.6(视频任务推荐);Transformers ≥ 5.0.0rc0huggingface.co ↗已核实
推荐解码参数top_p=0.6、top_k=2、temperature=0.8、repetition_penalty=1.1、max_new_tokens=16384huggingface.co ↗已核实

API 使用示例

所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。

cURL
curl https://api.therouter.ai/v1/chat/completions   -H "Content-Type: application/json"   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -d '{
    "model": "zhipu/glm-4.6v-flash",
    "messages": [
      {"role": "user", "content": "Summarize the key points from this input."}
    ]
  }'

API 使用指南

完整 API 参考 →

视觉对话补全(图像 / 视频 / PDF 输入)

GLM-4.6V-Flash 通过 api.therouter.ai 的标准 OpenAI /v1/chat/completions 端点访问。与 GPT-4o 一样,以 image_url 内容块传入图像。支持在单次请求中混合传入文本、图像、视频和 PDF 输入。函数调用通过标准 tools / tool_choice 参数实现——图像和视觉工具输出原生处理。API 完全免费,不消耗额度。

cURL
# Image understanding — free via TheRouter
curl https://api.therouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "zhipu/glm-4.6v-flash",
    "messages": [
      {
        "role": "user",
        "content": [
          {
            "type": "image_url",
            "image_url": { "url": "https://therouter.ai/assets/vision-sample.png" }
          },
          {
            "type": "text",
            "text": "Summarise the key trends shown in this chart."
          }
        ]
      }
    ],
    "max_tokens": 1024
  }'

zhipu 其他模型

同类模型

跨供应商的相似能力档位

动态与变更

2025-12-08

Z.ai 发布 GLM-4.6V 系列,首次集成原生多模态函数调用

智谱 AI(Z.ai)开源了 GLM-4.6V 系列——包含 106B MoE 旗舰版和 9B 密集版 GLM-4.6V-Flash,均支持 128K 上下文和原生多模态工具调用。Flash 版本可免费通过 API 访问,定位为本地和低延迟部署。

TheRouter 编辑重写huggingface.co ↗

常见问题

GLM-4.6V-Flash 真的免费吗,未来会开始收费吗?

截至 2026 年 6 月,该模型在 Z.ai 平台和 TheRouter 上的定价均为每 token $0(输入和输出)。定价由智谱 AI 决定,可能随时变更;无论哪个层级,标准速率限制和内容审核均适用。请关注 Z.ai 定价页面了解最新动态。

GLM-4.6V-Flash 和 GLM-4.6V-FlashX 有什么区别?

两者均为 GLM-4.6V 系列的 9B 轻量版本。GLM-4.6V-Flash 是无正式 SLA 的免费层版本。GLM-4.6V-FlashX 是付费版本(截至 2026 年 6 月:¥0.05/M 输入 token、¥0.30/M 输出 token),提供适合生产工作负载的 SLA 可靠性保障。原型开发和零成本流水线选 Flash;需要保证正常运行时间时选 FlashX。

原生多模态函数调用与标准工具调用有何不同?

在标准 LLM 工具调用中,图像必须先转换为文字描述才能作为工具参数传递——这个过程会损失空间、色彩和布局信息。GLM-4.6V-Flash 可将图像、截图和文档页面直接作为工具输入(通过 URL 引用)传递,并能在同一推理链中处理工具返回的视觉输出——如图表、渲染网页或图片搜索结果。API 接口与标准 OpenAI 工具调用完全一致;多模态能力由模型和 Z.ai / TheRouter 层透明处理。

GLM-4.6V-Flash 实际上能处理多长的上下文内容?

该模型的 128K token 上下文窗口是原生训练(而非事后扩展)的,这意味着它能在整个窗口范围内保持连贯性。Z.ai 团队报告的实际等效值为:单次推理可处理约 150 页密集文档、200 张幻灯片或 1 小时视频,因为视觉页面由视觉编码器编码为 token。每次请求的最大输出上限为 16,384 token。

在生产环境中我应该注意 GLM-4.6V-Flash 哪些已知局限性?

Z.ai 团队在模型卡中明确承认以下局限:(1) 纯文本 QA 性能弱于视觉能力,因为本轮训练优先考虑了多模态场景;(2) 处理复杂提示词时,模型可能偶尔过度思考或重复内容;(3) 某些情况下会在回复末尾重述答案;(4) 计数准确性和特定个体识别仍不完善。对于免费层、无 SLA 的工作流,这些是可接受的权衡。如果生产路径中上述任何一点至关重要,请仔细验证输出或路由到付费模型。

事实档案 — 本页每条断言可在此回溯来源
来源URL采集于
发布日期huggingface.co ↗2026-06-09已核实
参数量huggingface.co ↗2026-06-09已核实
架构huggingface.co ↗2026-06-09已核实
上下文窗口docs.z.ai ↗2026-06-09已核实
最大输出 token 数huggingface.co ↗2026-06-09已核实
输入模态docs.z.ai ↗2026-06-09已核实
输出模态docs.z.ai ↗2026-06-09已核实
定价docs.z.ai ↗2026-06-09已核实
原生函数调用huggingface.co ↗2026-06-09已核实
训练数据截止——未知
许可huggingface.co ↗2026-06-09待核实
本地部署支持huggingface.co ↗2026-06-09已核实
推荐解码参数huggingface.co ↗2026-06-09已核实
Z.ai 发布 GLM-4.6V 系列,首次集成原生多模态函数调用huggingface.co ↗2026-06-09已核实
帮助与联系