Embedding 3
Zhipu AI Embedding 3 — latest text embedding model. Default 2048-dim, supports custom dimensions (256, 512, 1024, 2048).
智谱 AI Embedding-3 是北京智谱 AI(GLM 系列语言模型背后的研究机构)推出的第三代文本向量化模型,在 bigmodel.cn 开放平台上发布。相较于 Embedding-2 的固定维度,Embedding-3 引入了可调输出维度(256 / 512 / 1024 / 2048)和 8K token 输入窗口(Embedding-2 仅 512 token),是一次重要升级。该模型专为中英双语语义理解设计,在以中文为主的检索语料库中表现尤为突出。
对 TheRouter 路由层用户,Embedding-3 是中文优先 RAG、搜索和推荐流水线的推荐嵌入模型。通过 TheRouter,价格约 $0.069/MTok(¥0.5/MTok),是中文 AI 技术栈中最具成本效益的嵌入 API 之一。其 matryoshka 风格的维度选择允许用户在存储成本与向量检索延迟之间灵活权衡——例如在大规模近似搜索中使用 256 维向量,在高保真检索中使用 2048 维——且无需对整个语料库重新嵌入。该模型通过 api.therouter.ai 的 OpenAI 兼容 /v1/embeddings 端点访问,使用 zhipu/embedding-3 模型标识符。
- • 中英双语 RAG 流水线:对中文文档为主的混合语言知识库进行语义检索
- • 成本敏感的大规模嵌入:¥0.5/MTok 的定价使其成为高吞吐量中文语料库(>1 亿 tokens/天)的默认选择
- • 维度灵活部署:matryoshka 维度控制(256–2048)允许在不重新嵌入的情况下压缩向量用于 ANN 索引
- • 大型中文文本语料库(新闻、电商、用户评论)的推荐系统与内容去重
- • 纯英文大规模检索:OpenAI text-embedding-3-large(3072 维,英文任务 MTEB 最优)或 Cohere Embed V4(多模态、多语言)更为适合
- • 多模态(图像+文本)嵌入任务:Cohere Embed V4 支持图像/文本混合输入;Embedding-3 仅支持文本
- • 超出中英之外的跨语言语义任务:具备更广泛多语言 MTEB 覆盖的模型(如 Cohere Embed V4、multilingual-e5-large)更为可靠
模态能力
价格明细
| 类型 | 费率 |
|---|---|
| 输入 | $0.081 每百万 Tokens |
支持参数
模型规格
| 上下文窗口 | 8192 tokens(8K)docs.bigmodel.cn ↗ | 已核实 |
| 输出维度 | 256、512、1024 或 2048(默认:2048)docs.bigmodel.cn ↗ | 已核实 |
| 批次大小限制 | 每次请求最多 64 条字符串docs.bigmodel.cn ↗ | 已核实 |
| 官方价格(智谱直购) | ¥0.5 / 百万 tokensdocs.bigmodel.cn ↗ | 已核实 |
| Matryoshka 维度压缩 | 支持 — 通过 dimensions 参数选择 256/512/1024/2048docs.bigmodel.cn ↗ | 已核实 |
| 模态 | 文本 → 嵌入(仅支持文本输入,不支持图像或音频)docs.bigmodel.cn ↗ | 已核实 |
| 前代型号 | 智谱 Embedding-2(固定 1024 维,512 token 上下文)docs.bigmodel.cn ↗ | 已核实 |
API 使用示例
所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。
curl https://api.therouter.ai/v1/chat/completions -H "Content-Type: application/json" -H "Authorization: Bearer $THE_ROUTER_API_KEY" -d '{
"model": "zhipu/embedding-3",
"messages": [
{"role": "user", "content": "Summarize the key points from this input."}
]
}'API 使用指南
嵌入向量(OpenAI 兼容)
通过 api.therouter.ai 的标准 OpenAI /v1/embeddings 端点访问 Embedding-3。通过 dimensions 参数(256、512、1024 或 2048)选择输出维度。每次请求最多可批量处理 64 条字符串以获得最大吞吐量。
curl https://api.therouter.ai/v1/embeddings \
-H "Authorization: Bearer $THEROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "zhipu/embedding-3",
"input": ["智谱 AI 是中国领先的 AI 研究机构", "Zhipu AI is a leading Chinese AI research lab"],
"dimensions": 1024
}'zhipu 其他模型
同类模型
跨供应商的相似能力档位常见问题
应该选择哪种维度?
2048(默认)提供最高的语义保真度,适合精度要求严格的检索场景(如法律或医疗知识库)。1024 适合大多数生产 RAG 栈的实用平衡。512 适合存储成本敏感的大规模近似近邻(ANN)搜索。256 适合以延迟为首要约束的实时相似度评分场景。四种维度的 token 成本相同。
能否在 LangChain、LlamaIndex 或 Spring AI 中使用 Embedding-3?
可以。由于 TheRouter 通过标准 OpenAI 嵌入 API(api.therouter.ai)暴露 Embedding-3,任何支持 OpenAI 嵌入客户端的框架均可开箱即用。对于 LangChain 和 LlamaIndex,将 base URL 设置为 https://api.therouter.ai/v1,模型设置为 zhipu/embedding-3。对于 Spring AI,设置 spring.ai.openai.embedding.options.model=zhipu/embedding-3 并根据需要设置 dimensions=1024。
Embedding-3 与 OpenAI text-embedding-3-small 相比如何?
Embedding-3 的成本效益显著更高(约 $0.069/MTok vs $0.020/MTok),但主要面向中文优先的工作负载。OpenAI text-embedding-3-small 在纯英文 MTEB 基准测试中表现更强,是 TheRouter 中英文主导 RAG 栈的默认选择。Embedding-3 的 8K 上下文窗口(vs text-embedding-3-small 的 8191 tokens)和 matryoshka 维度控制相当。若中文召回质量是主要关注点,选择 Embedding-3;若是英文或以西方语言为主的语料库,选择 text-embedding-3-small。
事实档案 — 本页每条断言可在此回溯来源
| 来源 | URL | 采集于 | |
|---|---|---|---|
| 上下文窗口 | docs.bigmodel.cn ↗ | 2026-06-09 | 已核实 |
| 输出维度 | docs.bigmodel.cn ↗ | 2026-06-09 | 已核实 |
| 批次大小限制 | docs.bigmodel.cn ↗ | 2026-06-09 | 已核实 |
| 官方价格(智谱直购) | docs.bigmodel.cn ↗ | 2026-06-09 | 已核实 |
| Matryoshka 维度压缩 | docs.bigmodel.cn ↗ | 2026-06-09 | 已核实 |
| 模态 | docs.bigmodel.cn ↗ | 2026-06-09 | 已核实 |
| 前代型号 | docs.bigmodel.cn ↗ | 2026-06-09 | 已核实 |