LLM Embeddings 与 Reranking API 跨供应商对比:OpenAI、DashScope、Cohere、Voyage AI、Jina 全面解析
Embedding 和 Reranking API 跨供应商参考指南:模型规格、维度、定价、OpenAI SDK 兼容性,以及 RAG 管线选型决策矩阵。涵盖 OpenAI、DashScope(Qwen3)、Cohere、Voyage AI、Jina。
Embedding 和 Reranking API 是每条 RAG 管线的基础,但各家供应商的封装方式各不相同——模型 ID 不同、维度控制不同、计费单位不同、SDK 模式也不同。我们整理了这份跨供应商参考指南,方便你一目了然地对比选型。
OpenAI 兼容指供应商提供一个 chat-completions 接口,其请求与响应结构与 OpenAI API 契约足够接近——只需替换三个值(API key、base URL、模型名),原来的 OpenAI SDK 调用即可直接工作。最小实践面是POST /v1/chat/completions 带 messages、model, 并返回 OpenAI 形式的流式响应。
TL;DR — 供应商对比表
| 供应商 | Embedding 模型 | 最大维度 | 最大 Token | Reranking | 定价(每百万 token) |
|---|---|---|---|---|---|
| OpenAI | text-embedding-3-small, text-embedding-3-large | 1536 / 3072 | 8191 | 无原生 reranker | $0.02(small)、$0.13(large) |
| DashScope | text-embedding-v3, Qwen3-Embedding-0.6B/4B/8B | 1024–4096 | 8192–32K | qwen3-rerank(已替代 gte-rerank,2026-05-30) | ¥0.7/1M(约 $0.10)for v3 |
| Cohere | Embed 4 | 1024 | 4096 | Rerank 3.5, Rerank 4 Fast, Rerank 4 Pro | $4.00–$5.00/1M searches |
| Voyage AI | voyage-4-large, voyage-4, voyage-4-lite | 256–2048 | 32000 | rerank-2.5, rerank-2.5-lite | $0.05–$0.18/1M tokens |
| Jina | jina-embeddings-v4, jina-embeddings-v5 | 最高 4096 | 8192 | jina-reranker-v2 | ~$0.02–$0.12/1M tokens |
价格于 2026 年 8 月从各家官方定价页面获取,部署前请核实最新费率。
OpenAI Embeddings
OpenAI 通过 /v1/embeddings 端点提供两款当前 embedding 模型:
text-embedding-3-small — 默认 1536 维,支持 MRL 降维至 256。定价 $0.02/百万 token(Batch 调用可享 50% 折扣)。适合以英文为主、对成本敏感的检索场景。
text-embedding-3-large — 默认 3072 维,同样支持 MRL 降维至 256。定价 $0.13/百万 token。在 MTEB 基准上质量更高,尤其擅长多语言和复杂语义任务。
两款模型每次请求最多接受 8191 个 input token,返回归一化 float 向量。
from openai import OpenAI
client = OpenAI()
response = client.embeddings.create(
model="text-embedding-3-large",
input="RAG 管线应该用哪个 embedding 模型?",
dimensions=1024 # MRL:从 3072 降到 1024
)
vector = response.data[0].embedding
print(f"维度: {len(vector)}") # 1024
无原生 reranker。 OpenAI 不提供 reranking 端点。使用 OpenAI embedding 的 RAG 管线通常搭配 Cohere Rerank 或开源 reranker(如 BGE-reranker-v2-m3)。
关于 OpenAI API 更多模式,参见 OpenAI API 速率限制与多供应商 fallback 指南。
来源:OpenAI Embeddings 文档(2026-08-07 检索)、OpenAI 定价(2026-08-07 检索)。
DashScope(阿里云百炼)Embeddings 与 Reranking
DashScope 既提供托管 embedding 模型(text-embedding-v3),又提供开源的 Qwen3-Embedding 系列,还有专用的 reranking 模型族。
Embedding 模型
text-embedding-v3 — 默认 1024 维,可通过 dimensions 参数自定义。定价 ¥0.7/百万 token(国际站约 $0.10)。支持 OpenAI 兼容的 /v1/embeddings 端点——将 base_url 切换到 https://dashscope-intl.aliyuncs.com/compatible-mode/v1 即可使用 OpenAI Python SDK。
Qwen3-Embedding 系列(2025 年 6 月发布):
| 模型 | 参数量 | 最大 Token | 默认维度 | MRL(自定义维度) |
|---|---|---|---|---|
| Qwen3-Embedding-0.6B | 0.6B | 32K | 1024 | 是(256–1024) |
| Qwen3-Embedding-4B | 4B | 32K | 2560 | 是(256–2560) |
| Qwen3-Embedding-8B | 8B | 32K | 4096 | 是(256–4096) |
Qwen3-Embedding-8B 在 MTEB Multilingual 上得分 70.58,超越 Google Gemini-Embedding。三种规格均支持 instruction-aware embedding,覆盖 100+ 语言(包括编程语言)。
Reranking 模型
DashScope 已于 2026 年 5 月 30 日下线 gte-rerank,替代方案为 Qwen3-Reranker 系列:
| 模型 | 参数量 | 最大 Token | MTEB-R 分数 |
|---|---|---|---|
| Qwen3-Reranker-0.6B | 0.6B | 32K | 65.80 |
| Qwen3-Reranker-4B | 4B | 32K | 69.76 |
| Qwen3-Reranker-8B | 8B | 32K | 69.02 |
from openai import OpenAI
client = OpenAI(
api_key="your-dashscope-key",
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1"
)
# Embedding 请求——同样的 OpenAI SDK
response = client.embeddings.create(
model="text-embedding-v3",
input="RAG 管线 embedding 对比",
dimensions=1024
)
完整的 DashScope 集成指南参见 阿里云百炼 API 指南 和 DashScope Qwen3.7 系列完整指南。
来源:阿里云博客:Mastering Embedding with Qwen3(2026-08-07 检索)、Qwen3-Embedding 技术报告(2026-08-07 检索)、DashScope 定价(2026-08-07 检索)。
Cohere Embed 与 Rerank
Cohere 专注检索场景:Embed 4 和 Rerank 模型专为搜索与 RAG 设计,而非通用文本生成。
Embed 4 — 生成面向搜索和分类优化的 embedding。支持 search_document、search_query、classification、clustering 输入类型。定价约 $4.00–$5.00/百万次搜索(注意 Cohere 按 API 调用量计费,非按 token)。上下文长度 4096 token。可在 AWS Bedrock 和 Google Cloud 上使用。
Rerank 3.5 — 接收 query + 文档列表,返回相关性评分。定价 $5.00/百万次搜索。支持 4096 token 文档。如果需要开箱即用的 reranker 且不想自托管,这是首选。
Rerank 4 Fast / Rerank 4 Pro — 更新的 reranking 模型,同样 $5.00/1M 价位,精度进一步提升。
Cohere 使用自有 SDK(非 OpenAI 兼容),但 LiteLLM 和 Portkey 等 gateway 可统一接口。
import cohere
co = cohere.ClientV2(api_key="your-cohere-key")
# Reranking:精排 top-k 结果
results = co.rerank(
model="rerank-v3.5",
query="RAG 最佳 embedding 模型",
documents=[
"OpenAI text-embedding-3-large 提供 3072 维……",
"Cohere Embed 4 针对搜索和分类优化……",
"BGE-M3 是一款开源多语言 embedding 模型……"
],
top_n=2
)
for r in results.results:
print(f"Index: {r.index}, Score: {r.relevance_score:.4f}")
来源:Cohere 定价(2026-08-07 检索)、Cohere Rerank 文档(2026-08-07 检索)。
Voyage AI(MongoDB)Embeddings 与 Reranking
Voyage AI 现已并入 MongoDB,提供面向特定领域的 embedding 和 reranking 模型,在 MTEB 上表现出色。
Embedding 模型(voyage-4 系列,2026 年 1 月)
| 模型 | 上下文 | 默认维度 | 可选维度 | 定价(每百万 token) |
|---|---|---|---|---|
| voyage-4-large | 32K | 1024 | 256, 512, 2048 | $0.18 |
| voyage-4 | 32K | 1024 | 256, 512, 2048 | $0.12 |
| voyage-4-lite | 32K | 1024 | 256, 512, 2048 | $0.05 |
| voyage-4-nano(开源权重) | 32K | 512 | 128, 256 | — |
voyage-4 系列所有 embedding 互相兼容——voyage-4-large 和 voyage-4-lite 生成的向量可以直接比较,支持索引用高质量模型、查询用低成本模型的混合策略。
领域专用模型:voyage-code-3(代码检索)、voyage-finance-2、voyage-law-2 — 针对专业语料调优。
Reranking 模型
| 模型 | 说明 |
|---|---|
| rerank-2.5 | 通用 reranker,最高质量 |
| rerank-2.5-lite | 更低延迟,精度略有下降 |
Voyage 使用自有 API 端点(原生不兼容 OpenAI)。LiteLLM 提供 Voyage provider 集成。
来源:Voyage AI 模型概览(MongoDB 文档)(2026-08-07 检索)、LiteLLM Voyage 文档(2026-08-07 检索)。
Jina Embeddings 与 Reranking
Jina AI 提供多模态和多语言 embedding 模型,以及 reranker。
jina-embeddings-v4 — 多模态 embedding 模型,支持文本和图像。每个图像 tile 消耗 10 token。支持多种任务特化的 LoRA adapter(检索、分类、文本匹配)。最大支持 8192 token。
jina-embeddings-v5 — 最新一代,多语言性能进一步提升。
jina-reranker-v2 — 交叉编码器 reranker,用于精排检索结果。
Jina 使用自有 API 端点 https://api.jina.ai/v1/embeddings,请求 schema 与 OpenAI /v1/embeddings 类似,集成较为简单。
来源:Jina Embeddings API(2026-08-07 检索)、Jina AI on Hugging Face(2026-08-07 检索)。
SiliconFlow 托管 Embedding 模型
SiliconFlow 托管了多款开源 embedding 模型,包括 BAAI/bge-m3 和 BAAI/bge-large-zh-v1.5,价格有竞争力,部分小模型有免费额度。
如果团队已通过 SiliconFlow 路由 chat completion 请求,使用其托管 embedding 可以避免管理额外的供应商集成。
详情参见 SiliconFlow API 完整指南 和 SiliconFlow 免费模型路由指南。
选型决策矩阵:不同场景的 Embedding + Reranking 推荐组合
| 场景 | 推荐 Embedding | 推荐 Reranker | 理由 |
|---|---|---|---|
| 低成本英文 RAG | OpenAI text-embedding-3-small ($0.02/1M) | Cohere Rerank 3.5 | 最便宜的 embedding + 成熟 reranker |
| 多语言生产 RAG | Qwen3-Embedding-8B 或 voyage-4-large | Qwen3-Reranker-4B 或 rerank-2.5 | MTEB 多语言顶级分数、32K 上下文 |
| 中文为主的场景 | DashScope text-embedding-v3 | qwen3-rerank | OpenAI 兼容、国内延迟最低 |
| 代码检索 | voyage-code-3 或 Qwen3-Embedding-8B | Qwen3-Reranker-8B | 代码领域调优,MTEB-Code 表现强 |
| 预算自托管 | BAAI/bge-m3(通过 SiliconFlow) | BGE-reranker-v2-m3 | 开源权重,规模化无 API 成本 |
| 追求最高质量 | voyage-4-large + 2048 维 | rerank-2.5 | 基准分数最高、32K 上下文 |
维度降低的权衡
所有现代 embedding 供应商现在都支持 Matryoshka Representation Learning (MRL) — 可以将 embedding 向量截断到更少的维度,同时保留大部分语义信息:
- OpenAI: text-embedding-3-large 在 256 维时仍保留 ~96% 的完整 3072 维质量(MTEB 基准)
- DashScope: Qwen3-Embedding-4B 支持 256–2560 自定义维度
- Voyage: voyage-4 系列支持 256、512、1024、2048
适合降维的场景:
- 向量数据库存储成本是主要瓶颈(如在 Pinecone/Qdrant 中存储百万级文档)
- 查询延迟比边际质量提升更重要
- 需要不同模型层级间的向量互兼容(voyage-4 系列)
不建议降维的场景:
- 法律、医疗或金融领域,检索精度至关重要
- 语料规模较小,存储不是问题
跨供应商路由 Embedding 请求
通过 TheRouter 等 gateway 路由 embedding 请求时,需注意以下差异:
-
端点兼容性: OpenAI 和 DashScope 都使用
/v1/embeddings,schema 相同。Cohere、Voyage 和 Jina 需要 SDK adapter 或 gateway 归一化。 -
维度参数:
dimensions参数在 OpenAI 和 DashScope 上工作方式相同,但 Cohere 是固定维度、Voyage 在请求时设置。 -
Token 计数: 不同 tokenizer 意味着同一段文本在不同供应商上产生不同的 token 数。一篇 500 词的文档在 OpenAI tiktoken 下可能是 700 token,在 DashScope tokenizer 下可能是 650 token。
-
向量兼容性: 不同供应商的 embedding 不可互换。不能用 OpenAI embedding 建索引然后用 DashScope embedding 查询——向量空间不同。
-
Fallback 考量: 不同于 chat completion 的 fallback 相对直接,embedding 的 fallback 需要用 fallback 供应商的模型重新索引整个语料库。请慎重选择主 embedding 供应商。
更多多供应商路由模式参见 LLM API 成本优化路由策略指南 和 统一 LLM API 供应商 gateway 对比。
常见问题
查询和文档应该用同一个模型做 embedding 吗?
是的。只有同一模型产生的 embedding 向量才能比较。部分供应商(如 Cohere)使用 input_type 参数来区分查询和文档的 embedding 方式,但模型本身必须一致。
分块策略如何影响 embedding 质量?
较短的分块(256–512 token)更适合上下文窗口小的 embedding 模型。对于 32K 上下文的模型(Qwen3-Embedding、Voyage 4),可以 embed 更大的分块甚至整篇文档,但长文段的检索精度可能下降。建议基于实际语料做实验。
可以在同一个向量数据库中混用不同供应商的 embedding 吗?
不行。每个供应商的 embedding 模型生成的向量处于不同的语义空间。同一 collection/index 中的所有向量必须来自同一模型。如果要切换供应商,需要重新 embed 整个语料库。
Embedding 和 Reranking 的延迟差异有多大?
Embedding 通常很快(短文本每次请求 5–20ms)。Reranking 较慢,因为需要将 query 与每个候选文档做交叉编码——rerank 25 个文档大约需要 50–200ms,取决于文档长度和模型大小。
定价和模型可用性于 2026 年 8 月核实。各供应商定价变动频繁——生产部署前请查阅官方文档。