← 全部文章

LLM Embeddings 与 Reranking API 跨供应商对比:OpenAI、DashScope、Cohere、Voyage AI、Jina 全面解析

Embedding 和 Reranking API 跨供应商参考指南:模型规格、维度、定价、OpenAI SDK 兼容性,以及 RAG 管线选型决策矩阵。涵盖 OpenAI、DashScope(Qwen3)、Cohere、Voyage AI、Jina。

· TheRouter

Embedding 和 Reranking API 是每条 RAG 管线的基础,但各家供应商的封装方式各不相同——模型 ID 不同、维度控制不同、计费单位不同、SDK 模式也不同。我们整理了这份跨供应商参考指南,方便你一目了然地对比选型。

OpenAI 兼容指供应商提供一个 chat-completions 接口,其请求与响应结构与 OpenAI API 契约足够接近——只需替换三个值(API key、base URL、模型名),原来的 OpenAI SDK 调用即可直接工作。最小实践面是POST /v1/chat/completions 带 messages、model, 并返回 OpenAI 形式的流式响应。

TL;DR — 供应商对比表

供应商Embedding 模型最大维度最大 TokenReranking定价(每百万 token)
OpenAItext-embedding-3-small, text-embedding-3-large1536 / 30728191无原生 reranker$0.02(small)、$0.13(large)
DashScopetext-embedding-v3, Qwen3-Embedding-0.6B/4B/8B1024–40968192–32Kqwen3-rerank(已替代 gte-rerank,2026-05-30)¥0.7/1M(约 $0.10)for v3
CohereEmbed 410244096Rerank 3.5, Rerank 4 Fast, Rerank 4 Pro$4.00–$5.00/1M searches
Voyage AIvoyage-4-large, voyage-4, voyage-4-lite256–204832000rerank-2.5, rerank-2.5-lite$0.05–$0.18/1M tokens
Jinajina-embeddings-v4, jina-embeddings-v5最高 40968192jina-reranker-v2~$0.02–$0.12/1M tokens

价格于 2026 年 8 月从各家官方定价页面获取,部署前请核实最新费率。

OpenAI Embeddings

OpenAI 通过 /v1/embeddings 端点提供两款当前 embedding 模型:

text-embedding-3-small — 默认 1536 维,支持 MRL 降维至 256。定价 $0.02/百万 token(Batch 调用可享 50% 折扣)。适合以英文为主、对成本敏感的检索场景。

text-embedding-3-large — 默认 3072 维,同样支持 MRL 降维至 256。定价 $0.13/百万 token。在 MTEB 基准上质量更高,尤其擅长多语言和复杂语义任务。

两款模型每次请求最多接受 8191 个 input token,返回归一化 float 向量。

from openai import OpenAI

client = OpenAI()

response = client.embeddings.create(
    model="text-embedding-3-large",
    input="RAG 管线应该用哪个 embedding 模型?",
    dimensions=1024  # MRL:从 3072 降到 1024
)

vector = response.data[0].embedding
print(f"维度: {len(vector)}")  # 1024

无原生 reranker。 OpenAI 不提供 reranking 端点。使用 OpenAI embedding 的 RAG 管线通常搭配 Cohere Rerank 或开源 reranker(如 BGE-reranker-v2-m3)。

关于 OpenAI API 更多模式,参见 OpenAI API 速率限制与多供应商 fallback 指南。

来源:OpenAI Embeddings 文档(2026-08-07 检索)、OpenAI 定价(2026-08-07 检索)。

DashScope(阿里云百炼)Embeddings 与 Reranking

DashScope 既提供托管 embedding 模型(text-embedding-v3),又提供开源的 Qwen3-Embedding 系列,还有专用的 reranking 模型族。

Embedding 模型

text-embedding-v3 — 默认 1024 维,可通过 dimensions 参数自定义。定价 ¥0.7/百万 token(国际站约 $0.10)。支持 OpenAI 兼容的 /v1/embeddings 端点——将 base_url 切换到 https://dashscope-intl.aliyuncs.com/compatible-mode/v1 即可使用 OpenAI Python SDK。

Qwen3-Embedding 系列(2025 年 6 月发布):

模型参数量最大 Token默认维度MRL(自定义维度)
Qwen3-Embedding-0.6B0.6B32K1024是(256–1024)
Qwen3-Embedding-4B4B32K2560是(256–2560)
Qwen3-Embedding-8B8B32K4096是(256–4096)

Qwen3-Embedding-8B 在 MTEB Multilingual 上得分 70.58,超越 Google Gemini-Embedding。三种规格均支持 instruction-aware embedding,覆盖 100+ 语言(包括编程语言)。

Reranking 模型

DashScope 已于 2026 年 5 月 30 日下线 gte-rerank,替代方案为 Qwen3-Reranker 系列:

模型参数量最大 TokenMTEB-R 分数
Qwen3-Reranker-0.6B0.6B32K65.80
Qwen3-Reranker-4B4B32K69.76
Qwen3-Reranker-8B8B32K69.02
from openai import OpenAI

client = OpenAI(
    api_key="your-dashscope-key",
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1"
)

# Embedding 请求——同样的 OpenAI SDK
response = client.embeddings.create(
    model="text-embedding-v3",
    input="RAG 管线 embedding 对比",
    dimensions=1024
)

完整的 DashScope 集成指南参见 阿里云百炼 API 指南 和 DashScope Qwen3.7 系列完整指南。

来源:阿里云博客:Mastering Embedding with Qwen3(2026-08-07 检索)、Qwen3-Embedding 技术报告(2026-08-07 检索)、DashScope 定价(2026-08-07 检索)。

Cohere Embed 与 Rerank

Cohere 专注检索场景:Embed 4 和 Rerank 模型专为搜索与 RAG 设计,而非通用文本生成。

Embed 4 — 生成面向搜索和分类优化的 embedding。支持 search_document、search_query、classification、clustering 输入类型。定价约 $4.00–$5.00/百万次搜索(注意 Cohere 按 API 调用量计费,非按 token)。上下文长度 4096 token。可在 AWS Bedrock 和 Google Cloud 上使用。

Rerank 3.5 — 接收 query + 文档列表,返回相关性评分。定价 $5.00/百万次搜索。支持 4096 token 文档。如果需要开箱即用的 reranker 且不想自托管,这是首选。

Rerank 4 Fast / Rerank 4 Pro — 更新的 reranking 模型,同样 $5.00/1M 价位,精度进一步提升。

Cohere 使用自有 SDK(非 OpenAI 兼容),但 LiteLLM 和 Portkey 等 gateway 可统一接口。

import cohere

co = cohere.ClientV2(api_key="your-cohere-key")

# Reranking:精排 top-k 结果
results = co.rerank(
    model="rerank-v3.5",
    query="RAG 最佳 embedding 模型",
    documents=[
        "OpenAI text-embedding-3-large 提供 3072 维……",
        "Cohere Embed 4 针对搜索和分类优化……",
        "BGE-M3 是一款开源多语言 embedding 模型……"
    ],
    top_n=2
)

for r in results.results:
    print(f"Index: {r.index}, Score: {r.relevance_score:.4f}")

来源:Cohere 定价(2026-08-07 检索)、Cohere Rerank 文档(2026-08-07 检索)。

Voyage AI(MongoDB)Embeddings 与 Reranking

Voyage AI 现已并入 MongoDB,提供面向特定领域的 embedding 和 reranking 模型,在 MTEB 上表现出色。

Embedding 模型(voyage-4 系列,2026 年 1 月)

模型上下文默认维度可选维度定价(每百万 token)
voyage-4-large32K1024256, 512, 2048$0.18
voyage-432K1024256, 512, 2048$0.12
voyage-4-lite32K1024256, 512, 2048$0.05
voyage-4-nano(开源权重)32K512128, 256—

voyage-4 系列所有 embedding 互相兼容——voyage-4-large 和 voyage-4-lite 生成的向量可以直接比较,支持索引用高质量模型、查询用低成本模型的混合策略。

领域专用模型:voyage-code-3(代码检索)、voyage-finance-2、voyage-law-2 — 针对专业语料调优。

Reranking 模型

模型说明
rerank-2.5通用 reranker,最高质量
rerank-2.5-lite更低延迟,精度略有下降

Voyage 使用自有 API 端点(原生不兼容 OpenAI)。LiteLLM 提供 Voyage provider 集成。

来源:Voyage AI 模型概览(MongoDB 文档)(2026-08-07 检索)、LiteLLM Voyage 文档(2026-08-07 检索)。

Jina Embeddings 与 Reranking

Jina AI 提供多模态和多语言 embedding 模型,以及 reranker。

jina-embeddings-v4 — 多模态 embedding 模型,支持文本和图像。每个图像 tile 消耗 10 token。支持多种任务特化的 LoRA adapter(检索、分类、文本匹配)。最大支持 8192 token。

jina-embeddings-v5 — 最新一代,多语言性能进一步提升。

jina-reranker-v2 — 交叉编码器 reranker,用于精排检索结果。

Jina 使用自有 API 端点 https://api.jina.ai/v1/embeddings,请求 schema 与 OpenAI /v1/embeddings 类似,集成较为简单。

来源:Jina Embeddings API(2026-08-07 检索)、Jina AI on Hugging Face(2026-08-07 检索)。

SiliconFlow 托管 Embedding 模型

SiliconFlow 托管了多款开源 embedding 模型,包括 BAAI/bge-m3 和 BAAI/bge-large-zh-v1.5,价格有竞争力,部分小模型有免费额度。

如果团队已通过 SiliconFlow 路由 chat completion 请求,使用其托管 embedding 可以避免管理额外的供应商集成。

详情参见 SiliconFlow API 完整指南 和 SiliconFlow 免费模型路由指南。

选型决策矩阵:不同场景的 Embedding + Reranking 推荐组合

场景推荐 Embedding推荐 Reranker理由
低成本英文 RAGOpenAI text-embedding-3-small ($0.02/1M)Cohere Rerank 3.5最便宜的 embedding + 成熟 reranker
多语言生产 RAGQwen3-Embedding-8B 或 voyage-4-largeQwen3-Reranker-4B 或 rerank-2.5MTEB 多语言顶级分数、32K 上下文
中文为主的场景DashScope text-embedding-v3qwen3-rerankOpenAI 兼容、国内延迟最低
代码检索voyage-code-3 或 Qwen3-Embedding-8BQwen3-Reranker-8B代码领域调优,MTEB-Code 表现强
预算自托管BAAI/bge-m3(通过 SiliconFlow)BGE-reranker-v2-m3开源权重,规模化无 API 成本
追求最高质量voyage-4-large + 2048 维rerank-2.5基准分数最高、32K 上下文

维度降低的权衡

所有现代 embedding 供应商现在都支持 Matryoshka Representation Learning (MRL) — 可以将 embedding 向量截断到更少的维度,同时保留大部分语义信息:

  • OpenAI: text-embedding-3-large 在 256 维时仍保留 ~96% 的完整 3072 维质量(MTEB 基准)
  • DashScope: Qwen3-Embedding-4B 支持 256–2560 自定义维度
  • Voyage: voyage-4 系列支持 256、512、1024、2048

适合降维的场景:

  • 向量数据库存储成本是主要瓶颈(如在 Pinecone/Qdrant 中存储百万级文档)
  • 查询延迟比边际质量提升更重要
  • 需要不同模型层级间的向量互兼容(voyage-4 系列)

不建议降维的场景:

  • 法律、医疗或金融领域,检索精度至关重要
  • 语料规模较小,存储不是问题

跨供应商路由 Embedding 请求

通过 TheRouter 等 gateway 路由 embedding 请求时,需注意以下差异:

  1. 端点兼容性: OpenAI 和 DashScope 都使用 /v1/embeddings,schema 相同。Cohere、Voyage 和 Jina 需要 SDK adapter 或 gateway 归一化。

  2. 维度参数: dimensions 参数在 OpenAI 和 DashScope 上工作方式相同,但 Cohere 是固定维度、Voyage 在请求时设置。

  3. Token 计数: 不同 tokenizer 意味着同一段文本在不同供应商上产生不同的 token 数。一篇 500 词的文档在 OpenAI tiktoken 下可能是 700 token,在 DashScope tokenizer 下可能是 650 token。

  4. 向量兼容性: 不同供应商的 embedding 不可互换。不能用 OpenAI embedding 建索引然后用 DashScope embedding 查询——向量空间不同。

  5. Fallback 考量: 不同于 chat completion 的 fallback 相对直接,embedding 的 fallback 需要用 fallback 供应商的模型重新索引整个语料库。请慎重选择主 embedding 供应商。

更多多供应商路由模式参见 LLM API 成本优化路由策略指南 和 统一 LLM API 供应商 gateway 对比。

常见问题

查询和文档应该用同一个模型做 embedding 吗?

是的。只有同一模型产生的 embedding 向量才能比较。部分供应商(如 Cohere)使用 input_type 参数来区分查询和文档的 embedding 方式,但模型本身必须一致。

分块策略如何影响 embedding 质量?

较短的分块(256–512 token)更适合上下文窗口小的 embedding 模型。对于 32K 上下文的模型(Qwen3-Embedding、Voyage 4),可以 embed 更大的分块甚至整篇文档,但长文段的检索精度可能下降。建议基于实际语料做实验。

可以在同一个向量数据库中混用不同供应商的 embedding 吗?

不行。每个供应商的 embedding 模型生成的向量处于不同的语义空间。同一 collection/index 中的所有向量必须来自同一模型。如果要切换供应商,需要重新 embed 整个语料库。

Embedding 和 Reranking 的延迟差异有多大?

Embedding 通常很快(短文本每次请求 5–20ms)。Reranking 较慢,因为需要将 query 与每个候选文档做交叉编码——rerank 25 个文档大约需要 50–200ms,取决于文档长度和模型大小。


定价和模型可用性于 2026 年 8 月核实。各供应商定价变动频繁——生产部署前请查阅官方文档。

帮助与联系