Qwen3 Embedding 系列以 Apache 2.0 协议开源
阿里 Qwen 在 Hugging Face 和 ModelScope 上以 Apache 2.0 协议开源了 Qwen3-Embedding-0.6B/4B/8B 和 Qwen3-Reranker-0.6B/4B/8B 系列。8B 嵌入模型以 70.58 的分数荣登 MTEB 多语言排行榜第一名。此次发布还包括技术报告(arXiv 2506.05176)和 GitHub 上的开源训练代码。
Qwen 最新一代多语种文本 embedding — 新项目首选。
text-embedding-v4 是 Qwen 最新一代通用多语种文本 embedding。推荐用于新建 RAG 索引、语义搜索、聚类与分类工作负载 — 相对 v3 在同样的标价下提供更高的检索质量。
与 v3 共享相同的 OpenAI 兼容 `/v1/embeddings` 接口,迁移只需切换 model ID 加一次性重建索引。TheRouter 按请求在 bailian-cn 与 bailian-sg 之间选择更便宜的一侧。
| 类型 | 费率 |
|---|---|
| 输入 | $0.0756 每百万 Tokens |
| 发布日期 | 2025-06-05qwenlm.github.io ↗ | 已核实 |
| 参数量 | 40 亿huggingface.co ↗ | 已核实 |
| Transformer 层数 | 36huggingface.co ↗ | 已核实 |
| 最大嵌入维度 | 2560(MRL:32–2560)huggingface.co ↗ | 已核实 |
| 上下文长度(TheRouter) | 8,192 个 tokentherouter.ai ↗ | 已核实 |
| 上游原生上下文长度 | 32,768 个 tokenhuggingface.co ↗ | 已核实 |
| 支持语言 | 100 多种(自然语言及编程语言)github.com ↗ | 已核实 |
| MRL(俄罗斯套娃)支持 | 是——输出维度可从 32 到 2560 自定义huggingface.co ↗ | 已核实 |
| 指令感知提示 | 是——在查询前添加任务描述,可提升 1–5% 检索效果github.com ↗ | 已核实 |
| 许可 | Apache 2.0github.com ↗ | 已核实 |
| 训练数据截止 | 未公开披露 | 未知 |
| Benchmark | Distribution | Score | Source |
|---|---|---|---|
MTEB Multilingual (Qwen3-Embedding-8B, for context) 8B 版本;截至 2025 年 6 月 5 日在 MTEB 多语言排行榜排名第一。4B 版本(text-embedding-v4)得分略低,但在同等规模中保持竞争力。 | 70.58score | qwenlm.github.io ↗ |
所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。
curl https://api.therouter.ai/v1/chat/completions -H "Content-Type: application/json" -H "Authorization: Bearer $THE_ROUTER_API_KEY" -d '{
"model": "qwen/text-embedding-v4",
"messages": [
{"role": "user", "content": "Summarize the key points from this input."}
]
}'通过兼容 OpenAI 的 /v1/embeddings 端点生成嵌入向量。支持可配置的输出维度(32–2560,Matryoshka MRL)以及指令感知查询提示,可提升 1–5% 的检索效果。TheRouter 在阿里云百炼 bailian-cn 和 bailian-sg 之间自动路由。
curl https://api.therouter.ai/v1/embeddings \
-H "Authorization: Bearer $THEROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen/text-embedding-v4",
"input": "The quick brown fox jumps over the lazy dog",
"encoding_format": "float",
"dimensions": 2560
}'
# MRL: reduce dimensions for lower storage cost (range 32-2560)
# "dimensions": 512
# Instruction-aware query (prepend task prefix to query, NOT to documents):
# "input": "Instruct: Given a web search query, retrieve relevant passages that answer the query\nQuery: What is the capital of France?"阿里 Qwen 在 Hugging Face 和 ModelScope 上以 Apache 2.0 协议开源了 Qwen3-Embedding-0.6B/4B/8B 和 Qwen3-Reranker-0.6B/4B/8B 系列。8B 嵌入模型以 70.58 的分数荣登 MTEB 多语言排行榜第一名。此次发布还包括技术报告(arXiv 2506.05176)和 GitHub 上的开源训练代码。
是的。qwen/text-embedding-v4 是阿里云百炼对 Qwen3-Embedding-4B 使用的 API 产品名称。TheRouter 的模型 ID qwen/text-embedding-v4 路由到这一模型。8B 变体无法通过此 ID 单独访问。
不可以。v4 和 v3 向量处于不同的嵌入空间,无法互相比较。需要对向量数据库进行完整重建。如果暂时无法重建,请继续对现有索引调用 qwen/text-embedding-v3,直到准备好重建为止。
在嵌入请求中传入 dimensions 参数(例如 dimensions: 512)。有效范围为 32–2560。更小的维度可降低存储和 ANN 查询成本,但会带来一定的质量损失;在为生产环境选择降维方案前,请在具体数据集上进行基准测试。
不需要。推荐的做法是仅在查询中添加任务指令前缀(例如 Instruct: Given a web search query, retrieve relevant passages...\nQuery: <你的查询>)。段落/文档输入应在没有任何指令前缀的情况下发送。为文档添加指令通常会降低检索质量。
| 来源 | URL | 采集于 | |
|---|---|---|---|
| 发布日期 | qwenlm.github.io ↗ | 2026-06-09 | 已核实 |
| 参数量 | huggingface.co ↗ | 2026-06-09 | 已核实 |
| Transformer 层数 | huggingface.co ↗ | 2026-06-09 | 已核实 |
| 最大嵌入维度 | huggingface.co ↗ | 2026-06-09 | 已核实 |
| 上下文长度(TheRouter) | therouter.ai ↗ | 2026-06-09 | 已核实 |
| 上游原生上下文长度 | huggingface.co ↗ | 2026-06-09 | 已核实 |
| 支持语言 | github.com ↗ | 2026-06-09 | 已核实 |
| MRL(俄罗斯套娃)支持 | huggingface.co ↗ | 2026-06-09 | 已核实 |
| 指令感知提示 | github.com ↗ | 2026-06-09 | 已核实 |
| 许可 | github.com ↗ | 2026-06-09 | 已核实 |
| 训练数据截止 | — | — | 未知 |
| MTEB Multilingual (Qwen3-Embedding-8B, for context) | qwenlm.github.io ↗ | 2026-06-09 | 已核实 |
| Qwen3 Embedding 系列以 Apache 2.0 协议开源 | qwenlm.github.io ↗ | 2026-06-09 | 已核实 |
| text-embedding-v4 和 Qwen3-Embedding-4B 是同一个模型吗? | bailian.console.aliyun.com ↗ | 2026-06-09 | 待核实 |
| 我可以在不重建索引的情况下从 text-embedding-v3 迁移吗? | therouter.ai ↗ | 2026-06-09 | 待核实 |
| 如何使用 MRL 缩减向量维度? | huggingface.co ↗ | 2026-06-09 | 待核实 |
| 我是否也需要在文档中添加指令前缀? | github.com ↗ | 2026-06-09 | 待核实 |