返回模型列表

Amazon Titan Text Embeddings V2

amazonamazon/titan-embed-v2

Lightweight, efficient embedding model for high accuracy retrieval tasks. Supports flexible embedding sizes (1024, 512, 256) and 100+ languages.

Amazon Titan Text Embeddings V2 是亚马逊针对检索增强生成优化的第二代文本嵌入模型。2024 年 4 月发布,旨在将自然语言文本转换为高维向量,支持可配置的输出维度(256、512 或 1024),让用户可以在精度、存储成本和检索延迟之间做出精细权衡。

作为 Amazon Bedrock 的托管嵌入服务,Titan V2 完全无服务器化 — 无需预置基础设施或运维运行时环境。它在预训练中支持超过 100 种语言,提供单位向量归一化以提高余弦相似度精度,并且定价为每百万输入令牌 $0.02,比 V1 模型降低了 5 倍,且在 256 维度下通常保持 >97% 的检索精度。

适合使用
  • • RAG(检索增强生成)管道,因其可配置向量维度让您可以微调精度-存储的权衡
  • • 在统一向量空间内对 100+ 种语言进行多语言语义搜索
  • • 成本敏感的文档嵌入工作流,其中较小的向量维度(256、512)相比 1024 将存储成本降低 75‑50%
  • • 需要托管、无服务器嵌入服务且具备一致的 AWS 账单与合规护栏的企业工作负载
不适合使用
  • • 嵌入驱动的代码分析 — 建议选用专门针对代码的模型,如 OpenAI text‑embedding‑3‑large
  • • 需要在亚马逊基础设施外运行模型的本地部署/自托管场景
  • • 多模态输入(图像 + 文本)— Titan V2 仅支持文本;Cohere embed‑v4 或 OpenAI CLIP 变体更合适
  • • 需要 P99 <50ms 的低延迟实时推理 — 应先评估向量数据库,但 Titan 的运行时请求/分钟限制可能限制吞吐量

供应商自营与 TheRouter 服务形态的差异

供应商自己运营时

AWS 在 Bedrock bedrock-runtime 端点通过 Invoke 提供 Titan Text Embeddings V2,输入为文本,输出为 embedding,上限为 8K token / 50,000 字符,模型 ID 为 amazon.titan-embed-text-v2:0,当前模型卡未列出跨区域 inference profile。

在 TheRouter 上

TheRouter 将同一 embedding 模型以 amazon/titan-embed-v2 通过 /v1/embeddings 提供,并使用 OpenAI 兼容客户端语法。实际价格、上下文、模态和 supported-parameter 字段来自 TheRouter 实时 catalog;本 curated 页面记录 AWS 权威行为,并在运营者付费验证记录执行前保持 snippets 封顶。

上下文长度
8K
最大输出
--
输入价格每百万 tokens
$0.0216每百万 Tokens

模态能力

文本→embedding

价格明细

类型费率
输入$0.0216 每百万 Tokens

支持参数

dimensionsnormalize

模型规格

发布日期2024‑04‑30Amazon Bedrock docs ↗已核实
输出维度256、512、1024(可配置)docs.aws.amazon.com ↗已核实
向量归一化支持(单位向量),可选docs.aws.amazon.com ↗已核实
支持语种针对英语优化,100+ 种语言处于 preview 支持;跨语言查询效果次优docs.aws.amazon.com ↗已核实
最大输入字符数50,000docs.aws.amazon.com ↗已核实
训练数据截止日期未公开披露未知
令牌与字符比(英语)约 4.7 字符/令牌docs.aws.amazon.com ↗已核实

基准成绩

BenchmarkDistributionScoreSource
MTEB (Massive Text Embedding Benchmark) weighted average
60.37scoreAWS ML blog ↗
MTEB reranking
57.5scoreaws.amazon.com ↗
MIRACL multilingual
55scoreaws.amazon.com ↗

API 使用示例

所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。

cURL
curl https://api.therouter.ai/v1/chat/completions   -H "Content-Type: application/json"   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -d '{
    "model": "amazon/titan-embed-v2",
    "messages": [
      {"role": "user", "content": "Summarize the key points from this input."}
    ]
  }'

API 使用指南

完整 API 参考 →

嵌入请求

为文本输入生成嵌入向量,支持可配置的维度和可选归一化。TheRouter 会透明地将您的请求路由到 Amazon Bedrock,语法完全兼容 OpenAI。

cURL
curl https://api.therouter.ai/v1/embeddings \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "amazon/titan-embed-v2",
    "input": "Your text to embed here.",
    "dimensions": 256,
    "encoding_format": "float"
  }'

amazon 其他模型

同类模型

跨供应商的相似能力档位

动态与变更

2024-05-06

Amazon Titan Text Embeddings V2 现已在 Amazon Bedrock 上线

AWS 宣布 Titan V2 全面上线,支持可配置维度(256、512、1024)、单位向量归一化和 100+ 种语言,定价为每百万令牌 $0.02,相比 V1 降低 5 倍。

TheRouter 编辑重写AWS News Blog ↗
2024-10-07

开始使用 Amazon Titan Text Embeddings V2:Amazon Bedrock 的新一代前沿嵌入模型

AWS ML 团队发布全面的 Titan V2 评测文章,涵盖其 MTEB 分数(加权平均 60.37)、多语言性能以及针对 RAG 的优化优势。

TheRouter 编辑重写AWS Machine Learning Blog ↗

常见问题

在 256、512 和 1024 维度之间,实际精度‑存储权衡如何?

亚马逊的测试结果显示,512 维向量保留了约 99% 的 1024 维全精度检索准确率,而 256 维向量则保持 >97% 的精度。这意味着您可以在牺牲极少量检索质量的同时,将向量存储减少 75%(256→1024)或 50%(512→1024)。对于绝大多数 RAG 工作负载,256 维在成本与精度之间达到了极佳的平衡。

TheRouter 编辑重写aws.amazon.com ↗
Titan V2 支持跨语言搜索吗(例如,用德语查询韩语语料库)?

尽管预训练覆盖 100+ 种语言,AWS 明确表示跨语言查询将给出 '次优结果'。该模型在其训练语言内的单语检索方面表现出色;对于稳健的跨语言搜索,请考虑专门为此场景设计的 OpenAI text‑embedding‑3‑large 或 Cohere embed‑v4。

TheRouter 编辑重写docs.aws.amazon.com ↗
为什么 Bedrock 用每分钟请求数而非每分钟令牌数来限速嵌入模型?性能会受什么影响?

嵌入模型每个请求处理相对较短的文本(≤8192 标记),因此吞吐量受限于每个请求的计算开销,而非令牌流处理能力。RPM 配额确保各租户的公平使用。对于大规模索引任务,请通过 AWS Support 申请增加配额,或使用 Bedrock Batch 进行吞吐量优化的批量嵌入。

TheRouter 编辑重写docs.aws.amazon.com ↗
Titan V2 与其前代 Titan G1(V1)有何不同?

Titan V2 带来了三大升级:(1) 可配置维度(256/512/1024),而 G1 固定为 1536;(2) 单位向量归一化,提高了余弦相似度精度,尤其是在 RAG 场景下;(3) 支持 100+ 种语言(预训练),G1 仅支持 25+。此外,每令牌成本降低 5 倍(每百万 $0.02 对比 $0.10),并在 256 维下保持了 >97% 的 G1 检索精度。

TheRouter 编辑重写aws.amazon.com ↗
事实档案 — 本页每条断言可在此回溯来源
来源URL采集于
发布日期Amazon Bedrock docs ↗2026-08-23已核实
输出维度docs.aws.amazon.com ↗2026-08-23已核实
向量归一化docs.aws.amazon.com ↗2026-08-23已核实
支持语种docs.aws.amazon.com ↗2026-08-23已核实
最大输入字符数docs.aws.amazon.com ↗2026-08-23已核实
训练数据截止日期——未知
令牌与字符比(英语)docs.aws.amazon.com ↗2026-08-23已核实
MTEB (Massive Text Embedding Benchmark) weighted averageAWS ML blog ↗2026-08-23已核实
MTEB rerankingaws.amazon.com ↗2026-08-23已核实
MIRACL multilingualaws.amazon.com ↗2026-08-23已核实
Amazon Titan Text Embeddings V2 现已在 Amazon Bedrock 上线AWS News Blog ↗2026-08-23已核实
开始使用 Amazon Titan Text Embeddings V2:Amazon Bedrock 的新一代前沿嵌入模型AWS Machine Learning Blog ↗2026-08-23已核实
在 256、512 和 1024 维度之间,实际精度‑存储权衡如何?aws.amazon.com ↗2026-08-23待核实
Titan V2 支持跨语言搜索吗(例如,用德语查询韩语语料库)?docs.aws.amazon.com ↗2026-08-23待核实
为什么 Bedrock 用每分钟请求数而非每分钟令牌数来限速嵌入模型?性能会受什么影响?docs.aws.amazon.com ↗2026-08-23待核实
Titan V2 与其前代 Titan G1(V1)有何不同?aws.amazon.com ↗2026-08-23待核实
帮助与联系