Embeddings и Reranking API для LLM: сравнение OpenAI, DashScope, Cohere, Voyage AI и Jina
Кросс-провайдерный справочник по embedding и reranking API: спецификации моделей, размерности, ценообразование, совместимость с OpenAI SDK и матрица выбора для RAG-пайплайнов. OpenAI, DashScope (Qwen3), Cohere, Voyage AI, Jina.
Embedding и reranking API — фундамент любого RAG-пайплайна, но каждый провайдер оборачивает их по-своему: разные model ID, управление размерностью, единицы тарификации и паттерны SDK. Мы подготовили этот справочник, чтобы можно было сравнить всё в одном месте.
OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.
TL;DR — Сравнительная таблица провайдеров
| Провайдер | Embedding-модели | Макс. размерность | Макс. токенов | Reranking | Цена (за 1M токенов) |
|---|---|---|---|---|---|
| OpenAI | text-embedding-3-small, text-embedding-3-large | 1536 / 3072 | 8191 | Нет нативного reranker | $0.02 (small), $0.13 (large) |
| DashScope | text-embedding-v3, Qwen3-Embedding-0.6B/4B/8B | 1024–4096 | 8192–32K | qwen3-rerank (замена gte-rerank, 30.05.2026) | ¥0.7/1M (~$0.10) для v3 |
| Cohere | Embed 4 | 1024 | 4096 | Rerank 3.5, Rerank 4 Fast, Rerank 4 Pro | $4.00–$5.00/1M searches |
| Voyage AI | voyage-4-large, voyage-4, voyage-4-lite | 256–2048 | 32000 | rerank-2.5, rerank-2.5-lite | $0.05–$0.18/1M tokens |
| Jina | jina-embeddings-v4, jina-embeddings-v5 | до 4096 | 8192 | jina-reranker-v2 | ~$0.02–$0.12/1M tokens |
Цены получены в августе 2026 года с официальных страниц тарифов; уточняйте актуальные ставки перед внедрением.
OpenAI Embeddings
OpenAI предоставляет две текущие embedding-модели через endpoint /v1/embeddings:
text-embedding-3-small — 1536 измерений по умолчанию, поддержка MRL-снижения до 256. Цена — $0.02 за 1M токенов (скидка 50% при batch-вызовах). Подходит для бюджетных англоязычных задач retrieval.
text-embedding-3-large — 3072 измерения по умолчанию, также MRL до 256. Цена — $0.13 за 1M токенов. Более высокое качество по MTEB, особенно для мультиязычных и сложных семантических задач.
Обе модели принимают до 8191 input-токенов на запрос и возвращают нормализованные float-векторы.
from openai import OpenAI
client = OpenAI()
response = client.embeddings.create(
model="text-embedding-3-large",
input="Какую embedding-модель выбрать для RAG?",
dimensions=1024 # MRL: снижение с 3072 до 1024
)
vector = response.data[0].embedding
print(f"Размерность: {len(vector)}") # 1024
Нет нативного reranker. OpenAI не предлагает endpoint для reranking. RAG-пайплайны на базе OpenAI embedding обычно комбинируются с Cohere Rerank или open-source reranker (BGE-reranker-v2-m3).
Подробнее об API-паттернах OpenAI: руководство по rate limits и multi-provider fallback.
Источники: OpenAI Embeddings docs (получено 2026-08-07), OpenAI Pricing (получено 2026-08-07).
DashScope (Alibaba Cloud Model Studio): Embeddings и Reranking
DashScope предлагает управляемую embedding-модель (text-embedding-v3), open-weight серию Qwen3-Embedding и выделенное семейство reranking-моделей.
Embedding-модели
text-embedding-v3 — 1024 измерения по умолчанию, настраивается через параметр dimensions. Цена — ¥0.7 за 1M токенов (~$0.10 international). Поддерживает OpenAI-совместимый /v1/embeddings endpoint — меняете base_url на https://dashscope-intl.aliyuncs.com/compatible-mode/v1 и используете OpenAI Python SDK.
Qwen3-Embedding (запуск — июнь 2025):
| Модель | Параметры | Макс. токенов | Размерность | MRL |
|---|---|---|---|---|
| Qwen3-Embedding-0.6B | 0.6B | 32K | 1024 | Да (256–1024) |
| Qwen3-Embedding-4B | 4B | 32K | 2560 | Да (256–2560) |
| Qwen3-Embedding-8B | 8B | 32K | 4096 | Да (256–4096) |
Qwen3-Embedding-8B набирает 70.58 на MTEB Multilingual, обгоняя Gemini-Embedding от Google. Все три размера поддерживают instruction-aware embedding и 100+ языков, включая языки программирования.
Reranking-модели
DashScope заменил gte-rerank (закат 30.05.2026) на семейство Qwen3-Reranker:
| Модель | Параметры | Макс. токенов | MTEB-R |
|---|---|---|---|
| Qwen3-Reranker-0.6B | 0.6B | 32K | 65.80 |
| Qwen3-Reranker-4B | 4B | 32K | 69.76 |
| Qwen3-Reranker-8B | 8B | 32K | 69.02 |
from openai import OpenAI
client = OpenAI(
api_key="your-dashscope-key",
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1"
)
# Embedding-запрос — тот же OpenAI SDK
response = client.embeddings.create(
model="text-embedding-v3",
input="Сравнение embedding для RAG",
dimensions=1024
)
Подробнее о DashScope: руководство по Aliyun Bailian API и полный гайд по серии Qwen3.7.
Источники: Alibaba Cloud blog: Mastering Embedding with Qwen3 (получено 2026-08-07), Qwen3-Embedding technical report (получено 2026-08-07), DashScope pricing (получено 2026-08-07).
Cohere Embed и Rerank
Cohere специализируется на retrieval: Embed 4 и Rerank созданы для поиска и RAG, а не для генерации текста.
Embed 4 — embedding, оптимизированный для поиска и классификации. Поддерживает типы ввода search_document, search_query, classification, clustering. Цена — $4.00–$5.00 за 1M поисков (Cohere тарифицирует по количеству API-вызовов, не по токенам). Контекст — 4096 токенов. Доступен на AWS Bedrock и Google Cloud.
Rerank 3.5 — принимает query + список документов и возвращает оценки релевантности. Цена — $5.00 за 1M поисков. Документы до 4096 токенов. Лучший выбор, если нужен reranker без self-hosting.
Rerank 4 Fast / Rerank 4 Pro — более новые reranking-модели по той же цене $5.00/1M, с улучшенной точностью.
Cohere использует собственный SDK (не OpenAI-совместимый), но gateway LiteLLM и Portkey могут унифицировать интерфейс.
import cohere
co = cohere.ClientV2(api_key="your-cohere-key")
# Reranking: переранжирование top-k
results = co.rerank(
model="rerank-v3.5",
query="лучшая embedding-модель для RAG",
documents=[
"OpenAI text-embedding-3-large с 3072 измерениями...",
"Cohere Embed 4 оптимизирован для поиска и классификации...",
"BGE-M3 — open-source мультиязычная embedding-модель..."
],
top_n=2
)
for r in results.results:
print(f"Index: {r.index}, Score: {r.relevance_score:.4f}")
Источники: Cohere Pricing (получено 2026-08-07), Cohere Rerank docs (получено 2026-08-07).
Voyage AI (MongoDB): Embeddings и Reranking
Voyage AI, теперь часть MongoDB, предлагает специализированные embedding и reranking модели с высокими результатами на MTEB.
Embedding-модели (серия voyage-4, январь 2026)
| Модель | Контекст | Размерность | Варианты | Цена (за 1M токенов) |
|---|---|---|---|---|
| voyage-4-large | 32K | 1024 | 256, 512, 2048 | $0.18 |
| voyage-4 | 32K | 1024 | 256, 512, 2048 | $0.12 |
| voyage-4-lite | 32K | 1024 | 256, 512, 2048 | $0.05 |
| voyage-4-nano (open-weight) | 32K | 512 | 128, 256 | — |
Все embedding серии voyage-4 кросс-совместимы — векторы от voyage-4-large и voyage-4-lite можно сравнивать напрямую, что позволяет индексировать дорогой моделью, а искать — дешёвой.
Доменные модели: voyage-code-3 (retrieval кода), voyage-finance-2, voyage-law-2.
Reranking-модели
| Модель | Описание |
|---|---|
| rerank-2.5 | Универсальный reranker, максимальное качество |
| rerank-2.5-lite | Меньшая задержка, чуть ниже точность |
Voyage использует собственный API endpoint. LiteLLM обеспечивает интеграцию Voyage.
Источники: Voyage AI Models Overview (MongoDB docs) (получено 2026-08-07), LiteLLM Voyage docs (получено 2026-08-07).
Jina: Embeddings и Reranking
Jina AI предоставляет мультимодальные и мультиязычные embedding-модели, а также reranker.
jina-embeddings-v4 — мультимодальная embedding-модель для текста и изображений. Каждый image tile = 10 токенов. Поддерживает task-specific LoRA-адаптеры (retrieval, classification, text matching). До 8192 токенов.
jina-embeddings-v5 — новое поколение с улучшенной мультиязычной производительностью.
jina-reranker-v2 — cross-encoder reranker для уточнения результатов retrieval.
Jina использует endpoint https://api.jina.ai/v1/embeddings со схемой, похожей на OpenAI /v1/embeddings, что упрощает интеграцию.
Источники: Jina Embeddings API (получено 2026-08-07), Jina AI on Hugging Face (получено 2026-08-07).
SiliconFlow: хостинг embedding-моделей
SiliconFlow хостит open-source embedding-модели — BAAI/bge-m3 и BAAI/bge-large-zh-v1.5 — по конкурентным ценам, для некоторых моделей есть бесплатный тариф.
Если вы уже маршрутизируете chat completion через SiliconFlow, использование их embedding избавляет от интеграции дополнительного провайдера.
Подробнее: полный гайд по SiliconFlow API и руководство по маршрутизации бесплатных моделей SiliconFlow.
Матрица выбора: Embedding + Reranking для разных сценариев
| Сценарий | Рекомендуемый Embedding | Рекомендуемый Reranker | Обоснование |
|---|---|---|---|
| Бюджетный англоязычный RAG | OpenAI text-embedding-3-small ($0.02/1M) | Cohere Rerank 3.5 | Самый дешёвый embedding + зрелый reranker |
| Мультиязычный production RAG | Qwen3-Embedding-8B или voyage-4-large | Qwen3-Reranker-4B или rerank-2.5 | Топ MTEB multilingual, контекст 32K |
| Китайский язык — основной | DashScope text-embedding-v3 | qwen3-rerank | OpenAI-совместимый, минимальная задержка в Китае |
| Code retrieval | voyage-code-3 или Qwen3-Embedding-8B | Qwen3-Reranker-8B | Доменная настройка, высокий MTEB-Code |
| Self-hosted с минимальным бюджетом | BAAI/bge-m3 (через SiliconFlow) | BGE-reranker-v2-m3 | Open-weight, нет стоимости API при масштабировании |
| Максимальное качество | voyage-4-large + 2048 dims | rerank-2.5 | Лучшие benchmark-результаты, 32K контекст |
Компромиссы при снижении размерности
Все современные embedding-провайдеры поддерживают Matryoshka Representation Learning (MRL) — возможность обрезать embedding-вектор до меньшего числа измерений, сохраняя большую часть семантической информации:
- OpenAI: text-embedding-3-large при 256 dims сохраняет ~96% качества полных 3072 dims (MTEB)
- DashScope: Qwen3-Embedding-4B поддерживает 256–2560 custom dimensions
- Voyage: серия voyage-4 поддерживает 256, 512, 1024, 2048
Когда снижать размерность:
- Хранилище векторной базы — основная статья расходов (миллионы документов в Pinecone/Qdrant)
- Задержка запроса важнее маргинального прироста качества
- Нужна кросс-совместимость между уровнями моделей (серия voyage-4)
Когда сохранять полную размерность:
- Юридические, медицинские или финансовые домены, где точность retrieval критична
- Корпус достаточно мал, чтобы хранилище не было проблемой
Маршрутизация embedding-запросов между провайдерами
При маршрутизации embedding-запросов через gateway вроде TheRouter учитывайте:
-
Совместимость endpoint: OpenAI и DashScope используют
/v1/embeddingsс одинаковой схемой. Cohere, Voyage и Jina требуют SDK-адаптеров или нормализации gateway. -
Параметр dimensions: работает одинаково в OpenAI и DashScope, но по-разному у Cohere (фиксирован) и Voyage (задаётся при запросе).
-
Подсчёт токенов: разные токенизаторы — один и тот же текст даёт разное количество токенов. 500-словный документ может быть 700 токенов с tiktoken OpenAI и 650 с DashScope.
-
Совместимость векторов: embedding от разных провайдеров не взаимозаменяемы. Нельзя индексировать с OpenAI embedding и искать с DashScope — это разные векторные пространства.
-
Fallback: в отличие от chat completion, fallback для embedding требует переиндексации всего корпуса моделью fallback-провайдера. Тщательно выбирайте основного провайдера.
Подробнее о паттернах маршрутизации: руководство по стратегиям оптимизации затрат LLM API и сравнение unified LLM API gateway.
FAQ
Нужно ли использовать одну модель для embedding запросов и документов?
Да. Embedding-векторы сравнимы только когда созданы одной моделью. Некоторые провайдеры (Cohere) используют параметр input_type для разделения запросов и документов, но сама модель должна совпадать.
Как стратегия чанкинга влияет на качество embedding?
Короткие чанки (256–512 токенов) лучше работают с моделями с маленьким контекстом. Для моделей с 32K (Qwen3-Embedding, Voyage 4) можно делать embedding больших фрагментов или целых документов, но точность retrieval может снижаться для длинных пассажей. Экспериментируйте с вашим корпусом.
Можно ли смешивать embedding разных провайдеров в одной векторной базе?
Нет. Каждая embedding-модель создаёт векторы в своём семантическом пространстве. Все векторы в одном collection/index должны быть от одной модели. При смене провайдера потребуется переиндексация корпуса.
Какая разница в задержке между embedding и reranking?
Embedding обычно быстрый (5–20 мс на запрос для короткого текста). Reranking медленнее из-за cross-encoding запроса с каждым кандидатом — около 50–200 мс для reranking 25 документов, в зависимости от длины и размера модели.
Цены и доступность моделей проверены в августе 2026 года. Тарифы провайдеров часто меняются — перед production-внедрением сверяйтесь с официальной документацией.