← Все статьи

Embeddings и Reranking API для LLM: сравнение OpenAI, DashScope, Cohere, Voyage AI и Jina

Кросс-провайдерный справочник по embedding и reranking API: спецификации моделей, размерности, ценообразование, совместимость с OpenAI SDK и матрица выбора для RAG-пайплайнов. OpenAI, DashScope (Qwen3), Cohere, Voyage AI, Jina.

· TheRouter

Embedding и reranking API — фундамент любого RAG-пайплайна, но каждый провайдер оборачивает их по-своему: разные model ID, управление размерностью, единицы тарификации и паттерны SDK. Мы подготовили этот справочник, чтобы можно было сравнить всё в одном месте.

OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.

TL;DR — Сравнительная таблица провайдеров

ПровайдерEmbedding-моделиМакс. размерностьМакс. токеновRerankingЦена (за 1M токенов)
OpenAItext-embedding-3-small, text-embedding-3-large1536 / 30728191Нет нативного reranker$0.02 (small), $0.13 (large)
DashScopetext-embedding-v3, Qwen3-Embedding-0.6B/4B/8B1024–40968192–32Kqwen3-rerank (замена gte-rerank, 30.05.2026)¥0.7/1M (~$0.10) для v3
CohereEmbed 410244096Rerank 3.5, Rerank 4 Fast, Rerank 4 Pro$4.00–$5.00/1M searches
Voyage AIvoyage-4-large, voyage-4, voyage-4-lite256–204832000rerank-2.5, rerank-2.5-lite$0.05–$0.18/1M tokens
Jinajina-embeddings-v4, jina-embeddings-v5до 40968192jina-reranker-v2~$0.02–$0.12/1M tokens

Цены получены в августе 2026 года с официальных страниц тарифов; уточняйте актуальные ставки перед внедрением.

OpenAI Embeddings

OpenAI предоставляет две текущие embedding-модели через endpoint /v1/embeddings:

text-embedding-3-small — 1536 измерений по умолчанию, поддержка MRL-снижения до 256. Цена — $0.02 за 1M токенов (скидка 50% при batch-вызовах). Подходит для бюджетных англоязычных задач retrieval.

text-embedding-3-large — 3072 измерения по умолчанию, также MRL до 256. Цена — $0.13 за 1M токенов. Более высокое качество по MTEB, особенно для мультиязычных и сложных семантических задач.

Обе модели принимают до 8191 input-токенов на запрос и возвращают нормализованные float-векторы.

from openai import OpenAI

client = OpenAI()

response = client.embeddings.create(
    model="text-embedding-3-large",
    input="Какую embedding-модель выбрать для RAG?",
    dimensions=1024  # MRL: снижение с 3072 до 1024
)

vector = response.data[0].embedding
print(f"Размерность: {len(vector)}")  # 1024

Нет нативного reranker. OpenAI не предлагает endpoint для reranking. RAG-пайплайны на базе OpenAI embedding обычно комбинируются с Cohere Rerank или open-source reranker (BGE-reranker-v2-m3).

Подробнее об API-паттернах OpenAI: руководство по rate limits и multi-provider fallback.

Источники: OpenAI Embeddings docs (получено 2026-08-07), OpenAI Pricing (получено 2026-08-07).

DashScope (Alibaba Cloud Model Studio): Embeddings и Reranking

DashScope предлагает управляемую embedding-модель (text-embedding-v3), open-weight серию Qwen3-Embedding и выделенное семейство reranking-моделей.

Embedding-модели

text-embedding-v3 — 1024 измерения по умолчанию, настраивается через параметр dimensions. Цена — ¥0.7 за 1M токенов (~$0.10 international). Поддерживает OpenAI-совместимый /v1/embeddings endpoint — меняете base_url на https://dashscope-intl.aliyuncs.com/compatible-mode/v1 и используете OpenAI Python SDK.

Qwen3-Embedding (запуск — июнь 2025):

МодельПараметрыМакс. токеновРазмерностьMRL
Qwen3-Embedding-0.6B0.6B32K1024Да (256–1024)
Qwen3-Embedding-4B4B32K2560Да (256–2560)
Qwen3-Embedding-8B8B32K4096Да (256–4096)

Qwen3-Embedding-8B набирает 70.58 на MTEB Multilingual, обгоняя Gemini-Embedding от Google. Все три размера поддерживают instruction-aware embedding и 100+ языков, включая языки программирования.

Reranking-модели

DashScope заменил gte-rerank (закат 30.05.2026) на семейство Qwen3-Reranker:

МодельПараметрыМакс. токеновMTEB-R
Qwen3-Reranker-0.6B0.6B32K65.80
Qwen3-Reranker-4B4B32K69.76
Qwen3-Reranker-8B8B32K69.02
from openai import OpenAI

client = OpenAI(
    api_key="your-dashscope-key",
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1"
)

# Embedding-запрос — тот же OpenAI SDK
response = client.embeddings.create(
    model="text-embedding-v3",
    input="Сравнение embedding для RAG",
    dimensions=1024
)

Подробнее о DashScope: руководство по Aliyun Bailian API и полный гайд по серии Qwen3.7.

Источники: Alibaba Cloud blog: Mastering Embedding with Qwen3 (получено 2026-08-07), Qwen3-Embedding technical report (получено 2026-08-07), DashScope pricing (получено 2026-08-07).

Cohere Embed и Rerank

Cohere специализируется на retrieval: Embed 4 и Rerank созданы для поиска и RAG, а не для генерации текста.

Embed 4 — embedding, оптимизированный для поиска и классификации. Поддерживает типы ввода search_document, search_query, classification, clustering. Цена — $4.00–$5.00 за 1M поисков (Cohere тарифицирует по количеству API-вызовов, не по токенам). Контекст — 4096 токенов. Доступен на AWS Bedrock и Google Cloud.

Rerank 3.5 — принимает query + список документов и возвращает оценки релевантности. Цена — $5.00 за 1M поисков. Документы до 4096 токенов. Лучший выбор, если нужен reranker без self-hosting.

Rerank 4 Fast / Rerank 4 Pro — более новые reranking-модели по той же цене $5.00/1M, с улучшенной точностью.

Cohere использует собственный SDK (не OpenAI-совместимый), но gateway LiteLLM и Portkey могут унифицировать интерфейс.

import cohere

co = cohere.ClientV2(api_key="your-cohere-key")

# Reranking: переранжирование top-k
results = co.rerank(
    model="rerank-v3.5",
    query="лучшая embedding-модель для RAG",
    documents=[
        "OpenAI text-embedding-3-large с 3072 измерениями...",
        "Cohere Embed 4 оптимизирован для поиска и классификации...",
        "BGE-M3 — open-source мультиязычная embedding-модель..."
    ],
    top_n=2
)

for r in results.results:
    print(f"Index: {r.index}, Score: {r.relevance_score:.4f}")

Источники: Cohere Pricing (получено 2026-08-07), Cohere Rerank docs (получено 2026-08-07).

Voyage AI (MongoDB): Embeddings и Reranking

Voyage AI, теперь часть MongoDB, предлагает специализированные embedding и reranking модели с высокими результатами на MTEB.

Embedding-модели (серия voyage-4, январь 2026)

МодельКонтекстРазмерностьВариантыЦена (за 1M токенов)
voyage-4-large32K1024256, 512, 2048$0.18
voyage-432K1024256, 512, 2048$0.12
voyage-4-lite32K1024256, 512, 2048$0.05
voyage-4-nano (open-weight)32K512128, 256—

Все embedding серии voyage-4 кросс-совместимы — векторы от voyage-4-large и voyage-4-lite можно сравнивать напрямую, что позволяет индексировать дорогой моделью, а искать — дешёвой.

Доменные модели: voyage-code-3 (retrieval кода), voyage-finance-2, voyage-law-2.

Reranking-модели

МодельОписание
rerank-2.5Универсальный reranker, максимальное качество
rerank-2.5-liteМеньшая задержка, чуть ниже точность

Voyage использует собственный API endpoint. LiteLLM обеспечивает интеграцию Voyage.

Источники: Voyage AI Models Overview (MongoDB docs) (получено 2026-08-07), LiteLLM Voyage docs (получено 2026-08-07).

Jina: Embeddings и Reranking

Jina AI предоставляет мультимодальные и мультиязычные embedding-модели, а также reranker.

jina-embeddings-v4 — мультимодальная embedding-модель для текста и изображений. Каждый image tile = 10 токенов. Поддерживает task-specific LoRA-адаптеры (retrieval, classification, text matching). До 8192 токенов.

jina-embeddings-v5 — новое поколение с улучшенной мультиязычной производительностью.

jina-reranker-v2 — cross-encoder reranker для уточнения результатов retrieval.

Jina использует endpoint https://api.jina.ai/v1/embeddings со схемой, похожей на OpenAI /v1/embeddings, что упрощает интеграцию.

Источники: Jina Embeddings API (получено 2026-08-07), Jina AI on Hugging Face (получено 2026-08-07).

SiliconFlow: хостинг embedding-моделей

SiliconFlow хостит open-source embedding-модели — BAAI/bge-m3 и BAAI/bge-large-zh-v1.5 — по конкурентным ценам, для некоторых моделей есть бесплатный тариф.

Если вы уже маршрутизируете chat completion через SiliconFlow, использование их embedding избавляет от интеграции дополнительного провайдера.

Подробнее: полный гайд по SiliconFlow API и руководство по маршрутизации бесплатных моделей SiliconFlow.

Матрица выбора: Embedding + Reranking для разных сценариев

СценарийРекомендуемый EmbeddingРекомендуемый RerankerОбоснование
Бюджетный англоязычный RAGOpenAI text-embedding-3-small ($0.02/1M)Cohere Rerank 3.5Самый дешёвый embedding + зрелый reranker
Мультиязычный production RAGQwen3-Embedding-8B или voyage-4-largeQwen3-Reranker-4B или rerank-2.5Топ MTEB multilingual, контекст 32K
Китайский язык — основнойDashScope text-embedding-v3qwen3-rerankOpenAI-совместимый, минимальная задержка в Китае
Code retrievalvoyage-code-3 или Qwen3-Embedding-8BQwen3-Reranker-8BДоменная настройка, высокий MTEB-Code
Self-hosted с минимальным бюджетомBAAI/bge-m3 (через SiliconFlow)BGE-reranker-v2-m3Open-weight, нет стоимости API при масштабировании
Максимальное качествоvoyage-4-large + 2048 dimsrerank-2.5Лучшие benchmark-результаты, 32K контекст

Компромиссы при снижении размерности

Все современные embedding-провайдеры поддерживают Matryoshka Representation Learning (MRL) — возможность обрезать embedding-вектор до меньшего числа измерений, сохраняя большую часть семантической информации:

  • OpenAI: text-embedding-3-large при 256 dims сохраняет ~96% качества полных 3072 dims (MTEB)
  • DashScope: Qwen3-Embedding-4B поддерживает 256–2560 custom dimensions
  • Voyage: серия voyage-4 поддерживает 256, 512, 1024, 2048

Когда снижать размерность:

  • Хранилище векторной базы — основная статья расходов (миллионы документов в Pinecone/Qdrant)
  • Задержка запроса важнее маргинального прироста качества
  • Нужна кросс-совместимость между уровнями моделей (серия voyage-4)

Когда сохранять полную размерность:

  • Юридические, медицинские или финансовые домены, где точность retrieval критична
  • Корпус достаточно мал, чтобы хранилище не было проблемой

Маршрутизация embedding-запросов между провайдерами

При маршрутизации embedding-запросов через gateway вроде TheRouter учитывайте:

  1. Совместимость endpoint: OpenAI и DashScope используют /v1/embeddings с одинаковой схемой. Cohere, Voyage и Jina требуют SDK-адаптеров или нормализации gateway.

  2. Параметр dimensions: работает одинаково в OpenAI и DashScope, но по-разному у Cohere (фиксирован) и Voyage (задаётся при запросе).

  3. Подсчёт токенов: разные токенизаторы — один и тот же текст даёт разное количество токенов. 500-словный документ может быть 700 токенов с tiktoken OpenAI и 650 с DashScope.

  4. Совместимость векторов: embedding от разных провайдеров не взаимозаменяемы. Нельзя индексировать с OpenAI embedding и искать с DashScope — это разные векторные пространства.

  5. Fallback: в отличие от chat completion, fallback для embedding требует переиндексации всего корпуса моделью fallback-провайдера. Тщательно выбирайте основного провайдера.

Подробнее о паттернах маршрутизации: руководство по стратегиям оптимизации затрат LLM API и сравнение unified LLM API gateway.

FAQ

Нужно ли использовать одну модель для embedding запросов и документов?

Да. Embedding-векторы сравнимы только когда созданы одной моделью. Некоторые провайдеры (Cohere) используют параметр input_type для разделения запросов и документов, но сама модель должна совпадать.

Как стратегия чанкинга влияет на качество embedding?

Короткие чанки (256–512 токенов) лучше работают с моделями с маленьким контекстом. Для моделей с 32K (Qwen3-Embedding, Voyage 4) можно делать embedding больших фрагментов или целых документов, но точность retrieval может снижаться для длинных пассажей. Экспериментируйте с вашим корпусом.

Можно ли смешивать embedding разных провайдеров в одной векторной базе?

Нет. Каждая embedding-модель создаёт векторы в своём семантическом пространстве. Все векторы в одном collection/index должны быть от одной модели. При смене провайдера потребуется переиндексация корпуса.

Какая разница в задержке между embedding и reranking?

Embedding обычно быстрый (5–20 мс на запрос для короткого текста). Reranking медленнее из-за cross-encoding запроса с каждым кандидатом — около 50–200 мс для reranking 25 документов, в зависимости от длины и размера модели.


Цены и доступность моделей проверены в августе 2026 года. Тарифы провайдеров часто меняются — перед production-внедрением сверяйтесь с официальной документацией.

Помощь и контакты