Назад к моделям

text-embedding-v4 — новейшее поколение мультиязычного text embedding от Qwen общего назначения. Рекомендуемый выбор для новых RAG-индексов, семантического поиска, кластеризации и классификации — выше качество retrieval, чем у v3, при той же цене.

Тот же OpenAI-совместимый `/v1/embeddings`, что и у v3: миграция — замена model ID плюс разовая переиндексация. TheRouter выбирает более дешёвый из bailian-cn / bailian-sg на запрос.

Последнее поколение
Дефолтная embedding-модель Qwen для новых проектов — качество retrieval выше v3.
Мультиязычность
Китайский, английский и другие основные языки делят одно векторное пространство.
Окно входа 8K
Embed длинных пассажей без агрессивного чанкования — покрывает большинство RAG-срезов.
Двухрегиональная маршрутизация
Селектор выбирает bailian-cn или bailian-sg по стоимости запроса.
Когда выбирать
Новые RAG-индексы, семантический поиск, кластеризация, классификация, дедупликация — любой проект, стартующий сегодня и нуждающийся в мультиязычных embedding.
Когда не выбирать
Уже существующие индексы на text-embedding-v3, если переиндексация неоправдана — векторы между поколениями embedding не сравнимы.
Тарификация: $0.12 per MTok входа. TheRouter выбирает более дешёвый — bailian-cn или bailian-sg — на запрос.
Размер контекста
8K
Максимальный вывод
--
Цена Входза 1M токенов
$0.0756за 1 млн токенов

Модальности

Текст→embedding

Разбивка цен

ТипСтавка
Вход$0.0756 за 1 млн токенов

Поддерживаемые параметры

inputdimensionsencoding_format

Характеристики

Дата релиза2025-06-05qwenlm.github.io ↗проверено
Количество параметров4 млрдhuggingface.co ↗проверено
Слоёв Transformer36huggingface.co ↗проверено
Максимальная размерность эмбеддинга2560 (MRL: 32–2560)huggingface.co ↗проверено
Длина контекста (TheRouter)8 192 токенаtherouter.ai ↗проверено
Длина контекста upstream32 768 токеновhuggingface.co ↗проверено
Поддерживаемые языки100+ (естественные языки + языки программирования)github.com ↗проверено
Поддержка MRL (Matryoshka)Да — размерность выходных векторов настраивается от 32 до 2560huggingface.co ↗проверено
Instruction-aware промптингДа — добавление описания задачи перед запросом даёт +1–5% retrievalgithub.com ↗проверено
ЛицензияApache 2.0github.com ↗проверено
Дата отсечения данныхНе раскрытонеизвестно

Бенчмарки

BenchmarkDistributionScoreSource
MTEB Multilingual (Qwen3-Embedding-8B, for context)
Вариант 8B; занимал #1 в MTEB multilingual leaderboard по состоянию на 5 июня 2025 года. Вариант 4B (text-embedding-v4) имеет немного меньший балл, но остаётся конкурентоспособным в своём классе.
70.58scoreqwenlm.github.io ↗

Примеры API

Для новых интеграций используйте глобальный endpoint api.therouter.ai из примеров ниже; старый China accelerated endpoint выведен из эксплуатации.

cURL
curl https://api.therouter.ai/v1/chat/completions   -H "Content-Type: application/json"   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -d '{
    "model": "qwen/text-embedding-v4",
    "messages": [
      {"role": "user", "content": "Summarize the key points from this input."}
    ]
  }'

Гид по API

Запрос эмбеддинга

Генерация эмбеддингов через OpenAI-совместимый эндпоинт /v1/embeddings. Поддерживает настраиваемые выходные размерности (32–2560, Matryoshka MRL) и instruction-aware промптинг для прироста retrieval на 1–5%. TheRouter автоматически маршрутизирует между Alibaba Bailian bailian-cn и bailian-sg.

cURL
curl https://api.therouter.ai/v1/embeddings \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen/text-embedding-v4",
    "input": "The quick brown fox jumps over the lazy dog",
    "encoding_format": "float",
    "dimensions": 2560
  }'

# MRL: reduce dimensions for lower storage cost (range 32-2560)
# "dimensions": 512

# Instruction-aware query (prepend task prefix to query, NOT to documents):
# "input": "Instruct: Given a web search query, retrieve relevant passages that answer the query\nQuery: What is the capital of France?"

Ещё от qwen

Похожие модели

Аналоги в других провайдерах

Новости и изменения

2025-06-05

Серия Qwen3 Embedding открыта под лицензией Apache 2.0

Alibaba Qwen выпустила серии Qwen3-Embedding-0.6B/4B/8B и Qwen3-Reranker-0.6B/4B/8B на Hugging Face и ModelScope под лицензией Apache 2.0. Модель Embedding 8B заняла #1 в MTEB multilingual leaderboard с результатом 70,58. Вместе с релизом опубликован технический отчёт (arXiv 2506.05176) и обучающий код на GitHub.

переработано TheRouterqwenlm.github.io ↗

Частые вопросы

Является ли text-embedding-v4 тем же, что и Qwen3-Embedding-4B?

Да. qwen/text-embedding-v4 — это наименование API-продукта Alibaba Bailian для Qwen3-Embedding-4B. Model ID qwen/text-embedding-v4 в TheRouter маршрутизирует именно к этой модели. Вариант 8B через данный ID отдельно недоступен.

переработано TheRouterbailian.console.aliyun.com ↗
Можно ли перейти с text-embedding-v3 без переиндексирования?

Нет. Векторы v4 и v3 находятся в разных пространствах эмбеддингов и несовместимы. Полное переиндексирование вашей векторной базы данных обязательно. Если переиндексирование сейчас невозможно, продолжайте использовать qwen/text-embedding-v3 для существующих индексов до готовности к перестройке.

переработано TheRoutertherouter.ai ↗
Как использовать MRL для уменьшения размерности векторов?

Передайте параметр dimensions в запросе на создание эмбеддингов (например, dimensions: 512). Допустимый диапазон — 32–2560. Меньшая размерность снижает затраты на хранение и ANN-запросы с умеренными потерями качества; перед выбором уменьшенной размерности для продакшна проведите бенчмарк на своём датасете.

переработано TheRouterhuggingface.co ↗
Нужно ли добавлять префикс-инструкцию к документам, а не только к запросам?

Нет. Рекомендуемый паттерн — добавлять prefx с инструкцией только к запросу (например, Instruct: Given a web search query, retrieve relevant passages...\nQuery: <ваш запрос>). Входные данные для пассажей/документов должны отправляться без какого-либо инструкционного префикса. Добавление инструкций к документам обычно снижает качество retrieval.

переработано TheRoutergithub.com ↗
Реестр фактов — каждая утверждаемая величина имеет источник
источникURLполучено
Дата релизаqwenlm.github.io ↗2026-06-09проверено
Количество параметровhuggingface.co ↗2026-06-09проверено
Слоёв Transformerhuggingface.co ↗2026-06-09проверено
Максимальная размерность эмбеддингаhuggingface.co ↗2026-06-09проверено
Длина контекста (TheRouter)therouter.ai ↗2026-06-09проверено
Длина контекста upstreamhuggingface.co ↗2026-06-09проверено
Поддерживаемые языкиgithub.com ↗2026-06-09проверено
Поддержка MRL (Matryoshka)huggingface.co ↗2026-06-09проверено
Instruction-aware промптингgithub.com ↗2026-06-09проверено
Лицензияgithub.com ↗2026-06-09проверено
Дата отсечения данных——неизвестно
MTEB Multilingual (Qwen3-Embedding-8B, for context)qwenlm.github.io ↗2026-06-09проверено
Серия Qwen3 Embedding открыта под лицензией Apache 2.0qwenlm.github.io ↗2026-06-09проверено
Является ли text-embedding-v4 тем же, что и Qwen3-Embedding-4B?bailian.console.aliyun.com ↗2026-06-09к проверке
Можно ли перейти с text-embedding-v3 без переиндексирования?therouter.ai ↗2026-06-09к проверке
Как использовать MRL для уменьшения размерности векторов?huggingface.co ↗2026-06-09к проверке
Нужно ли добавлять префикс-инструкцию к документам, а не только к запросам?github.com ↗2026-06-09к проверке
Помощь и контакты