Назад к моделям

GPT OSS Safeguard 120B

openaiopenai/gpt-oss-safeguard-120b

OpenAI's advanced safety reasoning model (120B). Nuanced policy interpretation, multi-turn safety analysis, and justified decisions for content moderation.

GPT OSS Safeguard 120B — первая модель безопасности с открытыми весами от OpenAI, выпущенная в октябре 2025 года как исследовательский предварительный просмотр под лицензией Apache 2.0. Это доработанная версия gpt-oss-120b — 117-миллиардного MoE-трансформера (5,1B активных параметров на прямой проход), специализированная для классификации контента на основе политик. В отличие от традиционных моделей модерации, которые изучают границу решений на размеченных примерах, Safeguard рассуждает непосредственно на основе политики, предоставленной разработчиком, используя цепочку рассуждений для получения объяснимых классификаций.

В продакшене GPT OSS Safeguard 120B выполняет роль гибкого слоя модерации контента на основе рассуждений. Разработчики предоставляют собственные политики во время инференса — например, правила борьбы с читерством на игровом форуме или политику выявления фальшивых отзывов на платформе — и модель классифицирует каждый ввод в соответствии с этими политиками, выводя свои рассуждения. Она превосходна в доменах с быстро меняющимися рисками, где политики должны адаптироваться оперативно, тонких сценариях, где традиционные классификаторы пасуют, и ситуациях, где важны объяснимые решения модерации. Согласно внутренним оценкам OpenAI, модель безопасности превосходит gpt-5-thinking по точности многополитичной классификации, несмотря на значительно меньший размер.

Когда выбирать
  • • Модерация контента на основе собственных политик — используйте свои правила для классификации пользовательского контента.
  • • Домены с меняющимися рисками — обновляйте политики во время инференса без переобучения классификаторов.
  • • Объяснимая модерация — цепочка рассуждений предоставляет проверяемое обоснование для каждого решения классификации.
  • • Локальные пайплайны безопасности — развёртывание on-premises на одном 80GB GPU с полным суверенитетом данных.
  • • Многополитичная классификация — одновременная оценка контента по нескольким политикам в одном инференсе.
Когда не выбирать
  • • Высокопроизводительная модерация в масштабе — подход на основе рассуждений требует больших вычислений и медленнее лёгких классификаторов. Для массовой классификации используйте традиционные модели.
  • • Низкая задержка / фильтрация в реальном времени — gpt-oss-safeguard-20b — более лёгкая альтернатива; для ещё более быстрой предварительной фильтрации рекомендуются выделенные классификаторы.
  • • Домены с большим объёмом данных и стабильными политиками — традиционные классификаторы, обученные на десятках тысяч качественных примеров, могут превзойти подход на основе рассуждений для хорошо изученных категорий риска.
Размер контекста
128K
Максимальный вывод
16K
Цена Входза 1M токенов
$0.162за 1 млн токенов
Цена Выходза 1M токенов
$0.648за 1 млн токенов

Модальности

Текст→Текст

Разбивка цен

ТипСтавка
Вход$0.162 за 1 млн токенов
Выход$0.648 за 1 млн токенов

Поддерживаемые параметры

temperaturemax_tokenstop_presponse_formatstop

Характеристики

Дата релиза2025-10-29 (исследовательский превью)openai.com ↗проверено
Базовая модельgpt-oss-120b — MoE Transformer (116,8B всего / 5,1B активных на токен)arxiv.org ↗проверено
ЛицензияApache 2.0openai.com ↗проверено
АрхитектураMoE Transformer — 36 слоёв, 128 экспертов, top-4 активны, 116,8B всего / 5,1B активных параметровarxiv.org ↗проверено
Контекстное окно128K токеновopenai.com ↗проверено
Токенизаторo200k_harmony (201 088 токенов)arxiv.org ↗проверено
КвантизацияMXFP4 (4,25 бит/параметр на MoE-весах)arxiv.org ↗проверено
Назначение моделиКлассификация безопасности на основе политик с deliberative reasoningopenai.com ↗проверено
ОграничениеВыделенные классификаторы с большими наборами размеченных данных могут превзойти на хорошо изученных категориях рискаopenai.com ↗проверено

Бенчмарки

BenchmarkDistributionScoreSource
Multi-policy accuracy (internal)
Превзошла gpt-5-thinking и базовые gpt-oss-модели на одновременной многополитичной классификации (внутренняя оценка).
Best among tested modelsopenai.com ↗
2022 Moderation eval (internal policy)
Незначительно превзошла все протестированные модели, включая внутренний Safety Reasoner и gpt-5-thinking (разница статистически незначима).
~95.7%openai.com ↗
ToxicChat
Safety Reasoner и gpt-5-thinking незначительно превосходят gpt-oss-safeguard-120b; небольшой размер по-прежнему является преимуществом для этого типа задач.
Comparable to Safety Reasoner / gpt-5-thinkingopenai.com ↗

Примеры API

Для новых интеграций используйте глобальный endpoint api.therouter.ai из примеров ниже; старый China accelerated endpoint выведен из эксплуатации.

cURL
curl https://api.therouter.ai/v1/chat/completions   -H "Content-Type: application/json"   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -d '{
    "model": "openai/gpt-oss-safeguard-120b",
    "messages": [
      {"role": "user", "content": "Summarize the key points from this input."}
    ]
  }'

Chat completion

Используйте стандартный совместимый с OpenAI chat completion через TheRouter. Модель принимает политику в системном сообщении или сообщении разработчика и классифицирует вводной контент в соответствии с ней.

cURL
curl https://api.therouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "openai/gpt-oss-safeguard-120b",
    "messages": [
      {"role": "system", "content": "You are a safety classifier. Apply the policy faithfully."},
      {"role": "developer", "content": "Policy: Classify messages as SAFE or UNSAFE. UNSAFE includes hate speech, harassment, and spam. SAFE includes all other content."},
      {"role": "user", "content": "I love this product! It works great."}
    ]
  }'

Ещё от openai

Похожие модели

Аналоги в других провайдерах

Новости и изменения

2025-10-29

OpenAI выпускает gpt-oss-safeguard — модели безопасности с открытыми весами

OpenAI выпустила gpt-oss-safeguard-120b и gpt-oss-safeguard-20b — исследовательские модели с открытыми весами для классификации безопасности на основе политик. Модели используют цепочку рассуждений для интерпретации политик разработчика во время инференса, поддерживая домены с меняющимися рисками и многополитичную классификацию. Доступны под лицензией Apache 2.0.

переработано TheRouteropenai.com ↗

Частые вопросы

Чем gpt-oss-safeguard-120b отличается от Moderation API от OpenAI?

Moderation API использует традиционные классификаторы, обученные на размеченных примерах по предопределённым политикам. gpt-oss-safeguard использует рассуждения для интерпретации политики разработчика во время инференса, создавая объяснимые классификации через цепочку рассуждений. Это делает её более гибкой для меняющихся политик, тонких доменов и пользовательских определений политик — но медленнее и требует больше вычислений.

переработано TheRouteropenai.com ↗
Может ли TheRouter хостить gpt-oss-safeguard-120b, чтобы мне не нужно было самостоятельно разворачивать модель?

Да. gpt-oss-safeguard-120b доступна на TheRouter через стандартный совместимый с OpenAI API по адресу https://api.therouter.ai/v1 с идентификатором модели openai/gpt-oss-safeguard-120b. Вам не нужно управлять собственным GPU-оборудованием.

переработано TheRouteropenai.com ↗
Реестр фактов — каждая утверждаемая величина имеет источник
источникURLполучено
Дата релизаopenai.com ↗2026-05-29проверено
Базовая модельarxiv.org ↗2026-05-29проверено
Лицензияopenai.com ↗2026-05-29проверено
Архитектураarxiv.org ↗2026-05-29проверено
Контекстное окноopenai.com ↗2026-05-29проверено
Токенизаторarxiv.org ↗2026-05-29проверено
Квантизацияarxiv.org ↗2026-05-29проверено
Назначение моделиopenai.com ↗2026-05-29проверено
Ограничениеopenai.com ↗2026-05-29проверено
Multi-policy accuracy (internal)openai.com ↗2026-05-29проверено
2022 Moderation eval (internal policy)openai.com ↗2026-05-29к проверке
ToxicChatopenai.com ↗2026-05-29к проверке
OpenAI выпускает gpt-oss-safeguard — модели безопасности с открытыми весамиopenai.com ↗2026-05-29проверено
Чем gpt-oss-safeguard-120b отличается от Moderation API от OpenAI?openai.com ↗2026-05-29к проверке
Может ли TheRouter хостить gpt-oss-safeguard-120b, чтобы мне не нужно было самостоятельно разворачивать модель?openai.com ↗2026-05-29к проверке
Помощь и контакты