Назад к моделям

GPT OSS Safeguard 20B

openaiopenai/gpt-oss-safeguard-20b

OpenAI's safety classification model (20B). Policy reasoning, content filtering, risk analysis, and justification generation.

gpt-oss-safeguard-20b от OpenAI — open-weight модель безопасности, дообученная на базе gpt-oss-20b и выпущенная 29 октября 2025 года под лицензией Apache 2.0. Она классифицирует текстовый контент на основе политик безопасности, предоставленных разработчиком во время инференса — гораздо более гибкий подход, чем обучение отдельных классификаторов для каждой категории риска. Модель использует цепь рассуждений (с настраиваемым усилием: низкий/средний/высокий) и выводит результаты в формате Harmony от OpenAI.

Модель имеет 21B общих параметров (3.6B активных, MoE-архитектура), что позволяет запускать её на одном GPU с 16 ГБ — идеально для локальных или изолированных пайплайнов безопасности. Она подходит платформам, которым нужно модерировать контент по быстро меняющимся собственным политикам без переобучения классификаторов. Модель принимает два входа одновременно — политику (правила на естественном языке) и подлежащий классификации контент — и выводит обоснованное заключение.

Когда выбирать
  • • Классификация пользовательского контента по быстро меняющимся политикам безопасности (игровые форумы, платформы отзывов, социальные ленты)
  • • Рассуждения по новым или нюансированным категориям вреда, когда размеченных данных недостаточно
  • • Аудируемые пайплайны безопасности, где требуется цепь рассуждений для соответствия требованиям и отладки
  • • Локальная или изолированная модерация контента с компактной моделью (один GPU на 16 ГБ)
Когда не выбирать
  • • Высокоскоростная модерация с низкой задержкой — используйте лёгкие классификаторы (например, Moderation API), оставив gpt-oss-safeguard для асинхронной проверки
  • • Сценарии, где есть десятки тысяч качественно размеченных примеров — обученный классификатор часто превзойдёт подход на основе рассуждений по политике
  • • Общие чаты и генерация контента — базовые gpt-oss или gpt-5 лучше подходят для взаимодействия с конечными пользователями
Размер контекста
128K
Максимальный вывод
16K
Цена Входза 1M токенов
$0.0756за 1 млн токенов
Цена Выходза 1M токенов
$0.216за 1 млн токенов

Модальности

Текст→Текст

Разбивка цен

ТипСтавка
Вход$0.0756 за 1 млн токенов
Выход$0.216 за 1 млн токенов

Поддерживаемые параметры

temperaturemax_tokenstop_presponse_formatstop

Характеристики

Дата релиза29 октября 2025 г.openai.com ↗проверено
ЛицензияApache 2.0huggingface.co ↗проверено
Архитектура21B всего, 3.6B активных параметров (MoE)github.com ↗проверено
Базовая модельgpt-oss-20bopenai.com ↗проверено
Требования к GPUПомещается на один GPU с ≥16 ГБ VRAMhuggingface.co ↗проверено
Формат ответаФормат Harmony (обязателен) — структурированные каналы рассуждений и классификацииgithub.com ↗проверено
Размер весов13.8 ГБ (FP16)huggingface.co ↗проверено
Дата отсечения данныхНе раскрыто (наследует дату отсечения gpt-oss-20b)неизвестно

Бенчмарки

BenchmarkDistributionScoreSource
Multi-policy accuracy (internal eval)
Оценка на одновременной классификации по нескольким политикам — верный ответ требует совпадения со всеми эталонными метками
Outperforms gpt-5-thinking and gpt-ossopenai.com ↗
2022 Moderation Evaluation Set
Оценка по внутренним политикам безопасности. Разница с Safety Reasoner статистически незначима
Slightly outperforms internal Safety Reasoner and gpt-5-thinkingopenai.com ↗
ToxicChat
Оценка по короткому промпту, адаптированному из внутренних политик. Меньший размер модели ожидаемо уступает лёгким классификаторам
Marginally behind gpt-5-thinking and Safety Reasoneropenai.com ↗

Примеры API

Для новых интеграций используйте глобальный endpoint api.therouter.ai из примеров ниже; старый China accelerated endpoint выведен из эксплуатации.

cURL
curl https://api.therouter.ai/v1/chat/completions   -H "Content-Type: application/json"   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -d '{
    "model": "openai/gpt-oss-safeguard-20b",
    "messages": [
      {"role": "user", "content": "Summarize the key points from this input."}
    ]
  }'

Классификация безопасности через Chat API

Модели gpt-oss-safeguard используют формат Harmony от OpenAI. Передайте политику и контент в сообщении пользователя. Модель вернёт структурированные рассуждения и заключение.

cURL
curl https://api.therouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "openai/gpt-oss-safeguard-20b",
    "messages": [
      {
        "role": "system",
        "content": "You are a safety classifier. You must respond in the Harmony format."
      },
      {
        "role": "user",
        "content": "[POLICY]\nClassify the following user message as:\n- hate_speech: content that attacks or demeans a group based on protected attributes\n- harassment: content that targets an individual with threats or degrading language\n- safe: none of the above\n\n[CONTENT]\nI completely disagree with your opinion on this topic."
      }
    ],
    "reasoning_effort": "medium"
  }'

Ещё от openai

Похожие модели

Аналоги в других провайдерах

Новости и изменения

2025-10-29

OpenAI выпускает gpt-oss-safeguard — open-weight модели безопасности

OpenAI выпустила две open-weight модели безопасности (120B и 20B) под лицензией Apache 2.0, дообученные на базе gpt-oss. Модели принимают политики безопасности от разработчика непосредственно во время инференса для классификации контента без переобучения. Включает технический отчёт, руководство по промптам и партнёрство с ROOST Model Community.

переработано TheRouteropenai.com ↗

Частые вопросы

Что такое формат Harmony и почему он обязателен?

Harmony — это структурированный формат ответов OpenAI для моделей классификации безопасности. Он разделяет рассуждения на отдельные каналы: анализ политики, решение о классификации и обоснование. Модели gpt-oss-safeguard обучены специально для этого формата и не работают правильно без него. Примеры — в руководстве по промптам.

Чем это отличается от Moderation API OpenAI?

Moderation API использует лёгкие обученные классификаторы с фиксированными политиками. Это быстро и дёшево, но не адаптируется под пользовательские политики без переобучения. gpt-oss-safeguard рассуждает напрямую по любой политике во время инференса — переобучение не требуется — но требует больше вычислений и имеет бо́льшую задержку. На практике многие платформы используют лёгкие классификаторы для первичного фильтра, затем передают отмеченный контент на gpt-oss-safeguard для глубокого анализа.

Можно ли использовать gpt-oss-safeguard-20b через TheRouter API?

Да. TheRouter поддерживает gpt-oss-safeguard-20b через стандартный OpenAI-совместимый эндпоинт /v1/chat/completions. Модель требует формат Harmony и не поддерживает tools/tool_choice. См. пример curl выше.

Какое усилие рассуждений следует использовать?

Используйте 'low' для высокопроизводительной предфильтрации, когда скорость важна, а политики просты. 'medium' — значение по умолчанию для большинства production-пайплайнов. 'high' — для сложных нюансированных политик (например, отличия разжигания ненависти от легитимной политической дискуссии) или когда нужна детальная цепь рассуждений для аудита.

Реестр фактов — каждая утверждаемая величина имеет источник
источникURLполучено
Дата релизаopenai.com ↗2026-05-29проверено
Лицензияhuggingface.co ↗2026-05-29проверено
Архитектураgithub.com ↗2026-05-29проверено
Базовая модельopenai.com ↗2026-05-29проверено
Требования к GPUhuggingface.co ↗2026-05-29проверено
Формат ответаgithub.com ↗2026-05-29проверено
Размер весовhuggingface.co ↗2026-05-29проверено
Дата отсечения данных——неизвестно
Multi-policy accuracy (internal eval)openai.com ↗2026-05-29проверено
2022 Moderation Evaluation Setopenai.com ↗2026-05-29проверено
ToxicChatopenai.com ↗2026-05-29проверено
OpenAI выпускает gpt-oss-safeguard — open-weight модели безопасностиopenai.com ↗2026-05-29проверено
Что такое формат Harmony и почему он обязателен?cookbook.openai.com ↗2026-05-29к проверке
Чем это отличается от Moderation API OpenAI?openai.com ↗2026-05-29к проверке
Какое усилие рассуждений следует использовать?github.com ↗2026-05-29к проверке
Помощь и контакты