返回模型列表

GPT OSS Safeguard 20B

openaiopenai/gpt-oss-safeguard-20b

OpenAI's safety classification model (20B). Policy reasoning, content filtering, risk analysis, and justification generation.

OpenAI 的 gpt-oss-safeguard-20b 是基于 gpt-oss-20b 微调的开源安全推理模型,于 2025 年 10 月 29 日以 Apache 2.0 协议发布。它利用推理能力在推理时根据开发者自定义的安全策略对文本内容进行分类 — 比针对每种风险类别训练独立分类器更加灵活。模型使用链式思维推理(支持低/中/高三种推理强度),并以 OpenAI 的 Harmony 响应格式输出可审计的分类结论。

该模型拥有 21B 总参数和 3.6B 活跃参数(基于 MoE 架构),20B 变体可装入单张 16GB GPU,特别适合本地部署或离线安全管线。适用于需要根据快速迭代的自定义策略进行内容审核的平台,无需重新训练分类器。模型同时接受两个输入——策略(自然语言规则)和待分类内容——然后输出包含推理过程的分类结论。

适合使用
  • • 根据快速迭代的自定义安全策略对用户生成内容进行分类(如游戏论坛、评论平台、社交信息流)
  • • 对新兴或高度细分的危害类别进行政策推理,当标注训练数据不足时尤为有效
  • • 需要可审计安全管线的场景——链式思维推理有助于合规和调试
  • • 本地或隔离环境下的内容审核,模型轻量(单张 16GB GPU)
不适合使用
  • • 大规模低延迟、高吞吐量审核——应使用轻量级分类器(如 Moderation API),将 gpt-oss-safeguard 作为异步审阅层
  • • 有数万高质量标注样本的情况——传统专用分类器通常会比策略推理方法表现更好
  • • 通用聊天或内容生成——gpt-oss 基座模型或 gpt-5 系列更适合面向终端用户的场景
上下文长度
128K
最大输出
16K
输入价格每百万 tokens
$0.0756每百万 Tokens
输出价格每百万 tokens
$0.216每百万 Tokens

模态能力

文本→文本

价格明细

类型费率
输入$0.0756 每百万 Tokens
输出$0.216 每百万 Tokens

支持参数

temperaturemax_tokenstop_presponse_formatstop

模型规格

发布日期2025 年 10 月 29 日openai.com ↗已核实
许可协议Apache 2.0huggingface.co ↗已核实
架构21B 总参数,3.6B 活跃参数(MoE)github.com ↗已核实
基座模型gpt-oss-20bopenai.com ↗已核实
GPU 要求可装入单张 ≥16GB VRAM 的 GPUhuggingface.co ↗已核实
响应格式Harmony 格式(必需)——结构化推理与分类通道github.com ↗已核实
模型权重大小13.8 GB(FP16)huggingface.co ↗已核实
训练数据截止未公开披露(继承 gpt-oss-20b 的数据截止日期)未知

基准成绩

BenchmarkDistributionScoreSource
Multi-policy accuracy (internal eval)
在同时多策略分类评估中测试——模型必须在所有策略上都匹配黄金标签才算正确
Outperforms gpt-5-thinking and gpt-ossopenai.com ↗
2022 Moderation Evaluation Set
使用内部安全政策进行评估。与 Safety Reasoner 的差异无统计显著性
Slightly outperforms internal Safety Reasoner and gpt-5-thinkingopenai.com ↗
ToxicChat
使用从内部政策改编的简短提示进行评估。较小的模型规模使得本任务更偏向轻量级分类器
Marginally behind gpt-5-thinking and Safety Reasoneropenai.com ↗

API 使用示例

所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。

cURL
curl https://api.therouter.ai/v1/chat/completions   -H "Content-Type: application/json"   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -d '{
    "model": "openai/gpt-oss-safeguard-20b",
    "messages": [
      {"role": "user", "content": "Summarize the key points from this input."}
    ]
  }'

API 使用指南

完整 API 参考 →

通过 Chat API 进行安全分类

gpt-oss-safeguard 模型使用 OpenAI 的 Harmony 响应格式。在用户消息中同时提供策略和待分类内容,模型将返回结构化推理和分类结论。

cURL
curl https://api.therouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "openai/gpt-oss-safeguard-20b",
    "messages": [
      {
        "role": "system",
        "content": "You are a safety classifier. You must respond in the Harmony format."
      },
      {
        "role": "user",
        "content": "[POLICY]\nClassify the following user message as:\n- hate_speech: content that attacks or demeans a group based on protected attributes\n- harassment: content that targets an individual with threats or degrading language\n- safe: none of the above\n\n[CONTENT]\nI completely disagree with your opinion on this topic."
      }
    ],
    "reasoning_effort": "medium"
  }'

openai 其他模型

同类模型

跨供应商的相似能力档位

动态与变更

2025-10-29

OpenAI 发布 gpt-oss-safeguard 开源安全推理模型

OpenAI 以 Apache 2.0 协议发布了两个开源安全模型(120B 和 20B),基于 gpt-oss 微调。模型在推理时直接根据开发者提供的策略进行推理分类,支持自带策略的内容审核而无需重新训练。发布内容还包括技术报告、提示指南和 ROOST 模型社区合作。

TheRouter 编辑重写openai.com ↗

常见问题

什么是 Harmony 响应格式,为什么必须使用它?

Harmony 是 OpenAI 专为安全分类模型设计的结构化响应格式。它将模型的推理过程分为专用通道:策略分析通道、分类决策通道和支持理由通道。gpt-oss-safeguard 模型专门针对此格式训练,没有它将无法正常工作。详见 Cookbook 提示指南。

它和 OpenAI Moderation API 有什么不同?

Moderation API 使用轻量级训练分类器,采用固定安全策略。速度快、成本低,但无法在不重新训练的情况下适配自定义策略。gpt-oss-safeguard 在推理时直接根据你提供的任何策略进行推理——无需重新训练——但计算量更大、延迟更高。实践中许多平台先用轻量级分类器做初筛,再将标记内容路由到 gpt-oss-safeguard 进行深度策略推理。

能否通过 TheRouter API 使用 gpt-oss-safeguard-20b?

可以。TheRouter 通过标准的 OpenAI 兼容 /v1/chat/completions 端点支持 gpt-oss-safeguard-20b。请注意该模型需要使用 Harmony 响应格式,不支持 tools/tool_choice。参考上面的 curl 示例。

应该使用哪种推理强度?

当速度重要且策略简单时,用 'low' 进行高吞吐量预过滤;大多数生产管线用 'medium' 作为默认值;'high' 用于复杂、细微的策略(如区分仇恨言论与合法政治辩论),或需要详细链式思维用于审计追踪时。

事实档案 — 本页每条断言可在此回溯来源
来源URL采集于
发布日期openai.com ↗2026-05-29已核实
许可协议huggingface.co ↗2026-05-29已核实
架构github.com ↗2026-05-29已核实
基座模型openai.com ↗2026-05-29已核实
GPU 要求huggingface.co ↗2026-05-29已核实
响应格式github.com ↗2026-05-29已核实
模型权重大小huggingface.co ↗2026-05-29已核实
训练数据截止——未知
Multi-policy accuracy (internal eval)openai.com ↗2026-05-29已核实
2022 Moderation Evaluation Setopenai.com ↗2026-05-29已核实
ToxicChatopenai.com ↗2026-05-29已核实
OpenAI 发布 gpt-oss-safeguard 开源安全推理模型openai.com ↗2026-05-29已核实
什么是 Harmony 响应格式,为什么必须使用它?cookbook.openai.com ↗2026-05-29待核实
它和 OpenAI Moderation API 有什么不同?openai.com ↗2026-05-29待核实
应该使用哪种推理强度?github.com ↗2026-05-29待核实
帮助与联系