OpenAI 发布 gpt-oss-safeguard 开源安全推理模型
OpenAI 以 Apache 2.0 协议发布了两个开源安全模型(120B 和 20B),基于 gpt-oss 微调。模型在推理时直接根据开发者提供的策略进行推理分类,支持自带策略的内容审核而无需重新训练。发布内容还包括技术报告、提示指南和 ROOST 模型社区合作。
OpenAI's safety classification model (20B). Policy reasoning, content filtering, risk analysis, and justification generation.
OpenAI 的 gpt-oss-safeguard-20b 是基于 gpt-oss-20b 微调的开源安全推理模型,于 2025 年 10 月 29 日以 Apache 2.0 协议发布。它利用推理能力在推理时根据开发者自定义的安全策略对文本内容进行分类 — 比针对每种风险类别训练独立分类器更加灵活。模型使用链式思维推理(支持低/中/高三种推理强度),并以 OpenAI 的 Harmony 响应格式输出可审计的分类结论。
该模型拥有 21B 总参数和 3.6B 活跃参数(基于 MoE 架构),20B 变体可装入单张 16GB GPU,特别适合本地部署或离线安全管线。适用于需要根据快速迭代的自定义策略进行内容审核的平台,无需重新训练分类器。模型同时接受两个输入——策略(自然语言规则)和待分类内容——然后输出包含推理过程的分类结论。
| 类型 | 费率 |
|---|---|
| 输入 | $0.0756 每百万 Tokens |
| 输出 | $0.216 每百万 Tokens |
| 发布日期 | 2025 年 10 月 29 日openai.com ↗ | 已核实 |
| 许可协议 | Apache 2.0huggingface.co ↗ | 已核实 |
| 架构 | 21B 总参数,3.6B 活跃参数(MoE)github.com ↗ | 已核实 |
| 基座模型 | gpt-oss-20bopenai.com ↗ | 已核实 |
| GPU 要求 | 可装入单张 ≥16GB VRAM 的 GPUhuggingface.co ↗ | 已核实 |
| 响应格式 | Harmony 格式(必需)——结构化推理与分类通道github.com ↗ | 已核实 |
| 模型权重大小 | 13.8 GB(FP16)huggingface.co ↗ | 已核实 |
| 训练数据截止 | 未公开披露(继承 gpt-oss-20b 的数据截止日期) | 未知 |
| Benchmark | Distribution | Score | Source |
|---|---|---|---|
Multi-policy accuracy (internal eval) 在同时多策略分类评估中测试——模型必须在所有策略上都匹配黄金标签才算正确 | Outperforms gpt-5-thinking and gpt-oss | openai.com ↗ | |
2022 Moderation Evaluation Set 使用内部安全政策进行评估。与 Safety Reasoner 的差异无统计显著性 | Slightly outperforms internal Safety Reasoner and gpt-5-thinking | openai.com ↗ | |
ToxicChat 使用从内部政策改编的简短提示进行评估。较小的模型规模使得本任务更偏向轻量级分类器 | Marginally behind gpt-5-thinking and Safety Reasoner | openai.com ↗ |
所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。
curl https://api.therouter.ai/v1/chat/completions -H "Content-Type: application/json" -H "Authorization: Bearer $THE_ROUTER_API_KEY" -d '{
"model": "openai/gpt-oss-safeguard-20b",
"messages": [
{"role": "user", "content": "Summarize the key points from this input."}
]
}'gpt-oss-safeguard 模型使用 OpenAI 的 Harmony 响应格式。在用户消息中同时提供策略和待分类内容,模型将返回结构化推理和分类结论。
curl https://api.therouter.ai/v1/chat/completions \
-H "Authorization: Bearer $THEROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "openai/gpt-oss-safeguard-20b",
"messages": [
{
"role": "system",
"content": "You are a safety classifier. You must respond in the Harmony format."
},
{
"role": "user",
"content": "[POLICY]\nClassify the following user message as:\n- hate_speech: content that attacks or demeans a group based on protected attributes\n- harassment: content that targets an individual with threats or degrading language\n- safe: none of the above\n\n[CONTENT]\nI completely disagree with your opinion on this topic."
}
],
"reasoning_effort": "medium"
}'OpenAI 以 Apache 2.0 协议发布了两个开源安全模型(120B 和 20B),基于 gpt-oss 微调。模型在推理时直接根据开发者提供的策略进行推理分类,支持自带策略的内容审核而无需重新训练。发布内容还包括技术报告、提示指南和 ROOST 模型社区合作。
Harmony 是 OpenAI 专为安全分类模型设计的结构化响应格式。它将模型的推理过程分为专用通道:策略分析通道、分类决策通道和支持理由通道。gpt-oss-safeguard 模型专门针对此格式训练,没有它将无法正常工作。详见 Cookbook 提示指南。
Moderation API 使用轻量级训练分类器,采用固定安全策略。速度快、成本低,但无法在不重新训练的情况下适配自定义策略。gpt-oss-safeguard 在推理时直接根据你提供的任何策略进行推理——无需重新训练——但计算量更大、延迟更高。实践中许多平台先用轻量级分类器做初筛,再将标记内容路由到 gpt-oss-safeguard 进行深度策略推理。
可以。TheRouter 通过标准的 OpenAI 兼容 /v1/chat/completions 端点支持 gpt-oss-safeguard-20b。请注意该模型需要使用 Harmony 响应格式,不支持 tools/tool_choice。参考上面的 curl 示例。
当速度重要且策略简单时,用 'low' 进行高吞吐量预过滤;大多数生产管线用 'medium' 作为默认值;'high' 用于复杂、细微的策略(如区分仇恨言论与合法政治辩论),或需要详细链式思维用于审计追踪时。
| 来源 | URL | 采集于 | |
|---|---|---|---|
| 发布日期 | openai.com ↗ | 2026-05-29 | 已核实 |
| 许可协议 | huggingface.co ↗ | 2026-05-29 | 已核实 |
| 架构 | github.com ↗ | 2026-05-29 | 已核实 |
| 基座模型 | openai.com ↗ | 2026-05-29 | 已核实 |
| GPU 要求 | huggingface.co ↗ | 2026-05-29 | 已核实 |
| 响应格式 | github.com ↗ | 2026-05-29 | 已核实 |
| 模型权重大小 | huggingface.co ↗ | 2026-05-29 | 已核实 |
| 训练数据截止 | — | — | 未知 |
| Multi-policy accuracy (internal eval) | openai.com ↗ | 2026-05-29 | 已核实 |
| 2022 Moderation Evaluation Set | openai.com ↗ | 2026-05-29 | 已核实 |
| ToxicChat | openai.com ↗ | 2026-05-29 | 已核实 |
| OpenAI 发布 gpt-oss-safeguard 开源安全推理模型 | openai.com ↗ | 2026-05-29 | 已核实 |
| 什么是 Harmony 响应格式,为什么必须使用它? | cookbook.openai.com ↗ | 2026-05-29 | 待核实 |
| 它和 OpenAI Moderation API 有什么不同? | openai.com ↗ | 2026-05-29 | 待核实 |
| 应该使用哪种推理强度? | github.com ↗ | 2026-05-29 | 待核实 |