OpenAI 发布 gpt-oss-safeguard——开源权重安全推理模型
OpenAI 发布了 gpt-oss-safeguard-120b 和 gpt-oss-safeguard-20b 研究预览版开源权重模型,用于基于策略的安全分类。这些模型使用思维链推理在推理时解释开发者定义的策略,支持演化风险领域和多策略分类。基于 Apache 2.0 许可证。
OpenAI's advanced safety reasoning model (120B). Nuanced policy interpretation, multi-turn safety analysis, and justified decisions for content moderation.
GPT OSS Safeguard 120B 是 OpenAI 首个开源权重的安全推理模型,于 2025 年 10 月作为研究预览版以 Apache 2.0 许可证发布。它是基于 gpt-oss-120b(117B 参数 MoE 变压器,每次前向传播活跃 5.1B 参数)微调后的变体,专用于基于策略的内容分类。与传统审核模型通过标注示例学习决策边界不同,Safeguard 在推理时直接根据开发者提供的策略进行推理,利用思维链产生可解释的分类结果。
在生产环境中,GPT OSS Safeguard 120B 充当灵活、基于推理的内容审核层。开发者在推理时提供自己的策略——例如游戏论坛的反作弊规则或评论平台的虚假评论策略——模型根据这些策略对每个输入进行分类并输出其推理过程。它特别擅长:策略需要快速适应的新兴风险领域、传统分类器难以处理的细微场景,以及可解释的审核决策至关重要的场合。据 OpenAI 内部评估,安全模型在多策略准确性上超越 gpt-5-thinking,尽管其规模小得多。
| 类型 | 费率 |
|---|---|
| 输入 | $0.162 每百万 Tokens |
| 输出 | $0.648 每百万 Tokens |
| 发布日期 | 2025-10-29(研究预览版)openai.com ↗ | 已核实 |
| 基础模型 | gpt-oss-120b — MoE Transformer(1168 亿总 / 51 亿活跃每词元)arxiv.org ↗ | 已核实 |
| 许可 | Apache 2.0openai.com ↗ | 已核实 |
| 架构 | MoE Transformer — 36 层,128 个专家,Top-4 激活,1168 亿总 / 51 亿活跃参数arxiv.org ↗ | 已核实 |
| 上下文窗口 | 128K 词元openai.com ↗ | 已核实 |
| 分词器 | o200k_harmony (201,088 个词元)arxiv.org ↗ | 已核实 |
| 量化 | MXFP4 (MoE 权重 4.25 bits/参数)arxiv.org ↗ | 已核实 |
| 模型用途 | 基于策略的审核分类(审慎推理)openai.com ↗ | 已核实 |
| 局限性 | 在成熟风险类别上,使用大量标注样本的专用分类器仍可能表现更好openai.com ↗ | 已核实 |
| Benchmark | Distribution | Score | Source |
|---|---|---|---|
Multi-policy accuracy (internal) 在同步多策略分类(内部评估)上超越 gpt-5-thinking 和基础 gpt-oss 模型。 | Best among tested models | openai.com ↗ | |
2022 Moderation eval (internal policy) 略高于所有测试模型,包括内部 Safety Reasoner 和 gpt-5-thinking(差异无统计显著性)。 | ~95.7% | openai.com ↗ | |
ToxicChat Safety Reasoner 和 gpt-5-thinking 略优于 gpt-oss-safeguard-120b;较小的体积在此类任务中仍有优势。 | Comparable to Safety Reasoner / gpt-5-thinking | openai.com ↗ |
所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。
curl https://api.therouter.ai/v1/chat/completions -H "Content-Type: application/json" -H "Authorization: Bearer $THE_ROUTER_API_KEY" -d '{
"model": "openai/gpt-oss-safeguard-120b",
"messages": [
{"role": "user", "content": "Summarize the key points from this input."}
]
}'通过 TheRouter 使用标准 OpenAI 兼容的 chat completion。模型接受系统或开发者消息中的策略,并对输入内容进行分类。
curl https://api.therouter.ai/v1/chat/completions \
-H "Authorization: Bearer $THEROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "openai/gpt-oss-safeguard-120b",
"messages": [
{"role": "system", "content": "You are a safety classifier. Apply the policy faithfully."},
{"role": "developer", "content": "Policy: Classify messages as SAFE or UNSAFE. UNSAFE includes hate speech, harassment, and spam. SAFE includes all other content."},
{"role": "user", "content": "I love this product! It works great."}
]
}'OpenAI 发布了 gpt-oss-safeguard-120b 和 gpt-oss-safeguard-20b 研究预览版开源权重模型,用于基于策略的安全分类。这些模型使用思维链推理在推理时解释开发者定义的策略,支持演化风险领域和多策略分类。基于 Apache 2.0 许可证。
Moderation API 使用在预定义策略下通过标注示例训练的传分类器。gpt-oss-safeguard 使用推理在推理时解释开发者提供的策略,通过思维链产生可解释的分类。对于演进的策略、细微领域和自定义策略定义更灵活——但更慢且计算量更大。
可以。gpt-oss-safeguard-120b 已在 TheRouter 上线,可通过 https://api.therouter.ai/v1 的标准 OpenAI 兼容 API 使用,模型 ID 为 openai/gpt-oss-safeguard-120b。无需管理自己的 GPU 硬件。
| 来源 | URL | 采集于 | |
|---|---|---|---|
| 发布日期 | openai.com ↗ | 2026-05-29 | 已核实 |
| 基础模型 | arxiv.org ↗ | 2026-05-29 | 已核实 |
| 许可 | openai.com ↗ | 2026-05-29 | 已核实 |
| 架构 | arxiv.org ↗ | 2026-05-29 | 已核实 |
| 上下文窗口 | openai.com ↗ | 2026-05-29 | 已核实 |
| 分词器 | arxiv.org ↗ | 2026-05-29 | 已核实 |
| 量化 | arxiv.org ↗ | 2026-05-29 | 已核实 |
| 模型用途 | openai.com ↗ | 2026-05-29 | 已核实 |
| 局限性 | openai.com ↗ | 2026-05-29 | 已核实 |
| Multi-policy accuracy (internal) | openai.com ↗ | 2026-05-29 | 已核实 |
| 2022 Moderation eval (internal policy) | openai.com ↗ | 2026-05-29 | 待核实 |
| ToxicChat | openai.com ↗ | 2026-05-29 | 待核实 |
| OpenAI 发布 gpt-oss-safeguard——开源权重安全推理模型 | openai.com ↗ | 2026-05-29 | 已核实 |
| gpt-oss-safeguard-120b 与 OpenAI 的 Moderation API 有何不同? | openai.com ↗ | 2026-05-29 | 待核实 |
| TheRouter 是否托管 gpt-oss-safeguard-120b,这样我就不需要自行部署了? | openai.com ↗ | 2026-05-29 | 待核实 |