返回模型列表

GPT OSS Safeguard 120B

openaiopenai/gpt-oss-safeguard-120b

OpenAI's advanced safety reasoning model (120B). Nuanced policy interpretation, multi-turn safety analysis, and justified decisions for content moderation.

GPT OSS Safeguard 120B 是 OpenAI 首个开源权重的安全推理模型,于 2025 年 10 月作为研究预览版以 Apache 2.0 许可证发布。它是基于 gpt-oss-120b(117B 参数 MoE 变压器,每次前向传播活跃 5.1B 参数)微调后的变体,专用于基于策略的内容分类。与传统审核模型通过标注示例学习决策边界不同,Safeguard 在推理时直接根据开发者提供的策略进行推理,利用思维链产生可解释的分类结果。

在生产环境中,GPT OSS Safeguard 120B 充当灵活、基于推理的内容审核层。开发者在推理时提供自己的策略——例如游戏论坛的反作弊规则或评论平台的虚假评论策略——模型根据这些策略对每个输入进行分类并输出其推理过程。它特别擅长:策略需要快速适应的新兴风险领域、传统分类器难以处理的细微场景,以及可解释的审核决策至关重要的场合。据 OpenAI 内部评估,安全模型在多策略准确性上超越 gpt-5-thinking,尽管其规模小得多。

适合使用
  • • 自定义策略内容审核——自带规则对用户生成内容进行分类。
  • • 演化风险领域——推理时更新策略,无需重新训练分类器。
  • • 可解释审核——思维链推理为每次分类决策提供可审计的说明。
  • • 自托管安全管道——在单张 80GB GPU 上本地部署,完全掌控数据主权。
  • • 多策略分类——单次推理调用中同时评估多个策略的内容。
不适合使用
  • • 大规模高吞吐审核——基于推理的方法计算量大且比轻量分类器更慢。批量分类请使用传统审核模型。
  • • 低延迟/实时过滤——gpt-oss-safeguard-20b 是更轻的选择;更快的预过滤建议使用专用分类器。
  • • 策略稳定的高数据领域——在成熟风险类别上,使用数万个高质量样本训练的传分类器仍可超越推理方法。
上下文长度
128K
最大输出
16K
输入价格每百万 tokens
$0.162每百万 Tokens
输出价格每百万 tokens
$0.648每百万 Tokens

模态能力

文本→文本

价格明细

类型费率
输入$0.162 每百万 Tokens
输出$0.648 每百万 Tokens

支持参数

temperaturemax_tokenstop_presponse_formatstop

模型规格

发布日期2025-10-29(研究预览版)openai.com ↗已核实
基础模型gpt-oss-120b — MoE Transformer(1168 亿总 / 51 亿活跃每词元)arxiv.org ↗已核实
许可Apache 2.0openai.com ↗已核实
架构MoE Transformer — 36 层,128 个专家,Top-4 激活,1168 亿总 / 51 亿活跃参数arxiv.org ↗已核实
上下文窗口128K 词元openai.com ↗已核实
分词器o200k_harmony (201,088 个词元)arxiv.org ↗已核实
量化MXFP4 (MoE 权重 4.25 bits/参数)arxiv.org ↗已核实
模型用途基于策略的审核分类(审慎推理)openai.com ↗已核实
局限性在成熟风险类别上,使用大量标注样本的专用分类器仍可能表现更好openai.com ↗已核实

基准成绩

BenchmarkDistributionScoreSource
Multi-policy accuracy (internal)
在同步多策略分类(内部评估)上超越 gpt-5-thinking 和基础 gpt-oss 模型。
Best among tested modelsopenai.com ↗
2022 Moderation eval (internal policy)
略高于所有测试模型,包括内部 Safety Reasoner 和 gpt-5-thinking(差异无统计显著性)。
~95.7%openai.com ↗
ToxicChat
Safety Reasoner 和 gpt-5-thinking 略优于 gpt-oss-safeguard-120b;较小的体积在此类任务中仍有优势。
Comparable to Safety Reasoner / gpt-5-thinkingopenai.com ↗

API 使用示例

所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。

cURL
curl https://api.therouter.ai/v1/chat/completions   -H "Content-Type: application/json"   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -d '{
    "model": "openai/gpt-oss-safeguard-120b",
    "messages": [
      {"role": "user", "content": "Summarize the key points from this input."}
    ]
  }'

API 使用指南

完整 API 参考 →

Chat 调用

通过 TheRouter 使用标准 OpenAI 兼容的 chat completion。模型接受系统或开发者消息中的策略,并对输入内容进行分类。

cURL
curl https://api.therouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "openai/gpt-oss-safeguard-120b",
    "messages": [
      {"role": "system", "content": "You are a safety classifier. Apply the policy faithfully."},
      {"role": "developer", "content": "Policy: Classify messages as SAFE or UNSAFE. UNSAFE includes hate speech, harassment, and spam. SAFE includes all other content."},
      {"role": "user", "content": "I love this product! It works great."}
    ]
  }'

openai 其他模型

同类模型

跨供应商的相似能力档位

动态与变更

2025-10-29

OpenAI 发布 gpt-oss-safeguard——开源权重安全推理模型

OpenAI 发布了 gpt-oss-safeguard-120b 和 gpt-oss-safeguard-20b 研究预览版开源权重模型,用于基于策略的安全分类。这些模型使用思维链推理在推理时解释开发者定义的策略,支持演化风险领域和多策略分类。基于 Apache 2.0 许可证。

TheRouter 编辑重写openai.com ↗

常见问题

gpt-oss-safeguard-120b 与 OpenAI 的 Moderation API 有何不同?

Moderation API 使用在预定义策略下通过标注示例训练的传分类器。gpt-oss-safeguard 使用推理在推理时解释开发者提供的策略,通过思维链产生可解释的分类。对于演进的策略、细微领域和自定义策略定义更灵活——但更慢且计算量更大。

TheRouter 编辑重写openai.com ↗
TheRouter 是否托管 gpt-oss-safeguard-120b,这样我就不需要自行部署了?

可以。gpt-oss-safeguard-120b 已在 TheRouter 上线,可通过 https://api.therouter.ai/v1 的标准 OpenAI 兼容 API 使用,模型 ID 为 openai/gpt-oss-safeguard-120b。无需管理自己的 GPU 硬件。

TheRouter 编辑重写openai.com ↗
事实档案 — 本页每条断言可在此回溯来源
来源URL采集于
发布日期openai.com ↗2026-05-29已核实
基础模型arxiv.org ↗2026-05-29已核实
许可openai.com ↗2026-05-29已核实
架构arxiv.org ↗2026-05-29已核实
上下文窗口openai.com ↗2026-05-29已核实
分词器arxiv.org ↗2026-05-29已核实
量化arxiv.org ↗2026-05-29已核实
模型用途openai.com ↗2026-05-29已核实
局限性openai.com ↗2026-05-29已核实
Multi-policy accuracy (internal)openai.com ↗2026-05-29已核实
2022 Moderation eval (internal policy)openai.com ↗2026-05-29待核实
ToxicChatopenai.com ↗2026-05-29待核实
OpenAI 发布 gpt-oss-safeguard——开源权重安全推理模型openai.com ↗2026-05-29已核实
gpt-oss-safeguard-120b 与 OpenAI 的 Moderation API 有何不同?openai.com ↗2026-05-29待核实
TheRouter 是否托管 gpt-oss-safeguard-120b,这样我就不需要自行部署了?openai.com ↗2026-05-29待核实
帮助与联系