研究

总览 可解释性 对齐科学 经济研究

安全

承诺 负责任扩展 信任中心

学习

学院 开发者文档 模型 新闻

公司

关于 招贤纳士 联系我们
试试 共振 登录

能拦下一次发布的政策,才配叫政策。

安全承诺写起来容易,悄悄放弃更容易。下面这些承诺都绑定到具体的能力测量,写明了防护措施与责任人, 并负有"越过阈值时必须公开"的义务。

能力层级与必需的防护措施
层级 触发条件 继续推进前必须具备 放行签字
T1 基线 常规部署;下列各项评测无提升。 系统卡、使用政策执行、滥用监测。 模型发布评审
T2 提升 在网络或生物任务套件上,较公开基线有可测提升。 定向拒绝评测、访问控制、第三方红队。 安全负责人 + 发布评审
T3 自主 无需人工检查点,即可持续完成多天任务。 可解释性审查、沙箱化工具使用、独立审计、事件日志公开。 安全负责人 + 董事会安全委员会
T4 冻结 出现了"必需的防护措施尚不存在"的能力。 暂停或收缩训练,直到防护措施被证明并完成评审。 仅董事会安全委员会
关于"暂停"这个词。 冻结是一次真实的停下,但默认并非永久。当缺失的防护措施已经存在、由没有参与构建它的人完成评审、 并且以足以被反驳的细节公开描述时,冻结结束。如果我们描述不出来,就说明还没造出来。
认证 SOC 2 Type II 报告可在 NDA 下获取
隐私 ISO 27001 与 27701 范围覆盖 API 平台
数据驻留 区域锁定 美国、欧盟、英国与亚太
数据保留 零保留模式 可选项,受合同约束
访问控制 SSO、SCIM、审计日志 每个企业计划均包含
可用性 公开状态页 30 分钟内公告
05 — 事件日志

出了什么问题,以及何时出的

2026 年 8 月

评测配置错误抬高了安全分数

被污染的测试切分让拒绝基准虚高 9 个百分点。在模型上线前被内部复现检查发现;评测套件重建,受影响结论已从系统卡中撤回。

2026 年 5 月

经由检索文档的提示注入路径

检索到的 PDF 中被注入的指令,触发了一次超出声明范围的工具调用。已通过更严格的工具沙箱修复,并将一项评测加入发布门槛。

2026 年 2 月

非英语医疗问答中的过度拒绝

在四种语言中,正当临床问题的拒绝率明显更高。外部审查将原因追溯到训练数据不均衡,已在下一个检查点修正。

2025 年 11 月

区域故障期间状态页延迟

公开披露耗时 74 分钟,超出 30 分钟承诺。事后报告连同时间线与值班制度的调整一并公开。

06 — 披露政策

报告漏洞

如果你找到了让我们的模型做不该做的事的方法,我们希望在其他任何人之前先听到它。 请发送复现所需的最少信息,并在公开发布之前给我们一个合理的窗口期。

  • 范围内:绕过安全训练的越狱、经由工具或检索的提示注入路径、会话之间的数据泄漏,以及针对评测的作弊。
  • 范围外:你个人不喜欢的无害回答,以及已在公开系统卡中描述过的问题。
  • 我们的承诺:两个工作日内确认、持续同步进展、征得同意后署名致谢,并告诉你我们改了什么。
我们宁愿被一份报告弄得很尴尬,也不愿被一份报告吓一跳。