我们研究模型如何行为、为何如此行为,以及要让这些答案变得可靠,需要什么。
安全承诺只有在具体、公开、可检验时才有意义。下面是我们承诺的内容。
面向在我们模型之上构建的人的文档、课程与模式。
一家共益企业。章程允许我们把使命与股东回报放在同一架天平上。
我们发表的大部分内容,是因为我们自己需要那个答案。下面是这个研究项目的全貌: 研究什么、结果如何被使用,以及当前卡在哪里。
一个能给出好答案却无人能说清原因的模型,是一个无人能审计的模型。我们的可解释性工作试图用结构取代这种不确定: 回路、特征,以及可以被检验——而不是被叙述——的干预。
我们给自己定的实践标准是:一项发现必须能改变行为。如果我们定位到一个机制,就应该能引导它、破坏它, 并预测干预的后果——在分析从未见过的任务上。
如果一个解释无法被实验证伪,它描述的是我们自己的信心,而不是模型。
我们所说的对齐不是礼貌。它是系统被要求优化的目标与它实际所做之间的差距——任务越长、反馈越稀疏, 这个差距就越大。
仅靠偏好调优弥合不了这个差距;它教会模型的是哪些答案会被批准,这与哪些答案是正确的是两回事。 我们发表的若干阴性结果,正是被这个区别反复绊住之后才有的。
很多安全工作的瓶颈不是想法,而是验证想法的成本。我们投资于把假设在一天之内变成一次运行的"水管": 训练基础设施、评测框架与可复现性保证。
这里的红队测试,是系统地寻找那种能在演示中幸存下来的失败:经由检索内容注入指令的路径、越权的工具调用, 以及模型能认出来并"为之表演"的评测环境。
总量统计会遮住真正值得看的东西:哪些任务被交给了模型、在哪些职业里、这次交接是增强还是替代。 我们发布一个基于匿名聚合使用数据的定期指数,方法论公开,并欢迎任何批评。
我们能指出的收获,很少是模型自己有了洞见。它们是模型承担了研究项目里乏味的中段——筛选候选、起草流程、 整理文献——让人更早碰到有意思的问题。
大多数技术的社会影响,都在塑造它的设计决策过去几十年之后才被记录。我们宁愿在研究还能改变我们要造的东西时 就把它做完——这意味着会发表对我们自己产品并不好看的结果。
预印本与同行评审工作,按时间倒序。可公开的代码与数据均已附链接。
我们定位了在不确定时抑制答案的机制,并证明对它的干预会改变留出任务上的行为——同时报告干预在哪些情况下失效。
指令遵从性在我们此前未埋点的时长之后出现可测的退化。我们描述了失败模式,以及起效的缓解措施。
方法论说明与定期指数首期:哪些任务正在被移交,含区域拆分与样本量披露。
四次通过偏好调优减少谄媚的尝试,全部只是移动了被测行为而没有移动底层倾向。发表它,因为同行还在重复这些尝试。
我们资助外部研究者、接待访问职位,并公开我们的评测工具。如果你在做相邻方向的工作并希望获得访问权限, 最快的路径是告诉我们:你打算用它做什么。
必需 Cookie 保证站点正常运转,其余各项默认关闭——你不开,它就一直是关的。