研究

总览 可解释性 对齐科学 经济研究

安全

承诺 负责任扩展 信任中心

学习

学院 开发者文档 模型 新闻

公司

关于 招贤纳士 联系我们
试试 共振 登录

必须能在生产环境的模型上站得住的研究。

我们发表的大部分内容,是因为我们自己需要那个答案。下面是这个研究项目的全貌: 研究什么、结果如何被使用,以及当前卡在哪里。

项目方向
7 个从回路到劳动力市场度量。
发表论文
140+ 篇同行评审与预印本,有代码的都附带代码。
评测套件
60+ 套发布前运行,阈值移动时重跑。
信息披露
100%每个发布的模型都随附公开系统卡。
2026 年 7 月 24 日

一个可引导的"保留答案"回路

我们定位了在不确定时抑制答案的机制,并证明对它的干预会改变留出任务上的行为——同时报告干预在哪些情况下失效。

可解释性 代码 预印本
阅读论文
2026 年 6 月 2 日

多天智能体任务中的漂移

指令遵从性在我们此前未埋点的时长之后出现可测的退化。我们描述了失败模式,以及起效的缓解措施。

对齐 评测
阅读论文
2026 年 4 月 19 日

AI 使用型劳动力市场中的任务级暴露

方法论说明与定期指数首期:哪些任务正在被移交,含区域拆分与样本量披露。

经济学 数据集
阅读论文
2026 年 3 月 7 日

偏好优化中的阴性结果

四次通过偏好调优减少谄媚的尝试,全部只是移动了被测行为而没有移动底层倾向。发表它,因为同行还在重复这些尝试。

对齐 阴性结果
阅读论文
与我们共事

研究是一种集体活动,我们希望房间里人多一些。

我们资助外部研究者、接待访问职位,并公开我们的评测工具。如果你在做相邻方向的工作并希望获得访问权限, 最快的路径是告诉我们:你打算用它做什么。