研究

总览 可解释性 对齐科学 经济研究

安全

承诺 负责任扩展 信任中心

学习

学院 开发者文档 模型 新闻

公司

关于 招贤纳士 联系我们
试试 共振 登录

Cortex 5.1 与 Pulse 5.1

为活得比单轮对话更久的工作准备的两款模型:跨工具保持状态、从自己的错误中恢复, 不确定时如实说明,而不是编造一个终点。

有什么新变化

头条变化是时长。两款模型都为跨越数天而非分钟的任务做了训练与调优——这改变了重要性的排序: 重要的不再是单个回答的质量,而是到了周四写总结的时候,模型是否还记得你周一给它的约束。

实践中,这意味着我们把大部分精力花在三个不性感的问题上——让原始指令始终在视野内、 察觉工具调用已经悄悄失败、区分"完成了"和"没辙了"。这些没有一条会在聊天演示里露面。

  • Cortex 5.1 面向含糊的简报与长程智能体任务。更慢、更贵,在"自信的错误代价更高"的时候才值得选。
  • Pulse 5.1 是默认之选。承接大部分生产流量,也是每个新能力上线时我们最先调优的模型。
  • 两者共享一百万 token 上下文窗口、同一套工具协议与同一份拒绝政策,切换只需改一行。

一笔我们欠你的更正

系统卡的早期草稿曾报告:拒绝基准较上一代提升 9 个百分点。那个数字是错的。 评测切分被训练数据污染,模型被测的并不是卡片声称在测的东西。

评测套件已用留出切分与持续污染检查重建;受影响的结论已从卡片中撤回,而非悄悄改写。 重建后的基准显示的改进小于原数字——这才是我们现在报告的数。

为什么要把这件事说出来。 一个讨好我们的基准比没有基准更糟,因为它取消了继续查看的理由。这次撤回已记入公开事件日志, 连同发现的日期与随之而来的改变。

评测

发布门槛现覆盖工具滥用与多天任务中的指令漂移,外加网络提升、生物风险与压力下拒绝行为的常设套件。 结果都在系统卡里——包括两款模型没有超越前代的那几项。

Cortex 5.1 与 Pulse 5.1 概览
属性 Cortex 5.1 Pulse 5.1
上下文窗口 1M tokens 1M tokens
定位 长程智能体、含糊简报、分析 生产流量、编码、客服、抽取
延迟性格 从容 跟手
相对成本 $$$$ $$
可用性 Pro、团队、企业、API 免费、Pro、团队、企业、API

可用性

两款模型今日起在 API 与 共振 应用中可用。固定在上一代的既有部署照常运行; 控制台会在切换前给出升级预估,支出上限原样沿用。

如果模型没能完成你的任务,那是有用的信息。我们宁愿听到它,也不愿你悄悄绕开我们。

相关内容

全部公告
研究

多天智能体任务中的漂移

指令遵从性在工具此前未埋点的时长之后,出现可测的退化。

安全

负责任扩展政策,第三版

训练中途越过能力阈值时,会发生什么。

学习

无需重写的升级

如何把固定版本的部署迁移到新一代,并证明没有回归。