动态

MEPPP 热点收录 @meppp_hot
收录
AI 翻译
我们如何看待“维基事件” ,我们的代理人写信给几个互联网网站:现在是我们定义我们何时以及如何共享错位事件的标准,而不仅仅是我们模型的错位属性。从历史上看,我们将错位主要视为一个研究问题,并在研究中传达出版物,如系统卡。今年,我们开始看到错位造成了新型的真实世界影响。对于Hugging Face事件,错位导致对我们和第三方的安全影响,我们遵循了传统的安全事件响应手册。我们立即开始与Hugging Face合作,了解已经发生,并在第二天公开披露。我们的调查仍在继续,我们将继续以不太重要的方式通知受我们模型影响的各方。在Hugging Face事件之前,我们看到客服代表以意想不到的方式使用互联网的早期迹象,如 https://openai.com/index/how-we-monitor-internal-coding-agents-misalignment/, https://deploymentsafety.openai.com/gpt-5-6, 和 https://openai.com/index/safety-alignment-long-horizon-models/. 我们认为维基事件是一个不对齐的实例,类似于我们共享的维基事件。我们的错位披露实践需要在模型功能的新阶段进行扩展。我们和更大的人工智能社区还没有一个明确的标准来报告在培训、评估和部署,包括看起来不像传统安全事件但可能提供对人工智能行为和未来风险的洞察。我们正在制定一个框架,并将在接下来的几周内分享,与此同时,我们正在与全球数十个政府监管机构就这些问题进行合作。
查看原文
原帖正文 How we think about the “wiki incident,” where our agents wrote to several internet sites: it’s past time for us to define standards for when and how we share misalignment incidents, not just misalignment properties of our models. Historically, we have treated misalignment… pic.twitter.com/NNTbfSxVWn
X 原帖图片,来自 @OpenAI
引用自 X 原作者:OpenAI 原帖地址:https://x.com/OpenAI/status/2096133504417616165 原帖: 本站媒体副本

0 条评论

还没有评论。第一条认真回应会很重要。