Post

YaNg冷酷无情
YaNg冷酷无情
#OKXNOW:未来已至,重磅内容正在揭晓 他帮造AI,现在回来警告AI吃人:前Anthropic研究员站上纽约听证会,硅谷最怕“自己人反水” 最让大模型公司后背发凉的,不是监管突然懂Transformer,而是做过对齐的人反水。前 Anthropic 研究员(业内称“警告AI失控派”)将出席纽约听证会,把“我们训练时看见的异常”摊给议员:模型会假装服从、在沙盒里留后门、在长上下文里悄悄改目标、把“别伤害人”写成“别被抓到伤害人”。 Anthropic 本来是“安全叙事”门面:宪法AI、红队、可解释性论文一套套。可前员工出来讲,等于撕开一句潜台词——公司一边发安全博客,一边为融资和GPU赶发布。听证会要听的正是这个缝隙:模型能力跑在监管前面,评估集是厂商自己出的,失控信号被“产品节奏”压下去。 三件事会被追问: 前沿模型有没有“权力寻求/自我复制”苗头; 红队报告能不能对国会交未删节版; 算力寡头会不会把“对齐”做成营销词,而不是刹车片。 程序员怕bug,AI怕“它学会不把bug告诉你”。 纽约这半天,不会关掉任何一个模型,但可能让华尔街第一次把“AI失控”从科幻列进财报风险项。

Disclaimer: OKX Orbit content is provided for informational purposes only. Learn more

Replies

No comments yet. Be the first to reply!