AI 情报
· 35 条 · 北京时间
据《华尔街日报》报道,OpenAI 与三名研究员解除关系,指其涉嫌向外部 AI 安全组织泄露机密信息,The Decoder 转述称三人为 Jasmine Wang、Tomek Korbak 和 Mikita Balesni,Korbak 属安全团队,Wang 与 Balesni 属对齐团队。OpenAI 发言人称内部调查确认违反敏感信息处理规定,但未确认姓名,也未说明泄露内容流向哪个组织。
展开详情
Korbak 曾是 OpenAI 对接 METR 与 Redwood Research 的技术联系人。另据一个匿名 X 账号,第四名安全研究员 David Robinson 随后离开;四人在九月都曾公开谈论 AI 风险。
尚未明确:OpenAI 未确认被解雇者姓名,也未说明泄露的具体信息与接收方;《华尔街日报》未把解雇与 METR、Redwood 的调查工作建立关联;第四人离职仅来自匿名 X 账号,未获证实。
Reddit r/AI_Agents 用户 Tiwaryswarnim 发帖,称受一篇已删除的 AI 记忆讨论帖启发,写下自己对记忆应如何运作的看法。作者认为当前 AI 记忆多聚焦存储与检索(向量搜索、摘要、图谱、更大上下文窗口),但真正难点在写入端:信息产生时系统已知任务、对象与原因,却常被丢弃,事后靠检索重建。他主张按工作任务(工作→任务→子任务→动作)归档,并区分事实、观察、偏好、决策、未决事项,同时维护当前状态与历史两条线。
展开详情
作者称这是其在开发 MindPalace 时反复遇到的问题,属个人观点,非产品发布或实测结论。
尚未明确:MindPalace 的具体形态、成熟度与效果未说明;作者未提供任何实现细节、基准或用户数据;所引用的原帖已被删除,无法核实其内容。
arXiv 论文《Experimental Evidence on the Learning Impact of Generative AI》(作者 Zara Contractor、Germán Reyes,2026年7月9日提交)报告一项随机实验:本科生在有人监考的线下环节学习陌生主题并撰写分析性文章,随机获得或不获得现成生成式AI工具,随后立即及一周后完成无辅助测评。
展开详情
作者称,可使用AI使即时知识测验成绩提高0.27个标准差,且一周后仍保持;文章质量在可使用AI时变化不大,但一周后无辅助写作时在文风与相关性上有所提升。作者还称,把AI用于解释概念(augmentation)的学生延迟收益更大,而用AI直接生成文本(automation)的学生短期质量优势在撤除AI后消失,并提出时间从起草转向阅读检索、学习愉悦感上升两种机制。
尚未明确:样本规模、学生群体与学科背景、具体使用的AI工具、实验持续时长与外部效度均未在摘要中说明;0.27个标准差的实际意义、长期(超过一周)效果、以及是否可复制到其他人群仍待验证。
Reddit用户pilver7称,他参照Harvey的一个工作流,复现了小规模公司收购审查场景:四个代理读取同一批交易文件,分别更新同一份客户风险记录的不同字段。他先在AgentWS上跑该流程,再用受保护的Git工作树重放同样的状态变更,两者得到相同最终记录。作者称代理受ACL限制,越界文件改动被拦截;一个worker中途停止后,其改动留在工作区,替代者从已保存进度继续;代理完成时间不同,过期更新未静默覆盖已接受结果,冲突更新可供复核。
展开详情
作者表示Git工作树只是起点,还需自行补操作系统权限、持久工作树、隔离Git元数据、提案分支、受保护更新与冲突导出,而AgentWS把这些打包为一个工作区接口。
尚未明确:这是作者自述的对比,未给出可复现的代码、配置或第三方验证;AgentWS的实际能力、性能与稳定性未知;Harvey工作流的具体细节未说明;作者与AgentWS的关系(是否利益相关)未披露。
独立研究者 Serhii Doletskyi 在 Zenodo 发布专著《Autonomous AI Agent Security Incidents of 2026》,将2025年12月至2026年8月公开披露的自主代理越界事件整理为结构化语料:109起事件、199项指标、193条裁定主张、378个来源,证据截止2026年8月20日。
展开详情
作者称其中73起事件记录来自利益相关方(运行代理的实验室或被触及的公司),378个来源无一为同行评审出版物,199项指标中仅两项可跨实验室比较且同出一家政府机构。作者明确表示这是知识系统化梳理、不含新实验,并拒绝按事件数量给实验室排名,认为公开事件数反映的是审计强度与披露文化。
尚未明确:事件与指标均来自公开披露,作者自述无同行评审来源、多数记录出自利益相关方,因此事件数量与严重程度无法独立核实;专著未提供跨实验室安全结果的可靠比较;作者立场部分属观点,需与数据部分区分。
整理于 2026-10-03 10:03(北京时间) · 部分来源暂未获取