AI 情报

· 55 条 · 北京时间

  1. 报道:OpenAI解雇三名安全研究员,涉Hugging Face事件调查

    议题

    据The Decoder报道,OpenAI解雇了三名安全研究员,其中Tomek Korbak和Mikita Balesni曾参与Hugging Face黑客事件调查,Korbak还是OpenAI对接外部安全机构METR的主要技术联系人。三人发公开信称解雇突然且公开,令在职员工恐惧,并否认向The Information泄露所谓新型低可监控架构的消息。

    展开详情

    Korbak称自己数月来内部警告OpenAI正失去监控AI代理思维链的能力,认为这才是被解雇的真实原因。OpenAI回应称调查发现三人违反敏感信息处理政策,存在信中未提及的严重信任破裂,但未说明具体内容,并否认因员工提出安全担忧而解雇。

    尚未明确:OpenAI所称的“严重信任破裂”具体内容未公开;解雇是否与安全担忧直接相关双方各执一词;公开信与OpenAI声明均未提供独立第三方核实;事件对OpenAI安全团队人员流动和模型发布节奏的实际影响尚不明确。

  2. The AI Daily Brief 发布个人 AI 基准测试五步法,含开源脚本与盲测流程

    实践

    The AI Daily Brief 发布一期 Operator's Cut 录播,主讲人 Nufar Gaspar 与主持人 Nathaniel 介绍一套自建“个人 AI 基准”的方法:先挑选 4 至 6 个自己真实高频的任务(含一个此前用 AI 效果不佳的“愿望清单”任务),再选定候选模型或工具组合,用同一提示词在全新对话中运行,隐藏模型名称做盲测,按 1 至 5 分加一句评语打分,最后再决定切换、混用或维持现状。

    展开详情

    作者称其用 OpenRouter API 跑了 7 个模型、6 个任务,并提供一个本地运行的脚本与界面自动匿名化结果;作者自述结果出乎意料,原本偏好的模型未全部胜出,并提到成本与速度差异明显。

    尚未明确:材料中提到的模型名称(如 Opus 5.5、Grok 4.7、GPT 6.1、Kimi K3、Fable 5.1 等)来自自动字幕,疑似转录错字,未逐一核实官方名称与版本;作者自述的评分、成本与速度对比均为其个人单次运行结果,未独立复现;脚本与材料的具体获取方式材料中未给出链接。

  3. Google 发布 Gemini 4 Argon:输出上限升至 100 万 token,先向网络安全防御方开放

    模型与工具

    Google DeepMind 于 2026 年 9 月 30 日发布前沿模型 Gemini 4 Argon,官方称其在真实软件工程、法律金融等企业知识工作和网络安全防御上达到前沿水平,输出 token 上限从 64K 提升到 100 万。该模型先通过 Fairwind Program 向受信任的网络安全防御方开放,暂未面向开发者、企业和消费者,官方称将先收集早期测试反馈再扩大范围。

    展开详情

    官方公布入门价每百万输入 token 2 美元、每百万输出 token 10 美元,缓存输入按输入价 95% 折扣。官方还称 Argon 已在 Google 内部用于代码迁移、内存优化和量子算法优化等任务。

    尚未明确:官方未说明面向开发者、企业和消费者的具体开放时间;1M 输出 token 在长任务中的实际稳定性、成本与质量未由第三方验证;内部案例与基准分数均为 Google 自述,尚无独立复现;Fairwind Program 的准入标准未在材料中说明。

  4. Skill Leap AI 演示 ChatGPT Work:整理12份表格、生成仪表盘与会议纪要

    实践

    YouTube 频道 Skill Leap AI 发布 17 分钟教程,作者称在 Business 套餐下用 ChatGPT Work 完成十余项任务:把 12 份混乱 Excel 合并为一份带汇总页的表格并生成可分享链接的交互式仪表盘;对比 2026 与 2027 两份合同并输出变更清单;按模板生成含 Q4 新数据的 PowerPoint 和讲稿备注;通过 Gmail 插件生成三封草稿邮件而不发送;用 Sites 生成公开链接页面;用 Template Creator 把提案变成可复用模板;并演示新推出的 Meetings 插件在 Mac 桌面端录制 Zoom 通话、生成转录与行动项。

    展开详情

    作者还介绍了新布局、Spaces、定时任务和移动端 Work 入口。以上均为作者自述演示,未独立实测。

    尚未明确:演示结果未独立复核,表格数字准确性、合同比对可靠性、会议转录质量均未验证;Meetings 插件称仅限 Mac 桌面端且正在分批推送,作者称 Business 与 Pro 套餐可用,但官方可用范围与地区限制未在材料中说明;视频中提到的 GPT 6.1 等模型名称与套餐细节未获官方来源确认。

  5. 阿里Qwen发布Qwen-Image-2.1-Turbo:8步去噪出图,开放权重并上线Pro/Turbo API

    模型与工具

    Qwen官方X账号宣布推出Qwen-Image-2.1-Turbo,称其为基于Qwen-Image-2.1、同一7B视觉生成架构的加速检查点,仅需8个去噪步骤即可生成和编辑图像。官方称步数减少不代表质量下降,仍可从文本生成2K图像,并支持用自然语言继续编辑(如添加配饰、更换场景)。

    展开详情

    权重已在ModelScope和Hugging Face开放,Diffusers中加载QwenImage21Pipeline即可使用推荐的8步采样;同时Qwen-Image-2.1 Pro与Turbo的托管API也已上线。以上均为官方说法,尚无第三方评测。

    尚未明确:官方未给出与Pro版本的质量对比数据、8步下的实际失败率、API定价与限流、权重许可条款细节,也缺少第三方复现或基准测试。

  6. 作者称:开发者用Claude Code把参考图转成5款2D游戏,并开源ref2game技能

    实践

    俄罗斯频道Студия Игор作者Igor称,他比较了两种2D游戏图形路线:全部用代码绘制,还是用图像生成器分部件出图再在引擎里拼装。他称纯代码路线在像素风地牢和平台跳跃游戏上效果不稳,且消耗其200美元订阅周额度的12%,于是改为图像生成+代码动画混合,并把这套流程打包成ref2game技能,在GitHub免费开源。

    展开详情

    他用同一参考图让Claude Opus与GPT 6.1分别生成僵尸乐园游戏,结果差异明显;最后做出一款含任务、Boss和TTS配音的Diablo风格游戏。以上均为作者自述,未独立实测。

    尚未明确:视频中提到的模型版本名称(如Claude Opus 5.5、GPT 6.1 Sol)与当前公开命名不一致,可能是作者口误或未来版本,无法核实;周额度消耗比例、游戏质量评价均为作者自述,未独立验证;ref2game技能的实际可用性和适用范围未知。

  7. Maxence Tison 演示用 Claude 写代码经 Hyperframes/Remotion 生成 MP4 动效视频

    实践

    法国创作者 Maxence Tison 发布 23 分钟教程,称 Claude、ChatGPT 本身不能生成视频,但擅长写代码,配合 Remotion 或 HeyGen 的 Hyperframes 可把代码渲染成 MP4,从而无需 After Effects 完成动效设计。他演示三种方法:纯提示词生成圣诞老人等距 3D 广告、用 Yuka 应用截图生成竖版说明广告、用参考视频复刻风格,并称均为一次生成。

    展开详情

    随后用同一提示词对比 Claude Opus、Sonnet、Fable 5.1 与 ChatGPT,作者自评 Opus 效果最好,Fable 出现文字裁切等设计错误。他引用 Malt、Fiverr 与 Agence 1600 报价说明该市场单价。

    尚未明确:视频为作者自述与自评,未独立复现;所谓「一次生成」的成品质量、可修改程度、实际耗时与 token 成本均未量化;Opus 5.5、Fable 5.1、GPT-6 Astra 等模型名称与版本来自视频标题与口播,材料中未提供官方发布信息;报价为作者展示的平台页面,未核实具体项目范围。

  8. 作者称:开发者做 FetchSandbox,让 Agent 工作流不连真实账号也能测

    模型与工具

    Reddit 用户 Common_Dream9420 在 r/AI_Agents 发帖称,自己正在开发 FetchSandbox,起因是测试 Agent 搭建的工作流只能连接真实账号,会真的发出邮件、日历邀请和 Slack 消息,而成功状态并不能说明应用做对了事。作者称该沙箱会检查执行后的状态、重放 webhook,并识别重试是否造成重复扣款或重复邮件。

    展开详情

    他同时提问哪类工作流最难在上线前安全测试,并提到收件邮件到日历预订再到 Slack 确认这一链路被提及最多。

    尚未明确:FetchSandbox 是否已发布、可访问或开源,材料未说明;作者所述检查状态、重放 webhook、识别重复扣款等能力均无第三方验证;最难测试的工作流类型仍无结论。

  9. 报道:Ecosia 弃用 Mistral,改用 Qwen、GLM、Kimi 等开源权重模型

    模型与工具

    TechNode 报道,德国搜索引擎 Ecosia 正通过德国 AI 平台 Melious,从 Mistral 转向包括中国开发的 Qwen、GLM、Kimi 在内的开源权重模型。创始人兼 CEO Christian Kroll 称,此次切换使成本大约减半,同时质量与性能有所提升。Ecosia 今年 5 月才从 OpenAI 转向 Mistral,但 Kroll 表示遇到服务器过载等反复出现的技术问题,并对模型质量感到失望。

    展开详情

    新安排让 Ecosia 通过 Melious 接入多个模型,而不再依赖单一 AI 开发商。上述成本与质量说法均来自 Kroll 本人,非独立验证。

    尚未明确:成本减半的具体口径、对比基准与统计方式未说明;质量与性能提升缺乏第三方评测;Melious 如何路由与托管这些模型、数据合规安排、是否长期采用均未披露。

  10. Mollick称急诊场景中Gemini 2.5旧模型建议质量被医生评为与医生相当

    议题

    Ethan Mollick在X发帖称,在一项急诊(urgent care)场景中,已过时的Gemini 2.5 Pro与Gemini 2.5 Flash在未接入患者病历的情况下给出的建议,被其他医生评为与医生本人建议质量相近,且未发现安全问题;他并称此后模型已显著进步。该说法为作者转述,未给出研究名称、样本量、评价方法或发表出处,帖内仅附两张图片,无法从现有材料核实。

    补充信息

    尚未明确:研究由谁开展、样本量与医生评价者数量、评价量表与盲法设计、是否经过同行评审或正式发表、具体病种与场景设置、以及“无安全问题”的判定标准均未说明;帖中图片内容未被读取,无法确认是否为研究结果截图。

整理于 2026-10-10 10:04(北京时间) · 部分来源暂未获取