AI 情报
· 35 条 · 北京时间
宝玉转述谷歌发布新一代旗舰模型 Gemini 4 Argon,并引用 Sundar Pichai 的发布帖。谷歌称其在复杂工作流、网络安全防御和软件工程上达到前沿水平,对比表 19 项测试中 13 项第一、1 项并列、5 项落后。规格上单次输出上限从上一代 6.4 万 token 提到 100 万,其他三家对比模型为 12.8 万。价格为首发每百万输入 2 美元、输出 10 美元,优惠后 4 美元和 20 美元。
展开详情
首批只开放给 Fairwind 计划中的网络安全防御人员,之后依次为付费 API 客户、Google AI Ultra 订阅用户和普通消费者,未公布日期。谷歌称已有数千名员工日常使用,并列举量子算法优化、数据中心内存释放、C/C++ 迁移 Rust 等内部案例。
尚未明确:所有跑分和内部案例均来自谷歌公布,尚无第三方复现;分阶段开放的具体日期、普通用户可用时间未公布;Fairwind 计划细节、Wiz 使用效果、医疗软件漏洞等均为谷歌单方说法;对比表中的 GPT-6 Astra、Claude Fable 5.1、Opus 5.5 等型号信息来自该材料,未独立核实。
Reddit r/n8n 用户 0xGich 发帖称,自己为 n8n 搭建了一层结果监控,用于“执行成功但结果错误”的场景,并列出 7 项检查:心跳(是否在预期时间窗内运行)、零输出或无变化、输出量上下限、基线偏离、状态与关键字段值、重复失败、数据新鲜度与凭证有效性。作者称这些检查能捕捉普通执行错误漏掉的“绿灯但错误”情况,并在帖末询问其他人在生产工作流上还会加哪些检查。
展开详情
以上为作者自述做法,非官方功能发布。
尚未明确:作者未说明这些检查的具体实现方式、所用节点或代码、误报率与维护成本,也未提供任何实际拦截故障的案例或数据。
宝玉转述 Anthropic 当日发布的研究报告:开源模型智谱 GLM-5.3 能独立写出可用的网络攻击程序,水平接近仅向少数机构开放的 Claude Mythos Preview。ExploitBench(Chrome V8)成功率 12% 对 14%,Anthropic 二进制漏洞利用测试为 4% 对 6%,更早模型基本为 0。
展开详情
演示中模型一天内找出某主流浏览器 JS 引擎多个零日漏洞并串成网页,另一次针对已公开漏洞写攻击程序,人工 20 分钟、模型运行 8 小时、花费 20.40 美元。三种绕过拒绝方式成功率分别为 64%、92%、100%;约 2200 GPU 小时、约 4400 美元可把拒绝率从 95% 降到 6%。以上均为报告方说法。
尚未明确:Anthropic 报告原文未在材料中给出,数据与演示均转述自二手帖文;被找出零日漏洞的具体浏览器与厂商未披露;CAISI 评估细节、Mythos Preview 与 Glasswing 项目公开信息有限;abliteration 后模型通用能力是否真无影响仅由报告方称述。
The Decoder报道,OpenAI在DevDay宣布一批ChatGPT更新:向外部开发者开放内部插件平台(Plugin Extensions,含Plugin Creator与新版提交流程),推出团队共享工作区ChatGPT Space、协作文档Pages和即将上线的Collaborative Slides,并让ChatGPT以@提及方式进入Slack和Microsoft Teams。
展开详情
OpenAI还接入拟议中的MCP Events规范,使插件可在连接应用发生事件时触发自动化,Business与Enterprise用户可用Team Tasks委派周期性任务。定价方面新增Pro 500套餐,200美元订阅回归但API额度较此前版本更小;同时推出面向企业的OpenAI Marketplace,首批32家合作方,以及让Plus与Pro用户在16个第三方服务中消耗配额的Sign in with ChatGPT。以上均为OpenAI在发布会上的说法,媒体尚未独立验证。
尚未明确:Pro 500的具体价格与配额未在材料中给出;200美元档API额度的缩减幅度、Ultrafast的实际能力、Collaborative Slides的确切上线时间、Meetings Plugin的正式版时间,以及32家合作方与16个第三方服务的完整名单均未说明。
- 报道:OpenAI 发布 Dots 常驻智能体,Anthropic 与 OpenAI 数周内连发多款降价模型 · Last Week in AI ↗
- 报道:OpenAI DevDay 2026 发布 dots 个人代理、GPT-6.1 Sol 与 Ultrafast 模式 · Simon Willison ↗
- 报道:OpenAI DevDay 2026 扩展 Codex 与 API:安全扫描、Decisions API、Ultrafast · The Decoder ↗
- 观点:Greg Isenberg 解读 OpenAI Dev Day 2026:Dots、Decisions API、Agents API 与 Sign in with ChatGPT · YouTube 搜索 - AI agents ↗
- 报道:OpenAI 在 DevDay 2026 发布常驻云电脑智能体 Dots,并推出 GPT-6.1 Sol · The Decoder ↗
- 报道:OpenAI DevDay 2026 发布 Dots 常驻代理、GPT-6.1 Sol 与 Ultrafast 模式 · Latent Space ↗
- OpenAI 发布 Dots 等约20项更新,创作者称其把常驻代理能力带给普通用户 · YouTube - The AI Advantage ↗
Reddit r/n8n 用户 Competitive-Joke-408 发帖称,其自托管 n8n 实例每月 Claude token 花费约 58 美元,因 Anthropic 发票只显示总额,他按工作流和模型自行汇总执行 token 用量,发现一个 Reddit 抓取工作流占账单 75%。原因是调度改动只保存未发布,旧版本持续运行。修正后月费约 5 美元。
展开详情
他还称内置编辑器助手在大模型上跑一天的费用相当于生产环境一个月。作者建议按工作流而非按发票计量成本,并检查实际发布版本。
尚未明确:仅为单一用户自述,无截图或原始数据佐证;58 美元与 5 美元为作者自报,未说明统计周期与模型明细;编辑器助手一天费用等同生产一个月的说法未给出具体金额。
Greg Isenberg 在播客中称,麦肯锡预计到2035年约百万家小企业因业主退休而转手,规模约5万亿美元。他引用 Thrive Holdings 两年内收购近50家会计事务所,其中 Bellingham 的 Larson Gross 用基于 OpenAI Codex 的 AI 在本税季处理7000份申报,会计平均省31%时间;General Catalyst 拨出15亿美元,旗下 Long Lake 称不到两年收购18家物业管理公司、EBITDA 达1亿美元。
展开详情
他同时说明这些数字多为融资中年轻公司自报,未经衰退检验,只算方向信号而非证明。
尚未明确:Thrive 与 OpenAI 的合作关系、General Catalyst 投入金额与 Crescendo 处理90%工单等说法均未获官方确认;31%省时、EBITDA 等为自报数据,未经独立核实,也未经历经济下行检验。
Latent Space 播客发布一期对谈,嘉宾为 Anthropic 的 Thariq Shihipar,主持人为 swyx 与 Vibhu,时长约 1 小时 34 分。
展开详情
节目介绍称,讨论覆盖 Claude Code 的界面演进(Ask User Question、artifacts、Claude Tag、Projects、model effort、implementation notes),以及用于自定义 harness 的新 Claude Mods 系统;Thariq 还提出 Claude.md 可能最终消失、前沿模型在部分任务上可能同时更聪明也更省 token、可变软件或成新范式等观点。后半段转向 Agent 安全与 Anthropic 的 Pacing the Frontier 主张,包括 sandboxing、prompt injection、Auto Mode 等。以上均为节目介绍与嘉宾说法,非独立验证。
尚未明确:节目介绍未给出 Claude Mods 的发布时间、可用范围与具体能力边界;Claude.md 消失、前沿模型更省 token、可变软件等均为嘉宾观点或预测,无数据支撑;Exploit-Bench、Hugging Face scorer 等事件细节未在材料中说明;材料仅有标题、简介与时间轴,未逐段核对视频内容。
西班牙创作者 Juanpe Navarro 发布 21 分钟教程,称用 Claude Code 桌面版配合 Opus 5 搭建了一个本地视频剪辑项目:用 Whisper 转录、FFmpeg 与 Remotion 处理画面与动画、Higgsfield 生成音乐和 A/B 缩略图,再通过 Blotato 的 API Key 自动发布到 YouTube 等平台。
展开详情
他称本视频片头即由该系统完成,自己只录制并上传原始素材,并给出两种变现思路:做自有内容、把系统卖给企业。以上均为作者自述,未提供第三方验证。
尚未明确:视频未展示完整成片与人工修改量,无法判断自动化程度;Opus 5 与 Claude Opus 5.5 的名称在材料中不一致;Remotion 商用授权、Blotato 试用与定价、实际节省的时间和成本均未说明。
一名Reddit用户在r/AI_Agents发帖称,他对开源MCP记忆服务器Knowl做了记忆投毒测试:先写入12条编码代理会存储的已验证事实(令牌有效期、部署审批规则、数据区域、备份保留期等),再用普通矛盾、伪造observed标签、伪装成正常更正等写法覆盖。作者称在测试版本上216次攻击写入全部替换了真实事实,且冲突检查只查仍活跃的事实,事后无告警。
展开详情
Knowl维护者随后修复了5条建议中的4条,发布Knowl 5.24.0;作者复测称自动写入替换已验证事实从36/36降至0/36,仍被替换的事实会出现在冲突视图。作者称直接调用存储工具的路径仍可写入伪装成更正的谎言。
尚未明确:测试由发帖者自行设计并执行,数字未经第三方复核;Knowl 5.24.0的具体改动范围、其他记忆服务器是否同样脆弱、以及直接调用存储工具这一未修复路径的实际风险均未说明。
The Decoder报道,OpenAI与EDA厂商Synopsys签署多年战略合作,共同开发面向芯片设计的专用模型GPT-Synopsys。该模型结合OpenAI的AI技术与Synopsys的EDA工具,目标是能推理芯片设计与验证,并直接操作Synopsys工具;工程师负责下达设计目标并审核批准输出。模型运行在OpenAI基础设施上,双方称客户数据不用于训练且加密存储。
展开详情
目前已与半导体客户开展早期测试,双方将联合营销并分成收入。Synopsys CEO Sassine Ghazi称AI可显著加速设计流程。
尚未明确:早期测试的具体客户、规模与效果均未披露;模型何时商用、定价与分成比例不明;客户数据不用于训练的说法来自双方声明,尚无第三方验证。
整理于 2026-10-01 06:48(北京时间) · 部分来源暂未获取