AI 情报

· 49 条 · 北京时间

  1. 作者称:Matt Wolfe 汇总 OpenAI DevDay 2026:Dots 助手、GPT-6.1 Sol 与多项发布

    模型与工具

    Matt Wolfe 在周报视频中汇总 OpenAI DevDay 2026 发布:常驻助手 Dots(无模型选择器、可主动提醒邮件与 Slack、支持语音通话),据其自述获早期访问并试用约一周;GPT-6.1 Sol 定位为比 Astra 便宜、能力接近的模型,API 定价 2 美元/百万输入 token、10 美元/百万输出 token;另有 UltraFast 模式、Decisions API、ChatGPT Spaces 与 Pages、会议插件、Sign in with ChatGPT 等。

    展开详情

    他还提到 Claude Sonnet 5.5、Gemini 4 Argon、Ideogram 4.5、ElevenLabs Eleven v4 等。以上多为作者转述官方发布与个人体验,未独立实测。

    尚未明确:Dots 的实际可用市场、长期稳定性与隐私边界;GPT-6.1 Sol 与 Sonnet 5.5 等基准的独立复现;Gemini 4 Argon 仅面向受信任网络安全方开放,公开可用时间未知;视频中部分定价与套餐细节未在材料内逐项核实。

  2. Reddit 用户称多智能体系统最大改进是让智能体变成可替换工人

    实践

    Reddit r/AI_Agents 用户 Druss_ 发帖称,过去数周重构其用于真实工作的多智能体系统,最大理念转变是不再让智能体本身构成系统,而是把它们当作系统内可替换的工人。他描述的新架构为:权威状态→有界任务契约→能力路由→合适工人→结构化结果→确定性检查→独立语义验证→已验证状态更新。

    展开详情

    他提出四点变化:完成不由工人宣布而由系统回读外部状态验证;推理自主权与执行权限分离;把已成熟流程从推理降级为规则、测试和工作流;按步骤选择最低成本可靠智能层级。他称自己并非软件工程师,而是前 CEO 和经济学者,因此把智能体架构视为组织设计问题。

    尚未明确:帖子未给出系统规模、具体任务类型、所用模型、成本或效率数据,也未提供可复现的基准;所述改进是作者个人经验与观点,尚无第三方验证或成功案例数据。

  3. The Information 报道:Meta 与微软削减员工内部使用 Claude,转向自研模型与 Copilot

    议题

    据 The Information 10 月 5 日报道(经宝玉转述),Meta 和微软都在减少员工内部使用 Anthropic 的 Claude。Meta 内部使用 Claude Code 的员工从年初约 6 万人降至约 3 万人,部分因春季裁员,更大原因是推广自研 Muse Spark 系列模型与编程工具:Muse Code 已有超 6000 名员工使用并于 8 月起对外测试,内部 MetaCode 用户超 3 万。

    展开详情

    微软原预计今年内部在 Anthropic 上至少花 10 亿美元,已被砍掉三分之一以上,管理层要求改用自家工具,工程师被引导转向 GitHub Copilot 命令行版本;云和 AI 部门每人每月 AI 模型额度从 10 万美元降至约 1 万美元。报道同时指出,微软企业客户通过其平台购买 Anthropic 服务的支出仍在增长。

    尚未明确:The Information 原文未直接读到,数据来自转述;Meta 与微软均未公开确认;Muse Code 对外测试效果、额度下调对产出的实际影响、以及是否与 Anthropic IPO 相关均未证实。

  4. 作者称:AI LABS 用 Claude Code 搭 Karpathy 式循环,并加一层自动改写指令的循环

    实践

    YouTube 频道 AI LABS 称其复现了 Karpathy 的 AutoResearch 循环:代理只能改训练文件、不能改评分文件,由 program.md 用自然语言规定每轮做法,两天跑 700 次实验、找到 20 个让模型训练更快的改动;并称 Shopify CEO 用同类循环过夜跑 37 次实验,模型表现提升 19%。

    展开详情

    作者把该循环搬到自己的 Claude Code 工作流,用 project context、build、write checks、approve checks 等技能与每功能新建的 builder 代理,让检查先于功能写好并锁进代理不可编辑的目录。作者称在餐厅网站加自取点单功能时写了 11 项检查、首轮全过,但循环发现检查未覆盖的下单表单并补上;随后又做了 auto loop,读取每轮结果文件、把反复出现的坏习惯写回 program.md 的 how to work 部分,但不得改检查。

    尚未明确:所有效果数字(700 次实验、20 个改动、37 次实验、19% 提升、11 项检查首轮全过)均来自作者或转述,未独立验证;Shopify CEO 的具体模型、任务与评测方式未说明;视频未展示完整代码与检查内容,也未说明失败轮次比例与 token 花费;字幕为自动生成,部分专有名词可能有误。

  5. 五角大楼称已停用Anthropic工具,此前将其列为供应链风险

    议题

    BBC报道,美国国防部一名官员周一表示,五角大楼"已停止使用Anthropic产品"。国防部长Hegseth今年2月将Anthropic列为国家安全供应链风险,并宣布8月底前停用,但多名知情人士称直到上周Claude仍被用于研究、分析、情报收集及对伊朗的军事行动,且深度嵌入Palantir运营的Maven Smart System。Anthropic以"前所未有且不合法"为由起诉特朗普政府,一名法官8月裁定政府属非法报复。

    展开详情

    五角大楼已与Google、xAI、OpenAI签约,OpenAI工具近月在一些军事部门使用更广。Anthropic拒绝对此置评。

    尚未明确:停用的确切时间与是否彻底完成不明;五角大楼未说明延迟原因;Anthropic未回应;Claude在Maven中的具体作用与替代进度仅有匿名信源描述。

  6. 作者称:Claude Code 2.1.287 上线 Mods:用自然语言给终端加界面与插件

    模型与工具

    YouTube 频道 Tristen O'Brien 在视频中称,Claude Code 于 2026 年 10 月 1 日在 2.1.287 版本推出 Claude Mods:用户用自然语言描述想要的功能,Claude 就把按钮、面板、斜杠命令等直接做进自身,无需写代码。

    展开详情

    作者展示了自己本周做的五个 mod,包括隐藏代码的清单视图、一键切换模型与 effort、并行多智能体面板、经 Higgsfield MCP 调用 Nano Banana Pro 等模型生成图片视频,以及等待时玩的小游戏,并称可把 mod 存为插件安装。该视频由 Higgsfield 赞助。

    尚未明确:Anthropic 官方是否发布 Mods、版本号与上线日期是否准确,材料仅有作者说法;mod 的权限与安全边界、插件分发机制、是否对所有付费计划开放,均未说明;作者展示的五个 mod 效果未独立验证。

  7. 作者称:开发者用单张3090跑本地35B浏览器Agent,在Online-Mind2Web上试跑并公开失败模式

    实践

    Reddit用户称其用本地模型Ornith 1.5 35B(单张3090)搭建浏览器Agent,在他人编写的Online-Mind2Web(300任务、136个真实网站)上试跑。同一模型下,TED任务经三次调整提示与工具返回提示后答对,作者归因于清单项加工具结果提示,而非单纯提示词。

    展开详情

    随后30个新任务中,未给起始站点组10个有效任务对6个,给起始站点组14个有效任务对5个;9个失败中6个属UI操作(地址自动补全、下拉框、Cookie浮层、搜索框)。作者强调为自评、非WebJudge,样本小,机器人检测任务按规则交人工并排除在分母外。

    尚未明确:Ornith 1.5 35B的具体来源与能力未说明;自评标准与WebJudge差异未量化;样本量小,作者本人也不做大结论;机器人检测排除在分母外的做法是否合理仍待讨论;未提供可复现的代码或完整任务清单。

  8. 作者称:Hugging Face 团队把 Claude Code、Codex 等 10 个编码工具直接变成 RL 训练环境

    模型与工具

    Hugging Face 的 Clement Delangue 发帖介绍一套开源方案:不改动 Claude Code、Codex、Hermes、Pi、opencode 等编码工具本身,也不改训练代码,而是插入一个捕获代理,让工具以为在调用模型 API,实际转发到 vLLM 并记录 token ID 与 logprobs,再交给 TRL 训练。作者称目前 10 个工具无需修改即可运行。

    展开详情

    在 LFM2.5-2.6B 上,单工具训练后 OpenCode 从 34% 升到 58%,四工具同时训练后四者均提升(42%→54%);用 Qwen3.8-27B 的 3189 条轨迹做 SFT 则停在 47.5%。作者还称加入减少工具调用次数的奖励后,调用数减少 31%。

    尚未明确:数据均为作者自述,尚无第三方复现;未说明任务集规模、评测口径、训练成本与硬件;31% 工具调用减少的具体统计范围未交代;更大模型与更大规模实验尚未进行。

  9. OpenAI 在 ChatGPT 推出新视觉广告形式并扩展广告衡量工具

    模型与工具

    OpenAI 官网发布文章,宣布在 ChatGPT 中引入一种新的视觉广告形式,同时扩展面向广告主的衡量工具、归因合作与品牌适配能力。材料仅给出这一概括性描述,未披露广告的具体样式、展示位置、上线时间、覆盖地区或定价方式,也未说明归因合作方名单与品牌适配标准。因此,这属于 OpenAI 官方对广告产品方向的正式发布,而非第三方实测或效果数据。

    补充信息

    尚未明确:广告具体形式与展示位置、上线时间与地区、是否影响免费与付费用户的体验差异、定价与投放门槛、归因合作方与衡量口径、品牌适配的具体规则,材料均未说明。

  10. AWS 开发者用 Strands Agents 演示智能体运行时自写工具并生成子智能体

    模型与工具

    AWS GenAI 高级开发者布道师 Sandhya Subramani 在 AI Engineer World's Fair 2026 演讲中,用开源 Strands Agents SDK 演示元工具化:智能体初始无工具,遇到不会的任务时自行编写工具并在不重启的情况下加载使用。实现方式是一段描述“好工具长什么样”的系统提示,加上 editor、shell、load_tool 三个工具。

    展开详情

    她还演示了会自建子智能体的旅行规划器,并介绍 swarm、graph、handoff、workflow 等模式,以及自修改智能体上线前需要的评估(目标达成、工具选择、参数、智能体间流转)与护栏(沙箱执行、权限约束、可观测性)。以上为演讲者演示与说法,非独立实测。

    尚未明确:演示中的成功率、稳定性与成本未给出数据;沙箱与权限护栏的具体实现细节、Strands Agents 的版本与生产可用性、以及“Strands 自己写了 TypeScript 版本”这一说法的细节均未在材料中说明。

整理于 2026-10-06 06:48(北京时间) · 部分来源暂未获取

AI 情报·2026-10-06|SCT AI 出海