AI 情报

· 37 条 · 北京时间

  1. 报道:Latent.Space 播客:MIT 张安澜谈递归语言模型与万级智能体实验

    模型与工具

    Latent.Space 在 X 发布新一期播客,主题为 Recursive Language Models,嘉宾为 MIT 的 @a1zhang。节目简介称其解释 Claude Code、Codex 与 Pi 为何基本同类,RLM 如何用代码、上下文卸载与递归子智能体跨任务泛化,为何一个专家有时可替代万亿 token 的暴力搜索,以及 OpenAI 一项 1 万智能体、1300 亿输出 token 实验对未来语言模型的启示。

    展开详情

    以上均为节目方对谈内容的预告式描述,非独立验证结论。

    尚未明确:播客正文与音频未读取,RLM 的具体方法、评测结果、OpenAI 实验的出处与可复现性均未在材料中说明;1 万智能体与 1300 亿输出 token 为节目方转述,未见原始报告。

  2. Anthropic 为 Claude Code 推出 Mods:可用 TypeScript 改行为与界面

    模型与工具

    Anthropic 开发者账号 @ClaudeDevs 宣布 Claude Code 支持 Mods:可改变其行为、自定义 UI、替换为自己的功能,用几行 TypeScript 编写,也可让 Claude 代写;Mods 打包在插件内,通过 CLI 或桌面应用的 /plugin 安装。

    展开详情

    Latent.Space 转述 Anthropic 的 Thariq 说法称,Mods 能访问对话上下文(如对话轮数、已用 token),因在进程内运行可派生子代理、解析其结果并用结构化输出返回,还能修改 hooks 无法触及的 UI。以上为官方与转述说法,未见独立验证。

    尚未明确:Mods 的权限与安全边界、是否影响计费、支持的 Claude Code 版本与平台、插件分发与审核机制、示例的实际可用性均未在材料中说明;转述内容来自播客账号,未附完整访谈原文。

  3. 作者称:Varick 的 Vas 在播客中拆解 FDE 部署 AI 代理的流程再造方法

    实践

    Greg Isenberg 播客中,Varick Agents 的 Vas 讲述其前向部署工程师(FDE)如何把 AI 落地进企业:先做访谈、挖掘系统记录、梳理现有文档,画出真实流程,再把每一步分入删除、普通代码、代理、人工决策四类,并把代理建在 Salesforce、NetSuite、Slack 等客户既有系统内。

    展开详情

    他称一个 500 亿美元营收的上市软件公司报价流程实为 20 步、含 7 个回环;一个应付账款项目把单张发票处理成本从 31 美元降到 6 美元、直通率从 18% 升到 87%。这些均为其自述案例,未独立核实。

    尚未明确:案例数据(31 美元到 6 美元、18% 到 87%、20 步 7 回环)均来自受访者口述,客户名称与细节被匿名化,无法独立验证;播客中提到的模型名称(如 Muse、Grokbot、Dots、Gemini 3.8 Live 等)多为转录疑似错字或赞助口播,未核实;FDE 年入百万美元的说法只是节目标题与讨论,无具体薪酬证据。

  4. 白宫召集科技CEO签AI安全承诺,特朗普行政令将AI改称“超级智能”

    议题

    TechCrunch 报道,本周白宫把扎克伯格、贝索斯、马斯克与 Anthropic 的 Dario Amodei 等主要科技公司 CEO 聚到一起,签署一份 AI 安全承诺,特朗普称其“具有道德约束力”。特朗普还签署行政令,正式把 AI 改称为“super intelligence(超级智能)”。同一期 Equity 播客提到,Meta 与 OpenAI 正给自家 AI 产品换上更友好的形象,而 AI 领域最大的收入仍来自企业端。

    展开详情

    以上为媒体报道与播客转述,承诺具体条款、行政令实际效力均未在材料中展开。

    尚未明确:承诺的具体条款、签署方是否具法律约束力、行政令是否改变任何实际监管规则、以及“更友好形象”指哪些具体产品改动,材料均未说明。

  5. 观点:Karpathy 建议用 LLM 输出图表、网页与讲解视频来理解模型结果

    议题

    Andrej Karpathy 在 X 发帖称,随着 LLM 变强,人们会把更多时间花在理解模型输出上,并分享自己的做法:让 LLM 用航空维修文档规范 ASD-STE100 的语言风格解释内容,或放宽到“80% 接近”;把文字换成图表;要求以 HTML 输出交互网页;他最看好的是按任意主题生成定制讲解视频,例如提示“做一个 3b1b 风格的 X 讲解视频,用我的 ElevenLabs API key 配音”。

    展开详情

    他称后者“已经开始能用了”,并认为未来可大量生成一次性、定制的软件产物。以上均为其个人经验与观点,非产品发布或独立评测。

    尚未明确:帖子未给出具体模型、提示词全文、生成视频的实际效果样例或可复现步骤;“已经开始能用了”是作者主观判断,缺少第三方验证;ASD-STE100 与 3b1b 风格的实际可用程度未知。

  6. 作者称:n8n 用户开源发票自动入账工作流:Gmail 抓取、去重后写入 Google Sheets

    实践

    n8n 社区用户 Felix(easybits_ai)发布了一个免费发票处理工作流,作者称已接入自己的 billing@ 邮箱,所有带附件的未读邮件会被自动读取、判断是否为发票并抽取字段,按发票号去重后追加到 Google Sheets,并逐条发送 Telegram 提醒;其他邮箱收到的发票可转发到该地址同样处理。作者强调两点做法:分类与抽取合并为一次模型调用,减少节点和失败点;写入前用发票号做表内查重,避免重复轮询或重发造成重复记录。

    展开详情

    工作流 JSON 已放在其 GitHub 仓库,与 25 个以上免费 n8n 工作流并列。

    尚未明确:作者未说明所用模型、抽取准确率、对非标准发票格式的失败率,也未提供实际运行时长或处理量;GitHub 仓库内容与许可证情况需进一步查看。

  7. 报道:Ramp AI指数:美国企业AI用量创新高,API支出却持续下降

    议题

    The Decoder报道Ramp经济学家Ara Kharazian发布的Ramp AI Index:美国企业AI使用量自7月支出峰值以来上升约50%,9月底创历史新高,但API支出持续下降。Kharazian称降价几乎全部来自OpenAI与Anthropic的竞争,以及更便宜高效的标准版和轻量版模型。9月最后一周Anthropic占token支出51%,OpenAI占44.5%,开源模型不足企业支出5%。

    展开详情

    该指数基于逾7万家美国公司的交易数据,token数据来自子样本,仅覆盖API支出且偏向大型AI客户。

    尚未明确:Ramp未说明支出下降的具体幅度与统计口径细节;token数据仅来自子样本,且只覆盖API支出、偏向大型客户,不能代表全部企业AI开支;用量上升50%的基期与计算方式未在材料中说明。

  8. Google 发布 Gemini 4 Argon,先向 Fairwind 计划可信网络防御者开放

    模型与工具

    Google 于 9 月 30 日发布前沿模型 Gemini 4 Argon,官方称其在真实软件工程、法律金融等企业知识工作和网络防御上达前沿水平,输出上限从 64K 提升至 100 万 token,介绍价每百万输入 2 美元、输出 10 美元。该模型先通过 Fairwind 计划向可信网络防御者开放,之后才面向开发者、企业和消费者,首批为付费 API 客户和 Google AI Ultra 订阅者。

    展开详情

    官方称 Argon 已用于 Google 内部量子算法优化、数据中心内存优化和 C/C++ 转 Rust 迁移。

    尚未明确:官方未公布通用可用时间表;基准成绩来自 Google 自述,尚无第三方独立复现;Argon 在 Google 内部任务上的效果是否可外推到普通用户和客户场景仍未知。

  9. 报道:Cloudflare 发布 Clef 与 Clef-flash 决策模型,主打低延迟替代 Jev

    模型与工具

    Cloudflare 发布两款面向 AI 智能体的决策模型 Clef 与 Clef-flash,不生成文本,而是对预设选项输出概率,供下游系统自动路由工单、升级或转人工。

    展开详情

    据 Cloudflare 自报,Clef-flash 中位延迟约 39 毫秒,Clef 约 209 毫秒,对比 Jev 的 524 毫秒以上;两者基于 Qwen3.8-27B 与 Qwen3.5-9B,支持文本与图像,采用 Apache-2.0 许可并在 Workers AI 与 Hugging Face 提供,API 与 Jev 兼容。Cloudflare 称其威胁情报团队已用 Clef 分类网站,并计划用于滥用举报与支持请求分拣。

    尚未明确:延迟与准确率数据均为 Cloudflare 自报,尚无独立复现;Jev Decision Index 等基准由 Cloudflare 自行设计。文中“人类不再需要留在回路中”是公司说法,实际高风险决策是否仍需人工复核未说明。自服务微调平台尚未上线,目前由前置工程师协助。

  10. 作者称:宝玉用 Opus 5.5 加 Gemini 3.8 Flash TTS 全自动生成中英双语吃瓜视频

    实践

    X 用户宝玉发帖称,他尝试用 Opus 5.5 制作吃瓜视频,由模型自行搜集素材、撰写文案并完成剪辑,配音使用 Gemini 3.8 Flash TTS(他自备 API Key),产出英文和中文两个版本。帖子附上了完整 Prompt,要求 9:16 竖版、4–6 分钟、开头 3 秒抛最炸的点、以视频片段为主、标注来源、裁掉原字幕台标、加推文原文卡片与中译、交付前用 STT 回听和抽帧检查,并可选做去敏版。

    展开详情

    作者称全程由模型自己找素材、自己配音,但未说明成片质量、耗时与人工介入程度。

    尚未明确:成片实际质量、生成耗时、失败率、素材版权与平台合规风险均未说明;Opus 5.5 与 Gemini 3.8 Flash TTS 的具体版本能力也无官方说明,帖子只有作者自述,无第三方验证。

整理于 2026-10-03 06:48(北京时间) · 部分来源暂未获取