SCTCAMP · AI 行动情报
每天替你删掉噪音,留下值得动手的信号。
今日判断
本期已整理:新模型与工具 41 条;真实实践 34 条;大众议题 30 条
今天动手
本期原始材料
这是一种与主流 LLM 不同的接口形态:把分类、排序、打分从生成式输出中拆出来,成本极低且可并行提问。对做检索重排、内容审核、标签与优先级判断的产品搭建有直接参考价值,也提示评估与偏差检查会成为新的必要环节。
阅读原始材料,核对作者展示与尚未确认的部分。
根据原始材料区分作者说法、已展示结果和未知限制。
5/89 个来源本轮获取失败,内容来自其余可用来源
大众议题
03- 01
宝玉转述:OpenAI 称内部模型解出纳维-斯托克斯方程,并设数学顾问组
X 用户宝玉转述称,OpenAI 宣布一个 8 月 28 日开始训练的内部模型解决了纳维-斯托克斯方程这一千禧年难题,并在数学各领域攻克超过 100 个长期未解公开问题;同时称 9 月 11 日有 27 位菲尔兹奖得主联名发表公开信质疑 AI 把开放问题当跑分、跳过论文与方法提炼。作为回应,OpenAI 宣布成立挂靠普林斯顿高等研究院的独立顾问组 AGMAI,成员包括 Timothy Gowers、Martin Hairer、Edward Witten 等,不领 OpenAI 报酬、可公开批评,但不负责建议放慢研发节奏。上述均为转述与作者说法,未见原始论文或证明。
你可以:这是 AI 进入数学知识生产核心环节的信号:模型能力宣称、学术共同体反弹、以及企业用独立顾问组回应合法性质疑,三者同时出现。对 Scott 判断 AI 与专业智力工作的关系、以及如何向客户解释 AI 结论的可信度边界,都有参考价值。
X - 宝玉看原文 ↗ - 02
宝玉转述Politico调查:白宫与Anthropic就前沿模型监管博弈85天
宝玉在X转述Politico一篇深度调查,称其采访十余位当事人,还原4月至7月特朗普政府与Anthropic围绕AI安全监管的博弈。文中称Anthropic 4月7日向审批用户发布可快速发现基础设施漏洞的Mythos,微软3月底获早期访问后向政府警告;白宫一度拟要求前沿模型发布前接受商务部CAISI 60天强制评估,遭Google、Anthropic、OpenAI反对,最终行政令6月2日低调签署,审查窗口缩至30天且改为自愿。6月9日发布的Fable因越狱漏洞被商务部以出口管制指令下架19天,后经Tom Brown谈判恢复。以上均为转述Politico报道内容,非独立证实。
你可以:前沿模型发布节奏正被安全审查与出口管制直接干预,这会影响模型可用性、供应商选择与合规预期;对做产品与选型的人,值得知道监管不确定性已成为真实变量。
X - 宝玉看原文 ↗ - 03
报道:Brood War Bench 让通用大模型智能体打星际争霸,全部未超过人类新手
X 用户宝玉转述:作者 Ben Swerdlow 做了一个只能通过智能体操控的《星际争霸:母巢之战》版本,并开放 Brood War Bench 对战平台,让通用大模型以智能体形式自行建基地、造兵、作战。转述称 Codex Astra 18 场全胜但主要靠派 Probe 骚扰,Claude Fable 胜率 83.3% 且会发展经济爬科技树,Grok 4.6 一局 43 分钟输出超 11000 推理 token 却只发 6 批指令、未造战斗单位。转述结论是所有模型水平未超过会基础快攻的人类新手,暴露实时多线程协调短板。以上均为转述者说法,未见原始评测报告。
你可以:这是少见的把通用大模型放进实时、多线程、持续决策环境做横向对比的公开测试,且平台开放可复现。对判断智能体在真实工作流中的节奏控制与长时任务协调能力有参考价值,也提示当前 agent 产品在实时场景的边界。
X - 宝玉看原文 ↗
真实实践
03- 01
作者称:开发者自建Agent路由只升不降:5.9万请求中8458次升级、零次降级
Reddit用户mrtrly称,他为降低Agent成本自建模型路由,事后检查路由方向发现:在59,299次请求中8,458次向上升级到更贵模型,零次向下切换。按标价合计约5,085美元,但实际跑在包月Max订阅上,现金支出仅数百美元;中位请求4美分。升级部分约占标价1,505美元,作者估算账单本可低约30%。他认为真正省钱的是缓存(未缓存标价16,980美元,缓存后5,085美元,约省70%),而升级会破坏缓存,约7倍成本。编码支出中72%(3,218美元)花在最终被取消的任务上,一个修测试任务重试76次烧掉940美元。作者结论:默认已便宜时,路由是质量旋钮而非省钱旋钮,应看每个交付物的成本。记录用代理已开源。
你可以:这是一份少见的、带具体数字的Agent成本结构复盘:它把“路由省钱”的常见假设拆开,指出升级方向、缓存失效、取消任务浪费三个真实成本黑洞。对正在搭Agent或给客户做成本估算的人,提供了可对照的检查清单——先看路由实际往哪走,再看每个交付物成本,而不是每次请求成本。
Reddit - AI Agents看原文 ↗ - 02
作者称:宝玉分享 Claude 多模型分工法:Fable 写方案、Opus 执行、Fable 验收
宝玉在 X 上介绍自己摸索的省 Token 工作流:在 Claude 中用 /advisor fable 把 Fable 设为顾问,复杂任务先由 Fable 出技术方案文档,确认后让 Opus 执行,并在提示词中要求 Opus 完成后请 advisor 验收、按反馈修复直到通过,从而让 Agent 自行闭环,无需人工在会话间搬运文档。他称另一套常用组合是 Fable 5 写方案、Codex 执行、Fable 5 验收,兼顾质量与性价比,并提到方案确认后先 /compact 以节省上下文。以上均为作者个人实践说法,非官方功能说明。
你可以:这是一条可直接借鉴的多模型协作与成本控制实践:把强模型用于规划与验收、把执行交给成本更低的模型,并用 advisor 机制让验收自动化,对日常用 Claude/Codex 做开发与内容生产的人有参考价值。
X - 宝玉看原文 ↗ - 03
作者称:n8n用户开源95节点多模型B2B意向雷达工作流,含JSON与Airtable结构
Reddit r/n8n 用户 Shoddy_Branch5364 发布一套自建 n8n 工作流,用于 B2B 线索发现:只抓取主动求助或讨论痛点的公开内容,不做自动冷邮件,所有输出经 Slack 人工确认。作者称架构为95个节点,自托管 n8n 加 Airtable 作状态机、Slack 做人工校验;用正则加 GPT-4o-mini 初筛、仅对评分75以上的结果调用 Claude 3.5 Sonnet,并用指数衰减函数给线索降温。作者称上线前以 Shadow Mode 静默运行两周,把提示温度降到0.2。GitHub 仓库 aminesellal/n8n-ai-workflows 的 leadgen 目录提供工作流 JSON、逐节点文档和 Airtable 表结构。以上均为作者自述,未见第三方验证。
你可以:这是一份可直接导入的完整多模型编排方案,展示了成本分层、结构化输出容错、人工闸门与线索时效衰减的具体做法,对自建销售或研究型 Agent 流水线有参考价值,也反映 n8n 社区正从单模型包装转向多模型共识加人工复核。
Reddit - n8n看原文 ↗
新模型与工具
02- 01
观点:TypeSafe AI 发布 Jev:只输出概率分数的决策模型,输入每百万 token 0.042 美元
Simon Willison 记述,TypeSafe AI 上周发布 Jev,称其为“System One 模型”的首个实例(他更认同 Maggie Appleton 的“决策模型”叫法)。Jev 接受文本输入,但不输出文本,而是返回浮点数:是/否置信度、选项概率分布、区间评分。定价只按输入计费,输出免费,首个模型输入价 0.042 美元/百万 token,低于 GPT-5 Nano 的 0.05 美元。官方文档称其在数字、日期和对抗性内容上表现不佳。社区已出现 jevchat、jev-leftpad、jev-2048 等实验,以及基于 Qwen 3.5 的开源复刻 Kev 和 JevBench 基准。
你可以:这是一种与主流 LLM 不同的接口形态:把分类、排序、打分从生成式输出中拆出来,成本极低且可并行提问。对做检索重排、内容审核、标签与优先级判断的产品搭建有直接参考价值,也提示评估与偏差检查会成为新的必要环节。
Simon Willison看原文 ↗ - 02
Box 称用 Claude Opus 5.5 测企业任务,准确率提升且 token 消耗大降
Box CEO Aaron Levie 称,Box 用 Box Agent 在非结构化企业知识任务上测试了 Anthropic 新发布的 Claude Opus 5.5。他给出的对比是:相比 Opus 5,token 用量少 63%、冗长度低 42%、速度快 30%,模型本身也更便宜。他列举四类内部测试:金融尽调任务准确率 +39%、云成本分析 +65%、客户账户分析 +17%、临床诊断数据分析 +15%,并称部分任务 token 减少 70% 至 82%。这些数字来自 Box 自述测试,非第三方验证。Levie 还称客户将可在 Box AI Studio 中用 Opus 5.5 搭建 AI Agent。
你可以:这是模型厂商发布后,企业软件方给出的第一手落地测试口径,涉及 Agent 处理非结构化数据、成本与速度,对判断企业级 Agent 可行性和选型有参考价值。
X - Aaron Levie看原文 ↗