SCTCAMP · AI 行动情报
每天替你删掉噪音,留下值得动手的信号。
今日判断
本期已整理:新模型与工具 37 条;真实实践 32 条;大众议题 29 条
今天动手
本期原始材料
它把 LLM 从“生成文本”改成“输出可编程的决策分数”,对分类、打标、排序、重排这类产品环节是新的接口形态;价格极低意味着可以大规模跑评测,同时黑箱与偏见问题也更突出,值得作为产品架构与评测设计的参考。
阅读原始材料,核对作者展示与尚未确认的部分。
根据原始材料区分作者说法、已展示结果和未知限制。
6/89 个来源本轮获取失败,内容来自其余可用来源
大众议题
03- 01
OpenAI 发布 GPT-6 Sol 与 Luna,称 token 价格降 50%
Aaron Levie 在 X 上转述并评论 OpenAI 当日发布:OpenAI 官方帖称欢迎 GPT-6 Sol 与 GPT-6 Luna 进入 GPT-6 系列,二者基于 GPT-6 Astra 的技术进展,定位更快、更便宜,用于支撑规模化工作,并称缓存与推理效率也有提升。Levie 称前沿模型当天大幅降价,除 Opus 5.5 降价外,GPT-6 Sol 和 Luna 把 token 价格降低 50%,并认为单位任务成本下降会显著扩大可部署的 agent 用例。上述降价幅度与效率提升均为发布方与评论者说法,材料未给出具体价格表或基准数据。
你可以:前沿模型价格与推理效率同时下探,直接改变 agent 类产品的成本结构和可承载的任务规模,是判断产品路线与客户方案时值得跟踪的信号。
X - Aaron Levie看原文 ↗ - 02
OpenAI 称内部模型解出纳维-斯托克斯方程,并成立数学顾问组 AGMAI
X 用户宝玉转述:OpenAI 宣布其 8 月 28 日开始训练的一个内部模型解决了纳维-斯托克斯方程这一千禧年难题,并在数学各领域攻克超过 100 个长期未解的公开问题。同一材料还称,9 月 11 日 27 位菲尔兹奖得主(含陶哲轩等)联名发表公开信,批评 AI 公司把开放问题当跑分项目、跳过论文撰写与方法提炼。作为回应,OpenAI 宣布成立独立顾问组 AGMAI,挂靠普林斯顿高等研究院,成员含 Timothy Gowers、Martin Hairer、Edward Witten 等,不领 OpenAI 薪酬、可公开批评,但不负责建议放慢研发节奏。以上均为转述与作者说法,未见原始论文或证明。
你可以:这是 AI 进入数学证明这一高门槛智力领域的标志性事件,同时暴露学术共同体对 AI 产出方式的分歧;对 Scott 判断 AI 能力边界、以及智力型工作被重构的叙事都有参考价值。
X - 宝玉看原文 ↗ - 03
宝玉转述 Politico 调查:白宫与 Anthropic 就 Mythos、Fable 监管博弈 85 天
宝玉在 X 转述 Politico 一篇深度调查,称其采访十余位当事人,还原 4 月至 7 月特朗普政府与 Anthropic 围绕前沿 AI 监管的博弈。按该转述,Anthropic 4 月 7 日向审批用户发布可快速发现基础设施漏洞的 Mythos,微软 3 月底获早期访问后向政府示警;5 月草案拟要求前沿模型发布前接受商务部 CAISI 60 天强制评估,遭 Google、Anthropic、OpenAI 反对,6 月 2 日签署版本改为 30 天且自愿。6 月 9 日发布的 Fable 两天后被亚马逊研究人员发现越狱漏洞,商务部以出口管制禁止外国国民访问,19 天后恢复。以上均为转述内容,非 Scott 独立核实。
你可以:前沿模型发布节奏、出口管制与政府审查正在直接绑定,这决定模型可用性、企业选型和跨境团队访问权限;对做产品、选模型和判断供应链风险的人,这类监管事件比单个模型跑分更影响决策。
X - 宝玉看原文 ↗
真实实践
03- 01
Reddit用户用同一通电话测试8款AI电话代理,发现分两类产品
Reddit用户Evening_Hawk_7470称自己用Claude Code接线,让8款AI电话代理拨打其手机,扮演牙科前台,任务是预约工作日15点后儿童检查,并故意先提供13点或14点违规时段、要求拼写长姓氏。作者称Retell通话质量最好但仅完成网页通话,PlaceCall是唯一在真实电话线上完成预约的,Ring-a-Ding也预约成功但收尾松散,CALL-E的API返回结构化字段但通话中断,Vapi、Bland、AgentPhone未能完成真实外呼。作者将产品分为自建平台与直接呼叫两类,并称测试约一天半,多数为默认设置、单次运行。
你可以:AI电话代理正从演示走向可调用服务,这条材料给出同一任务下的横向对比线索,并揭示自建平台与托管呼叫两类产品在接入门槛、号码验证、外呼限制上的差异,对评估语音代理落地成本有参考价值。
Reddit - AI Agents看原文 ↗ - 02
观点:Cursor、OpenAI、Anthropic 一周内相继推出协调者式多智能体编排方案
Reddit r/AI_Agents 用户 omidfarhang 发帖称,Cursor Projects、OpenAI Agents API 与 Claude Code Projects 在大约一周内先后落地,三者都采用“协调者+并行 worker+共享记忆+云端常驻会话”的结构,他认为三家同时推出同一形态说明这是一个品类而非巧合。作者明确表示自己忽略发布时的数字,称数千子智能体、更漂亮的合并率只是演示;他实际看到的工作流仍是一两个智能体、一个 pull request、人工读 diff、CI 因普通原因失败。作者称尚未对其中任何一个做过有边界的迁移测试,因此没有合并门禁、同分支多 worker 编辑、单个完成 PR 成本的数据。
你可以:Scott 关注 AI 智能体产品形态与真实工作流落差。这条把三家头部厂商同期动作并置,并给出“协调者不产生新技能、只放大已有技能”的判断框架,可用于评估自己或客户的多智能体方案是否只是增加 diff 与评审瓶颈。
Reddit - AI Agents看原文 ↗ - 03
作者称:用户分享在群晖 NAS 上跑通 n8n Assistant 沙箱与外部 JS/Python 任务运行器
Reddit r/n8n 用户 mearbode 发帖称,已在群晖 DSM 上自托管 n8n Assistant 沙箱,并接上外部 JavaScript 与 Python 任务运行器。作者强调两者是不同系统:沙箱为 Assistant/Agents 执行代码和处理文件,任务运行器执行 Code 节点脚本。其部署用 1.4.0 版官方沙箱镜像,因群晖内核在 Docker-in-Docker 下缺 CPU CFS、嵌套 overlayfs 与 iptables raw 支持,需设 DOCKER_IGNORE_BR_NETFILTER_ERROR、关闭 cgroups、改用 vfs 存储驱动,并临时改写容器内启动脚本加入 DOCKER_INSECURE_NO_IPTABLES_RAW 才通过校验。外部运行器则通过私有 bridge 网络与 n8nio/runners sidecar 连接,日志显示 JS 与 Python 运行器注册成功。
你可以:这是少见的自托管落地细节:把 n8n 的 AI 沙箱与代码运行器在非标准硬件(群晖 NAS)上跑通,并暴露了 Docker-in-Docker 与内核限制的真实坑。对想在自己或客户环境里私有化部署 n8n Agent 能力的人,这类排障路径比官方文档更接近实际。
Reddit - n8n看原文 ↗
新模型与工具
02- 01
报道:TypeSafe AI 发布 Jev:只输出概率分数的决策模型
Simon Willison 记述,TypeSafe AI 上周发布 Jev,称其为“System One 模型”的首个实例(他更认同 Maggie Appleton 的“决策模型”叫法)。Jev 仍接收文本输入,但不生成文本,而是返回 0-1 浮点数、选项概率分布或区间评分,支持是/否、选择、打分三类提问,同一 state 可并行提交多个问题。官方称其为“非结构化状态输入、类型化概率决策输出”,只按输入计费,输出免费,首个模型输入价每百万 token 0.042 美元。作者称已用它做搜索重排实验,并发布 llm-typesafe 插件;社区出现 jevchat、jev-leftpad、jev-2048 及基于 Qwen 3.5 的开源复刻 Kev。
你可以:它把 LLM 从“生成文本”改成“输出可编程的决策分数”,对分类、打标、排序、重排这类产品环节是新的接口形态;价格极低意味着可以大规模跑评测,同时黑箱与偏见问题也更突出,值得作为产品架构与评测设计的参考。
Simon Willison看原文 ↗ - 02
观点:Anthropic 发布 Claude Opus 5.5,OpenAI 同日推出 GPT-6 Sol 与 Luna 并大幅降价
Simon Willison 记录:Anthropic 发布 Claude Opus 5.5,约一小时后 OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna。据其整理的价目,GPT-6 Luna 为输入 $0.10/M、缓存输入 $0.01/M、输出 $0.50/M,约为 GPT-5.6 Luna 的一半;GPT-6 Sol 为 $2/$0.20/$10,也较 GPT-5.6 Sol 减半。Opus 5.5 输入 $4/M、输出 $20/M,较此前 Opus 系列的 $5/$25 降 20%,缓存读取价格降 60%。作者称已把 GPT-6 Sol 与 Opus 5.5 设为 Codex 和 Claude Code 默认模型,并把 Datasette Agent 演示切换到 GPT-6 Luna。Anthropic 方面称 Sonnet 5.5 与 Haiku 5.5 即将推出。
你可以:同一天两家头部厂商发布新模型并同步下调主力档价格,缓存读取降幅尤其影响长对话与 agent 类产品的成本结构;对自建产品、选型和成本预算的人是直接可用的信号。作者还记录了 Opus 5.5 在 max 推理档耗尽 12.8 万输出上限、两次失败各花约 $2.56 的具体案例,提示高推理档并非总更优。
Simon Willison看原文 ↗