AI 情报
· 35 条 · 北京时间
Anthropic 官方页面显示,Claude Sonnet 5.5 于 2026 年 9 月 28 日发布,是 Claude 5.5 家族第二个模型。官方称其比 Sonnet 5 快 30% 以上、多数工作成本最多低 30%,定价与 Sonnet 5 相同(输入每百万 token 2 美元、输出 10 美元),但完成同样任务所需 token 更少。
展开详情
Terminal-Bench 4.0 得分从 Sonnet 5 的 10.3% 升至 70.6%,GDPval-AA 比 Opus 5.5 低两分。官方称这是首个带网络安全防护与回退机制的 Sonnet 模型。Wes Roth 视频还提到 Anthropic IPO 招股书报道与 OpenAI 暂缓 GPT-6.1 Astra,属其转述。
尚未明确:官方基准为厂商自测,未独立复现;视频中 IPO 净亏损口径、GPT-6.1 Astra 暂缓原因均来自转述报道,未在材料中看到原始文件;Haiku 5.5 仅称未来数周推出,无具体日期。
YouTube 频道 IndyDevDan 发布 35 分钟视频,演示 TypeSafe 的 Jev(一种通过 JSON 编程的问答模型)在编码智能体中的 10 个递进用法:从提示注入是/否判断、多选工单分类、复合评分、置信度门控 bash 命令,到模型/智能体路由、智能体护栏钩子、自动压缩上下文、不读文件直接提问、多文件并行提问,最后让智能体自行决定向 Jev 提什么问题。
展开详情
作者称 Jev 调用成本远低于大模型,并提供了配套 GitHub 代码库。作者明确表示未接受赞助,Jev 是 LLM 的补充而非替代。
尚未明确:视频中的成本倍数、置信度数值和效果对比均为作者自述,未经独立验证;Jev 的定价、可用性和稳定性未在材料中说明;作者称部分用法仍在探索中。
YouTube 频道「回到Axton」发布一期对比视频,称 OpenAI 在 DevDay 发布 GPT-6.1 Sol 后,他用同一套四道题(超写实飞行模拟器、户型图转装修设计工具、相机对焦实验室、开放题)让 GPT-6.1 Sol 与 Claude Opus 5.5 在命令行 agent 环境、high 档算力、限时 60 分钟、不追加提示的条件下各自完成。
展开详情
作者称 GPT 首屏观感更强,但收油后飞机仍以 27 节、31 度仰角悬空,拆除非承重墙后面积表不变;Opus 则机头下坠、面积表即时重算。作者给出总耗时约 82 分钟对 137 分钟,并建议展示型原型看 GPT、真实业务逻辑看 Opus。以上均为作者自述,非独立实测。
尚未明确:GPT-6.1 Sol 是否真为 OpenAI DevDay 正式发布、其官方名称与可用范围未在材料中给出;测试仅一次、单机环境,未说明模型具体版本号、算力档位定义与评分标准;82 分钟与 137 分钟为作者自报,未提供原始日志。
Greg Isenberg 在播客中称,麦肯锡预计到2035年约百万家小企业因业主退休而转手,规模约5万亿美元;Thrive Holdings 24个月买入近50家会计所,其中 Bellingham 的 Larson Gross 用基于 OpenAI Codex 的 AI 在本税季处理7000份申报,会计平均省31%时间;General Catalyst 为此设15亿美元,旗下 Long Lake 称不到两年收购18家物业管理公司、EBITDA 达1亿美元。
展开详情
他同时说明这些数字多为融资中年轻公司自报、尚未经历衰退,只算方向信号而非证明,并给出单人控股公司的文件夹、代理流水线与人工审批规则。
尚未明确:Thrive 与 OpenAI 的关系、Larson Gross 的7000份申报与31%省时、Long Lake 的18家收购与1亿美元 EBITDA、Cresendo 称 AI 处理约90%一线工单,均为节目转述或公司自报,未见独立核实;单人控股公司部分为作者设想,非已实现案例。
宾夕法尼亚大学沃顿商学院教授Ethan Mollick在X发帖称,各公司的客服人员即将被Dots、Muses等AI代理淹没,这些代理会用语音或聊天替用户谈更优惠的条件。他表示,人们把这类议价工作交给代理并因此省钱的案例正在出现,而且只会越来越病毒式传播。需要区分的是:这是Mollick对趋势的判断与转述,他并未在帖中给出具体案例、金额或可核验来源,也未说明Dots、Muses的具体产品形态与能力边界。
补充信息
尚未明确:Dots、Muses具体是什么产品、由谁开发、是否已公开发布均未说明;所谓省钱案例的数量、金额、行业与真实性都无来源;企业客服是否真的被压垮、平台是否会封堵代理,都还是预测而非已发生事实。
Box CEO Aaron Levie 在 X 发帖称,把 AI 部署进经济体系存在巨大机会,企业更换工作流的实际工作量远超多数人预期。他列举所需环节:旧系统上云、数据组织与访问更新、软件以新方式接入智能体、为智能体重做工作流、设计人在环流程、生成并维护评测,并随新模型持续更新。他认为 AI 部署不同于传统软件实施,交付的是流程中的工作产出而非仅工具,因此会催生按行业、公司规模、内部问题划分的新服务公司与传统 SI 转型。
补充信息
尚未明确:Levie 未给出任何客户案例、市场规模或收入数据,也未说明哪些环节最难或最赚钱;其判断属个人观点,尚无第三方验证;帖中引用的“army of people”来自他人转述视频,视频内容未被读取。
OpenAI 在官网发布文章《Disrupting a coordinated model-distillation campaign》,称其阻断了一场旨在提取受保护模型推理内容的协同行动,并表示正在加强对“对抗性蒸馏”的防御。官方摘要仅说明事件性质与应对方向,未披露涉及方、时间线、具体技术手段或受影响模型范围。该文属于 OpenAI 官方对自身安全事件的说明,不是第三方独立调查,也未提供可核验的细节。
补充信息
尚未明确:材料未说明攻击方身份、发生时间、涉及哪些模型、蒸馏规模、是否造成实际损失,也未说明“加强防御”的具体措施与生效范围。
YouTube 频道 Jason Lee 发布 18 分钟演示:他用 Claude Code 的 /design 技能,附上某发票 App 的 App Store 页、落地页和 Refero 上 Wise 设计系统链接,一次提示生成名为 Quicksand 的 iOS 发票应用原型,共 22 个界面,按钮可点击;随后换新会话生成配套落地页,并安装 GitHub 上的 Brag 技能(latent-spaces/brag)生成 20 秒产品发布动效视频。
展开详情
作者称 Opus 5.5 比 Fable 5.1 更快、更少触发用量上限,并称其成本比 Opus 5 低 40%(转述 Anthropic 说法)。视频含 Omnisend 赞助段落。
尚未明确:未独立实测,未审看画面;应用后端未接入,作者明确跳过;视频中「某发票 App 月入 200 万美元」「Opus 5.5 成本低 40%」「比 Fable 5.1 更强」均为作者转述或主观感受,无官方来源;生成视频存在元素遮挡文字等瑕疵;模型名称与版本未在材料中由官方确认。
The Decoder 援引《纽约时报》报道称,Meta 将 AI 数据中心归类为“pilot models”、把 Nvidia 芯片列为实验材料,以申请一项 1981 年设立的联邦研究税收抵免。报道给出的数字是:2025 年节省 39 亿美元,2024 年为 20 亿美元,2023 年为 7 亿美元,使其成为该抵免额度最大的上市公司受益者。
展开详情
报道同时指出,Meta 在 SEC 文件中提示这些节省可能被挑战,不确定税务头寸准备金升至 187.4 亿美元;审计方 EY 认可该做法,并正向其他公司推销类似方案。
尚未明确:报道未说明 IRS 是否已启动审查或追缴,也未给出 Meta 若被否定后需补缴的具体金额;EY 向其他公司推销该方案的范围与进展同样没有细节。
播客中 Greg Isenberg 与 Varick 的 Vas 讨论“前置部署工程师”(FDE)如何把 AI 落地到真实企业:先做流程再造,再在客户已有的系统(如 Salesforce、NetSuite、Slack)内建 agent。Vas 称其方法包括访谈、流程挖掘、把每个步骤分入删除、普通代码、agent、人工决策四类。他提到一个 50 亿美元上市软件公司案例,以及应付账款改造把每张发票成本从 31 美元降到 6 美元。
展开详情
节目还给出五天起步计划与 FDE 所需技能。以上均为节目中的作者说法,未提供独立验证。
尚未明确:31 美元到 6 美元的成本口径、案例公司身份与统计方法未说明;五天计划的实际效果、FDE 收入水平均无独立数据;节目由 Google 赞助,音频模型链接为赞助内容。
整理于 2026-10-02 06:48(北京时间) · 部分来源暂未获取