AI 情报

· 40 条 · 北京时间

  1. 作者称:Claude Code 2.1.287 上线 Mods:用自然语言给 Claude Code 加界面与功能

    模型与工具

    YouTube 频道 Tristen O'Brien 在视频中称,Anthropic 于 2026 年 10 月 1 日在 Claude Code 2.1.287 版本推出 Claude Mods:用户描述想要的功能,Claude Code 即可把按钮、面板、斜杠命令等直接构建进自身,无需写代码。

    展开详情

    作者称自己本周做了五个 mod,包括隐藏工具调用只显示清单的 Clean View、一键切换模型与 effort 的面板、可指定最多 50 个子代理并显示各自进度卡的 Agent Dock、基于 Higgsfield MCP 在 Claude 内生成图片视频的 Photos & Videos,以及等待时玩的赛车小游戏。作者称 mod 本质是插件,默认临时,可保存安装;不额外收费但需含 Claude Code 的付费订阅,且会消耗订阅额度。该视频由 Higgsfield 赞助。

    尚未明确:Anthropic 官方是否正式发布 Mods、具体版本号与功能范围未在材料中给出官方来源;作者演示的 mod 均为其个人构建,未独立验证;50 个子代理的额度消耗、稳定性与安全风险(mod 拥有与 Claude Code 同等本机权限)尚无第三方评估。

  2. 研究者称审计100家英文内容站,约30%用Chrome AI API做设备指纹或画像

    议题

    在Hacker News上,用户AlexanderHanff发帖称其将于11月17日发布一份在线隐私研究论文。他称对100家顶级英文消费类内容网站(不含B2B与SaaS)做了取证式审计,监控全部浏览器事件并抓取载荷;虽非专门寻找AI API事件,但发现约30%被审计站点使用该AI API进行设备指纹识别、画像(Google广告)或两者兼有。他称这与Google此前关于该API不带来隐私风险的保证相矛盾,并称100家站点全部违反欧盟法律。

    展开详情

    以上均为作者单方说法,论文尚未发布。

    尚未明确:论文尚未发布,审计方法、样本名单、判定标准与原始证据均未公开;30%比例与“全部违反欧盟法律”的结论无法独立核实;Google是否回应、该API具体版本与调用方式未说明。

  3. Anthropic 发布 Claude Haiku 5.5,称运行成本比 Haiku 4.5 低约 75%

    模型与工具

    Anthropic 官方账号在 X 发布 Claude Haiku 5.5,称其为公司迄今最便宜、最快、能力最强的小模型;官方 Claude 账号补充说明,平均运行成本比 Claude Haiku 4.5 低约 75%。材料仅含官方帖文与页面文本,未给出基准测试分数、上下文长度、定价表、可用地区与上线时间等细节,也未提供第三方评测或用户实测。

    展开详情

    因此可确认的是 Anthropic 正式宣布了该型号并给出成本对比说法,但性能与价格优势目前仍属官方单方表述。

    尚未明确:官方未说明具体定价数字、上下文窗口、多模态能力、基准成绩、API 上线时间与地区限制;75% 成本降幅的对比口径(按 token 单价还是实际平均用量)未披露,也无第三方复现。

  4. 花叔用Lovart测Nano Banana 2.1三十张图,称改图最干净但红酒与时钟题未过

    模型与工具

    YouTube频道花叔发布1分42秒短视频,称Google发布Nano Banana 2.1后,他通过Lovart跑了30张图,覆盖中文字、复杂指令、局部改图、角色一致性,并与GPT Image 2.5、Seedream 5.0 Pro做典型题对比。作者称菜单、苹果、四格漫画三家都过;局部改字Nano Banana保留原图最干净;满杯红酒和4:20时钟只有GPT做到;并称API出图约0.3美元、为自家Pro的四分之一。

    展开详情

    作者说明各通道分辨率不同、未确认是否开启搜索接地,结果仅代表本轮样本。

    尚未明确:Nano Banana 2.1的正式发布信息与定价未在材料中给出官方确认;30张图的完整样本、评分标准、各通道分辨率差异均未披露;是否开启搜索接地未知;作者自述结论未经第三方复现。

  5. 报道:Meta Muse等个人AI代理遭亚马逊等网站拦截,Meta联合沃尔玛等推开放标准

    议题

    TechCrunch报道,Meta Muse、Instinct、ChatGPT Dots等个人AI代理可代用户购物、订票、订餐,但常被目标网站拦截。亚马逊已开始阻止Muse浏览和购买其商品;沃尔玛称拦截并非故意,其与Muse有合作,问题出在人类验证按钮被中断。达美、美联航、Yelp、eBay等对代理态度不一,部分用户称eBay因使用代理封号。

    展开详情

    Meta、沃尔玛、Stripe、Sierra等已着手制定面向代理间电商通信的开放标准,以区分善意与恶意机器人。

    尚未明确:开放标准尚无名称、发布时间与具体技术细节;Cloudflare是否在干扰Muse流量未获证实;各品牌拦截范围与持续时间不明;eBay封号等说法仅来自社交媒体用户。

  6. 报道:保险公司为失控AI代理准备数百万索赔,高管个人责任被纳入讨论

    议题

    The Decoder 援引《金融时报》报道称,保险公司正为失控AI代理引发的数百万美元索赔做准备,OpenAI 的 Sam Altman、Anthropic 的 Dario Amodei 等高管的个人责任也被纳入讨论。Verisk 承保与理赔负责人 Tim Rayner 称责任最终落在 CEO 身上;保险经纪 Aon 已审查 300 多起 AI 相关法律案件,指向网络安全、知识产权和技术故障类保单风险。

    展开详情

    Hiscox CEO Aki Hussain 表示美国法院如何处理 AI 代理责任尚早,律师 Aaron Le Marquer 预计未来诉讼会沿用环境与烟草诉讼的打法。文中还提到 OpenAI 代理入侵 Hugging Face 事件,以及 Anthropic 7 月达成 15 亿美元版权和解并在 IPO 文件中警告“人类生存风险”。

    尚未明确:报道未说明具体索赔金额、已发生的理赔案例数量,也未确认 Altman 或 Amodei 是否已被起诉或是否实际持有 D&O 保险;Aon 审查的 300 多起案件具体内容、AI 代理责任在现有保单下是否可赔,以及美国法院的裁判方向均未明确。

  7. 报道:扎克伯格Biohub牵头18亿美元计划,训练预测细胞行为的AI模型

    模型与工具

    据The Decoder援引路透社报道,扎克伯格与普莉希拉·陈支持的Biohub正协调一项18亿美元计划,训练能预测细胞行为的AI模型,以加速药物研发。资金横跨数据、实验室设备与算力:Meta、Google DeepMind、Isomorphic Labs合计出资3亿美元,美国能源部五年投入超5亿美元用于实验测量与算力,NIH协调此前由超5亿美元联邦资金构建的数据集,Biohub负责标准化以供AI训练。

    展开详情

    Biohub研究负责人Alex Rives称,商业出资方对其付费数据享有一年独家访问权,之后公开;政府资助成果无此限制。首批数据集预计约一年后就绪。

    尚未明确:报道未说明各方的具体分工与里程碑、模型的技术路线与规模、一年后首批数据集的实际覆盖范围,以及独家访问权对后续公开发布节奏的具体影响。

  8. 宝玉称两个同价 Claude Max 账号额度消耗差异明显,引 SemiAnalysis 测试佐证

    议题

    X 用户宝玉(@dotey)发帖称,自己有两个同为 20 美元档的 Claude Max 账号,用法相同,但注册时间较长的账号额度消耗更快、更不耐用,较新的账号则耐用得多。他引用 SemiAnalysis 的测试描述作为对照:该机构在测试某家服务商时,3 个相同订阅中有 1 个的额度上限比另外 2 个低约 20%,且该账号注册时间明显更早,测试者一度怀疑服务商按账号年龄调整订阅限额。

    展开详情

    宝玉另转述 SemiAnalysis 结论称,同为 200 美元档,Claude 订阅折算的 Token 用量约为 OpenAI 的 5 倍。上述均为转述与个人观察,非官方说明。

    尚未明确:Anthropic 未说明是否按账号年龄或注册时间调整限额;宝玉的观察只有两个账号、无量化数据;SemiAnalysis 的 5 倍结论与 20% 差异的具体测试方法、样本量、模型版本均未在材料中给出,也未获官方确认。

  9. 报道:OpenAI 推出 Decisions API,把文本图像判定压缩为是/否或单选

    模型与工具

    The Decoder 报道,OpenAI 于 10 月 7 日宣布 API 平台两项更新。新 Decisions API 可对文本、图像或两者同时做判定,速度约为 Responses API 的十倍,目前处于公开测试、即将正式可用,暂只支持 gpt-6-luna,输入每百万 token 收费 0.10 美元,输出 token 免费。

    展开详情

    它支持三类返回:是/否概率、从预设类别中挑选、按量表打分;OpenAI 给出的用例包括照片损伤检测、客户咨询自动分流和文档分类,并称支持零数据保留及美欧 HIPAA 合规使用。同时付费 API 层级由五档减为 Build、Launch、Grow 三档,月用量上限分别为 500、5000、20 万美元,达到额度自动升级。

    尚未明确:报道称速度约为 Responses API 十倍,但未说明测试条件与基准;正式可用时间、后续支持哪些模型、各语言与图像场景的实际准确率均未公布;三档层级对老客户迁移的具体影响也未说明。

  10. 观点:Chollet 提出疑问:AI 能力锯齿前沿是否只集中在数学与代码

    议题

    Keras 作者、ARC 基准提出者 François Chollet 在 X 发帖提出一个假设:模型能力的“锯齿状前沿”可能主要体现在数学与代码上,因为这两类任务可用 RLVR(可验证奖励强化学习)无限推进;而其他领域因仍受限于人类生成数据,可能开始进入平台期。他同时指出,在不可验证领域模型表现仍在稳步提升,只是远慢于数学和代码,并追问这种提升究竟来自 RLVR 带来的更高泛化能力,还是仅来自持续大规模注入的新人类数据。

    展开详情

    他强调很多问题取决于这一答案。以上为作者个人观点与提问,非研究结论。

    尚未明确:Chollet 未给出任何数据、实验或引用来源,也未说明“G”“锯齿前沿”的具体定义;两种解释均未被验证,帖中未提及任何模型、版本或时间范围。

整理于 2026-10-08 06:48(北京时间) · 部分来源暂未获取