AI 情报

· 37 条 · 北京时间

  1. Anthropic 发布 Claude Sonnet 5.5,官方称比 Sonnet 5 快 30% 且每任务成本最多低 30%

    模型与工具

    Anthropic 官网发布 Claude 5.5 家族第二款模型 Claude Sonnet 5.5,官方称其为 Sonnet 5 的明确升级:输出速度快 30% 以上,多数工作成本最多降低 30%,定价与 Sonnet 5 相同(输入每百万 token 2 美元、输出 10 美元)。

    展开详情

    官方基准显示 Terminal-Bench 4.0 从 Sonnet 5 的 10.3% 升至 70.6%,GDPval-AA 比 Opus 5.5 低两分。官方称其擅长范围明确的日常任务、修 bug 和制作文档、幻灯片、表格,并首次为 Sonnet 配备网络安全防护。以上均为 Anthropic 官方说法,未独立实测。

    尚未明确:官方未公开第三方独立复现的基准结果;视频中称 Sonnet 5.5 完成任务所需 token 更多、单位任务成本可能高于 Opus 的说法与官方“每任务最多便宜 30%”不一致,尚无独立数据裁决;Haiku 5.5 仅称未来数周加入。

  2. 谷歌发布 Nano Banana 2.1 图像模型,官方称视觉设计与主体一致性提升

    模型与工具

    X 用户歸藏转述谷歌发布 Nano Banana 2.1 图像模型,称其中文文字清晰度和错字问题大幅改善、中文字体设计与排版美学较好,并认为相比 GPT 没有破碎感、画面干净,主要优势是可生成 4K 图片,但价格偏贵。所附 Google AI Studio 原文称这是最新图像生成模型,在视觉设计、基于蒙版的编辑、主体一致性和更自然画面方面全面优于此前模型,可在 ai.studio 试用。

    展开详情

    上述中文表现与价格评价属作者个人说法,官方原文未提及中文能力与定价。

    尚未明确:官方原文未说明中文文字与排版的具体改善程度、4K 是否为原生输出、定价与额度、蒙版编辑的具体操作方式,也未给出与 GPT 图像模型的对比数据;作者的中文效果与价格评价缺少可复核的测试细节。

  3. Anthropic 扩展 Cyber Verification Program,分三级向安全团队开放 Claude 高级模型

    模型与工具

    Anthropic 于 10 月 6 日宣布扩展 Cyber Verification Program(CVP),将原 Project Glasswing 与 CVP 合并为三级访问体系:Defense Access 面向防御性安全工作,Red Team Access 增加授权渗透测试与红队,Specialized Access 面向可影响人身安全或市场的基础设施系统、需与美国政府联合审查。

    展开详情

    三级均可访问 Claude Opus 5.5、Sonnet 5.5、Mythos 5.1 及后续新模型,并降低网络安全拦截分类器。Anthropic 称在 CyScenarioBench 上,Defense 层 50 次试验中 46 次被拦截,Red Team 层无拦截且完成 34 次。

    尚未明确:Anthropic 未公布各层申请通过率、审核时长实际数据、定价差异;CyScenarioBench 为其自建评测,无第三方复现;129,000 个漏洞等数字来自部分合作伙伴问卷,官方称可能低估,真实规模待验证。

  4. 微软演示 Copilot Studio 用提示词生成代理、工作流与全栈应用

    模型与工具

    微软 Mechanics 频道由 Copilot Studio 高级产品经理 Jack Rowbotham 演示:在同一平台用自然语言描述需求,自动生成代理的名称、指令与可复用技能,可选模型(演示中保留 Claude Sonnet),接入 Work IQ 邮件与 Dataverse MCP,并挂载 RFP 示例 PDF 与供应商风险专家代理。

    展开详情

    工作流以 Outlook 新邮件触发,经分类、取附件、代理评估、人工复核分支,再由研究代理与推荐代理汇总写入 Dataverse;作者称 18 个测试用例 89% 满足评估标准,18 项测试实际运行约 22 分钟。最后用提示词生成 Bid Management App 供团队筛选与审批。

    尚未明确:演示为厂商官方视频,未独立实测;89% 通过率来自作者自备的 18 个测试用例,未说明评估标准细节与失败案例;未说明定价、区域可用性、Work IQ 与 Dataverse MCP 的正式发布状态,以及生成应用在生产环境的稳定性。

  5. Anthropic 的 Thariq 称 Claude 将走向云端大脑加本地操作电脑的"local hands"模式

    模型与工具

    Anthropic 员工 Thariq(@trq212)在 X 上表示,Claude 的发展方向是"大脑在云端、本地双手",即模型在云端运行,但能访问并操作用户本地电脑上的文件。他称这一模式正在 Claude Code 中实现,并提到"local hands"这个说法也将进入 cowork。他此前在 Latent Space 播客中谈过该话题,并指向 latent.space/p/thariq 的进一步说明。

    展开详情

    以上均为其个人表述,非 Anthropic 官方发布。

    尚未明确:"local hands"具体实现方式、覆盖范围、发布时间与是否面向所有用户均未说明;"cowork"具体指什么产品也未在材料中解释;latent.space 文章与播客内容未读取,无法核实细节。

  6. 观点:Mollick 借 1990 年代复印机维修工民族志,谈 AI 替代工作的复杂性

    议题

    宾大教授 Ethan Mollick 在 X 发帖称,人们讨论 AI 轻易替代劳动者时,他会想到 1990 年代关于复印机维修技术员的民族志研究:这类工作实际复杂、靠工人临场即兴处理、大量非正式且记录不全,因此不像表面那样容易被替代。他同时补充,技术最终大体上确实消灭了这个岗位。该帖为作者个人观点与类比,未给出具体研究出处,也未提供 AI 替代岗位的新数据。

    补充信息

    尚未明确:Mollick 未指明所引民族志的具体作者、书名或年份,也未说明该研究结论在多大程度上可外推到 AI 场景;帖中“技术最终大体消灭该岗位”是概括性说法,缺少数据与时间线支撑。

  7. 报道:Cohere 发布 North 2,把企业平台做成可跨模型接入的 AI 智能体控制台

    模型与工具

    The Decoder 报道,Cohere 将企业平台升级为 North 2,定位为 AI 智能体控制中心:智能体可自行处理多步工作流,并跨会话保留上下文。新版编排系统协调智能体调用共享知识库与可复用技能,并连接 Slack、SharePoint、Jira 等工具;还能在聊天中由文本提示直接生成演示文稿、仪表盘和简单应用。North 2 不绑定自家模型,除 Command A+ 外可接入企业自有模型;支持本地、云端或完全气隙部署。

    展开详情

    管理员通过 North Admin 管理 token 用量、用户配额及细到单个智能体的权限,关键操作需人工批准。Cohere 称在 Nvidia Blackwell 与 Hopper 硬件上其模型所需 token 更少,并称 LG CNS 与 Bell Cyber 已在生产环境运行 North。

    尚未明确:Cohere 关于 token 更省的说法未给出具体基准与对比数据;LG CNS 与 Bell Cyber 的生产使用规模、效果与是否覆盖 North 2 均未说明;North 2 的定价、可用区域、与 North 旧版的差异,以及演示视频内容均未核实。

  8. 作者称:宝玉分享用 Opus 5.5 生成篆书印章提示词的迭代方法

    实践

    X 用户宝玉在帖文中回答提问,称自己的提示词并非直接由 AI 生成,而是先与 AI 反复对话调整,再让 AI 输出一版提示词或 skill 供复用,随后用该提示词实测,有问题就让 AI 改、没问题才直接用。他给出的让 AI 写提示词的做法是直接要求:如果其他人也想生成类似印章,提示词该怎么写,中文、简洁、1-3 段。

    展开详情

    帖文还附上他用 Opus 5.5 设计印章的提示词,要求用 JS + Canvas 逐笔坐标绘制小篆字形、做白文与朱文两版、朱砂色印泥与宣纸纹理、导出 1200×1200 透明底 PNG,并先截图自检字形可辨与笔画间距。以上均为作者自述,未见第三方验证。

    尚未明确:帖文未说明所用 Opus 5.5 的具体版本与访问渠道,也未展示印章成品图或截图自检的实际结果;「反复对话调整」的轮次与失败案例未披露,提示词在其他模型上的可迁移性未知。

  9. 作者称:Mark Kashef 发布两个 Claude Code 模组:让 Claude 调用 Codex 控制 Mac 应用并并行多会话

    实践

    YouTube 频道 Mark Kashef 发布教程,称自己构建了两个 Claude Code 模组。其一通过 MCP 桥接让 Claude 调用 Codex 的 computer-use 工具在后台点击、输入 Mac 应用,作者演示了操作计算器并写笔记;其二名为 Threads,让一个主会话启动多个独立 Claude Code 会话、分配不同模型、跟踪进度并汇总结果。

    展开详情

    作者称资源包含源码、构建提示词与安装说明,并强调经过约一小时多次调试才跑通,并非一次成功。以上均为作者自述,未独立实测。

    尚未明确:视频为作者自述演示,未独立验证;模组在他人环境、其他 macOS 版本或 Claude/Codex 更新后的稳定性未知;作者提到的模型名称(如 Opus 5.5、GPT6 Astra)未在材料中确认是否为正式版本。

  10. 报道:盖洛普调查:常用AI的美国员工更可能已拥有优质工作

    议题

    盖洛普10月5日发布美国就业质量研究(AJQS)第二年首批结果:2026年1月26日至3月24日调查15,482名受雇美国员工,其中7,845名在过去一年至少用过几次AI。使用者自述AI主要带来速度(63%)和创意(56%)提升,47%称能腾出时间做更有趣的工作,46%称工作质量提高;31%称雇主因此要求承担更多职责。每周至少用AI者占28%,54%从未使用。

    展开详情

    每周用AI者中52%拥有优质工作,偶尔使用者46%,从不使用者32%。盖洛普指出,高学历、管理岗等本就易获优质工作的群体AI使用率更高,因果关系尚待研究。

    尚未明确:数据为员工自评,雇主是否同样评价这些效果未知;AI使用与优质工作之间的因果关系未确立;报告全文2026年10月底才发布,行业细分与长期趋势尚未披露。

整理于 2026-10-07 10:03(北京时间) · 部分来源暂未获取