AI 情报

· 37 条 · 北京时间

  1. 观点:Box CEO Levie:企业正把内部FDE嵌入各部门,催生自动化工程师新岗位

    议题

    Box CEO Aaron Levie 在 X 上称,他接触的多数企业正把内部 FDE(前置部署工程师)嵌入各业务部门,把 AI 能力接入底层工作流。他认为这需要同时具备技术能力、AI 理解和流程理解,没有捷径;并引用他人文章观点称“自动化工程师”是这一代技术催生的新岗位,因为相关工具两年前还不存在,没人有十年经验。他建议有软件能力又投入 AI 的人深耕这一方向。

    展开详情

    以上为企业高管基于自身观察的判断与观点,非正式研究结论。

    尚未明确:Levie 未给出企业数量、行业分布或岗位规模数据;“多数企业”是其个人接触样本的说法。所引“自动化工程师”表述来自他人文章,原文未在材料中完整呈现。该岗位的薪酬、招聘量与实际职责边界均未说明。

  2. 时代周刊称特朗普曾就抓捕马杜罗征询Grok意见,TechCrunch转述

    议题

    TechCrunch转述《时代》报道:2025年12月,即美国入侵委内瑞拉并抓捕总统马杜罗约一个月前,特朗普与马斯克有一次秘密会面,期间特朗普花数小时与Grok对话,并询问委内瑞拉人对其总统被抓会有何反应。一名消息人士称,Grok回答马杜罗是极不受欢迎的独裁者、许多委内瑞拉人可能庆祝其下台;2026年1月3日入侵后确出现庆祝,特朗普因此认为Grok很聪明。文中还提到五角大楼AI负责人称军方在对伊朗战争中使用Grok部署和打击目标。

    展开详情

    以上均为转述与匿名消息,非独立证实。

    尚未明确:《时代》未公开消息人士身份,特朗普与Grok的具体对话内容、时长及是否直接影响决策均无独立证据;五角大楼使用Grok的范围与授权细节也未说明。

  3. 销售研究Agent误报公司招聘,作者称根因是工具返回空页面被当内容

    实践

    一位开发者在r/AI_Agents发帖称,其为销售团队搭建的公司调研Agent约一个月内持续产生错误笔记,包括过时定价、已停产产品,以及把7月裁员50%的公司描述为“在大举招聘”。作者称先后更换模型两次、反复修改系统提示词、加入验证步骤与反思循环,笔记变得更长更自信但依然错误,自检成本一度高于人工调研。最终通过记录工具原始返回发现,模型把cookie横幅、旧缓存页面和空的React路由当作真实内容推理,遇到空字符串时编造合理答案。

    展开详情

    作者改为在信息送入模型前对工具结果做健全性检查,约三小时完成。

    尚未明确:仅为作者单方叙述,无代码、日志或数据佐证;未说明所用模型、contextdev具体产品与成本数字;健全性检查的边界条件作者自认仍有遗漏。

  4. 作者称:Karpathy 转发经纬度陆地/水域评测:Claude 系列被逐点问出世界地图

    议题

    Andrej Karpathy 在 X 转发并评论一个评测:把经纬度坐标以文本形式给 LLM,只问“Land or Water?”,重复 16,200 次后把回答画成图像。他称模型答得出来,并归因于“压缩互联网”带来的世界地理知识;原帖作者 Celeste 称展示的是所有 Claude 模型的结果。该帖为作者演示与 Karpathy 的转述,未见完整方法、坐标网格、准确率统计或与其他模型的对照,也未提供可复现脚本。

    补充信息

    尚未明确:16,200 次对应的具体坐标网格与采样方式、各 Claude 版本名称、准确率与错误分布、是否与真实海陆数据比对、其他模型结果,材料均未说明;Karpathy 的“models know”属个人转述,非独立验证。

  5. 作者称:Nate Herk 用七个工作流对比 Claude Sonnet 5.5 与 Opus 5.5 的成本与产出

    实践

    YouTube 频道 Nate Herk | AI Automation 发布 25 分钟视频,作者称把 Claude Sonnet 5.5 与 Opus 5.5 跑过七个真实工作流:落地页、动效展示、90 天行动计划、Excel 与投资人演示、HTML 讲解页、X 新闻看板、YouTube 资源指南。

    展开详情

    作者给出的定价为 Sonnet 5.5 每百万输入 2 美元、输出 10 美元,Opus 5.5 为输入 4 美元、输出 20 美元,并称 Sonnet 快约 30%、便宜约 30%。七轮中作者判 Sonnet 胜四轮、Opus 胜三轮,称 Opus 全程多花约 46 分钟、多约 1600 万美元等值输入 token 成本约 16 美元。以上均为作者自述测试,非独立复现。

    尚未明确:作者未公开完整提示词、skill 定义与原始账单,成本数字来自其自述;模型名称、定价与发布时间未与 Anthropic 官方文档核对;胜负判定为主观评价,未做盲测;视频画面未审看,无法确认演示细节。

  6. 作者称:Ethan Mollick 撰文:AI 自组织完成任务是他最低估的进展

    议题

    宾夕法尼亚大学沃顿商学院教授 Ethan Mollick 在 X 发帖称,他撰写了新文章《The Dot and the Swarm》,主题是他在 AI 进展中最低估的一点:AI 自组织以完成任务的能力。他表示文章还讨论了这对 Muse、Dots 等 agent 意味着什么,并附一支音乐视频解释为何人们不断重新学习 The Bitter Lesson。

    展开详情

    帖子发布于 2026 年 10 月 1 日,附有其 Substack 通讯 oneusefulthing.org 的文章链接,页面显示约 2.75 万次浏览。以上均为作者自述,尚未见第三方对其论点的独立验证。

    尚未明确:文章正文未在材料中呈现,自组织的具体机制、所举案例、Muse 与 Dots 指代的具体产品,以及该判断的证据基础均未知;The Bitter Lesson 与音乐视频的具体内容也未说明。

  7. Cole Medin 演示 Jev 决策模型在 AI 编程中的四个用法

    实践

    Cole Medin 在视频中介绍用 Jev(一类做决策而非生成文本的 system one 模型)改造 AI 编程流程的四个用法:以 pre-tool use hook 拦截读取密钥、删目录等危险操作;让 Jev 实时玩自己开发的游戏做验证;驱动浏览器测试真实应用;在 Archon 工作流里对 GitHub issue 和 PR 分类,决定任务类型与所用模型档位。

    展开详情

    他称 Jev 比 LLM 决策快 20 至 200 倍、便宜 40 至 1000 倍,并给出自测数据:安全 hook 每次分析约四分之一秒,12 次 issue 分类全部与自己的判断一致,PR 分类 16 次中 15 次一致。这些均为作者自述与自测,未独立验证。

    尚未明确:Jev 的官方来源、发布方与定价未在材料中说明;速度与成本倍数、准确率对比均为作者自述,无第三方复现;安全 hook 仅使用很短时间,长期误报率未知;游戏与浏览器测试的具体实现细节未展开。

  8. 作者称:Jono Catliff 发布免费 Claude Code 本地 SEO 代理,含 GBP 优化与评论自动化

    实践

    YouTube 频道 Jono Catliff 发布 34 分钟教程,称把此前 11 万播放的本地 SEO 大师课打包成一套免费 Claude Code 代理蓝图,托管在 GitHub,需在 VS Code 中安装 Claude Code 并连接 Semrush。

    展开详情

    作者演示的流程包括:用 /gbp 命令生成 Google Business Profile 优化清单(主类别参考前三名竞争对手、服务按 Semrush 搜索量排序)、用 /review-generator 搭建评论筛选表单(好评跳转 Google、差评经 Make.com 推送到 Slack)、批量生成 GBP 帖子、用 /keyword-research 找本地关键词、生成服务页与本地博客、经 GitHub 与 Vercel 发布,并用 Blotato 转成 LinkedIn 与 X 帖子。作者称其上一家公司月获 5 万次 Google 点击、本地 SEO 一到三个月见效,这些均为其个人说法。

    尚未明确:未独立实测该代理的实际排名效果;作者所称 5 万次月点击、50 万美元收入和一到三个月见效均无第三方验证;视频为 Semrush 合作内容且含多处联盟链接,存在利益关联;蓝图仓库与 Make.com 场景的实际可用性、Google 是否容忍自动回复评论与批量生成页面均未说明。

  9. AlphaGo核心成员Thore Graepel离开DeepMind,称LLM不会真正推理

    议题

    MIT Technology Review 10月2日刊出Thore Graepel署名观点文章。他自述是DeepMind AlphaGo团队核心成员,近期已离开Google DeepMind。文章回顾2016年AlphaGo对李世石第二局第37手:策略网络认为该手只有约万分之一的人类棋手会下,是搜索机制权衡后续变化后选中它。

    展开详情

    他据此提出,当前大模型靠逐token预测和思维链,缺少显式、可检查、可修订的认知状态,知识与推理混在权重里,思维链还常是事后编造,因此不算真正推理;主张借鉴AlphaGo的博弈树结构,让系统维护信念状态并由独立部分按证据评估每一步。

    尚未明确:文章为署名观点,未给出新系统原型、实验数据或可复现评测;所提'认知状态+独立评估'架构能否在开放世界落地、成本与效果如何均未说明;离开DeepMind后的具体去向与计划未披露。

  10. 宝玉:用参考图替代风格提示词,在 Manus 中生成水墨风演示页

    实践

    宝玉在 X 上称,他在测试 Manus 时总结出一个画图提示词技巧:不靠文字描述控制样式风格,而是直接提供一张参考图,图中包含颜色、字体示范、宣纸纤维、墨迹边缘、水痕、远山、印章与留白规则等,这样出图稳定性更高,内容提示词可以写得很简单。他给出两张示例页的 content_prompt,主题为“茶与慢生活”“把日常慢下来”,要求遵循参考图的水墨极简、侘寂、宣纸纹理与留白风格,并附上完整英文演示页提示词。

    展开详情

    以上均为作者自述的测试经验,非官方功能说明。

    尚未明确:作者未说明测试的具体 Manus 版本、生成次数与对比条件,也未给出成功率或失败案例;参考图是否对文字排版、中文字形同样稳定,材料中未验证;该技巧是否适用于 Manus 之外的模型未知。

整理于 2026-10-03 06:48(北京时间) · 部分来源暂未获取