AI 情报
· 37 条 · 北京时间
Box CEO Aaron Levie 在 X 上称,他接触的多数企业正把内部 FDE(前置部署工程师)嵌入各业务部门,把 AI 能力接入底层工作流。他认为这需要同时具备技术能力、AI 理解和流程理解,没有捷径;并引用他人文章观点称“自动化工程师”是这一代技术催生的新岗位,因为相关工具两年前还不存在,没人有十年经验。他建议有软件能力又投入 AI 的人深耕这一方向。
展开详情
以上为企业高管基于自身观察的判断与观点,非正式研究结论。
尚未明确:Levie 未给出企业数量、行业分布或岗位规模数据;“多数企业”是其个人接触样本的说法。所引“自动化工程师”表述来自他人文章,原文未在材料中完整呈现。该岗位的薪酬、招聘量与实际职责边界均未说明。
TechCrunch转述《时代》报道:2025年12月,即美国入侵委内瑞拉并抓捕总统马杜罗约一个月前,特朗普与马斯克有一次秘密会面,期间特朗普花数小时与Grok对话,并询问委内瑞拉人对其总统被抓会有何反应。一名消息人士称,Grok回答马杜罗是极不受欢迎的独裁者、许多委内瑞拉人可能庆祝其下台;2026年1月3日入侵后确出现庆祝,特朗普因此认为Grok很聪明。文中还提到五角大楼AI负责人称军方在对伊朗战争中使用Grok部署和打击目标。
展开详情
以上均为转述与匿名消息,非独立证实。
尚未明确:《时代》未公开消息人士身份,特朗普与Grok的具体对话内容、时长及是否直接影响决策均无独立证据;五角大楼使用Grok的范围与授权细节也未说明。
一位开发者在r/AI_Agents发帖称,其为销售团队搭建的公司调研Agent约一个月内持续产生错误笔记,包括过时定价、已停产产品,以及把7月裁员50%的公司描述为“在大举招聘”。作者称先后更换模型两次、反复修改系统提示词、加入验证步骤与反思循环,笔记变得更长更自信但依然错误,自检成本一度高于人工调研。最终通过记录工具原始返回发现,模型把cookie横幅、旧缓存页面和空的React路由当作真实内容推理,遇到空字符串时编造合理答案。
展开详情
作者改为在信息送入模型前对工具结果做健全性检查,约三小时完成。
尚未明确:仅为作者单方叙述,无代码、日志或数据佐证;未说明所用模型、contextdev具体产品与成本数字;健全性检查的边界条件作者自认仍有遗漏。
Andrej Karpathy 在 X 转发并评论一个评测:把经纬度坐标以文本形式给 LLM,只问“Land or Water?”,重复 16,200 次后把回答画成图像。他称模型答得出来,并归因于“压缩互联网”带来的世界地理知识;原帖作者 Celeste 称展示的是所有 Claude 模型的结果。该帖为作者演示与 Karpathy 的转述,未见完整方法、坐标网格、准确率统计或与其他模型的对照,也未提供可复现脚本。
补充信息
尚未明确:16,200 次对应的具体坐标网格与采样方式、各 Claude 版本名称、准确率与错误分布、是否与真实海陆数据比对、其他模型结果,材料均未说明;Karpathy 的“models know”属个人转述,非独立验证。
YouTube 频道 Nate Herk | AI Automation 发布 25 分钟视频,作者称把 Claude Sonnet 5.5 与 Opus 5.5 跑过七个真实工作流:落地页、动效展示、90 天行动计划、Excel 与投资人演示、HTML 讲解页、X 新闻看板、YouTube 资源指南。
展开详情
作者给出的定价为 Sonnet 5.5 每百万输入 2 美元、输出 10 美元,Opus 5.5 为输入 4 美元、输出 20 美元,并称 Sonnet 快约 30%、便宜约 30%。七轮中作者判 Sonnet 胜四轮、Opus 胜三轮,称 Opus 全程多花约 46 分钟、多约 1600 万美元等值输入 token 成本约 16 美元。以上均为作者自述测试,非独立复现。
尚未明确:作者未公开完整提示词、skill 定义与原始账单,成本数字来自其自述;模型名称、定价与发布时间未与 Anthropic 官方文档核对;胜负判定为主观评价,未做盲测;视频画面未审看,无法确认演示细节。
宾夕法尼亚大学沃顿商学院教授 Ethan Mollick 在 X 发帖称,他撰写了新文章《The Dot and the Swarm》,主题是他在 AI 进展中最低估的一点:AI 自组织以完成任务的能力。他表示文章还讨论了这对 Muse、Dots 等 agent 意味着什么,并附一支音乐视频解释为何人们不断重新学习 The Bitter Lesson。
展开详情
帖子发布于 2026 年 10 月 1 日,附有其 Substack 通讯 oneusefulthing.org 的文章链接,页面显示约 2.75 万次浏览。以上均为作者自述,尚未见第三方对其论点的独立验证。
尚未明确:文章正文未在材料中呈现,自组织的具体机制、所举案例、Muse 与 Dots 指代的具体产品,以及该判断的证据基础均未知;The Bitter Lesson 与音乐视频的具体内容也未说明。
Cole Medin 在视频中介绍用 Jev(一类做决策而非生成文本的 system one 模型)改造 AI 编程流程的四个用法:以 pre-tool use hook 拦截读取密钥、删目录等危险操作;让 Jev 实时玩自己开发的游戏做验证;驱动浏览器测试真实应用;在 Archon 工作流里对 GitHub issue 和 PR 分类,决定任务类型与所用模型档位。
展开详情
他称 Jev 比 LLM 决策快 20 至 200 倍、便宜 40 至 1000 倍,并给出自测数据:安全 hook 每次分析约四分之一秒,12 次 issue 分类全部与自己的判断一致,PR 分类 16 次中 15 次一致。这些均为作者自述与自测,未独立验证。
尚未明确:Jev 的官方来源、发布方与定价未在材料中说明;速度与成本倍数、准确率对比均为作者自述,无第三方复现;安全 hook 仅使用很短时间,长期误报率未知;游戏与浏览器测试的具体实现细节未展开。
YouTube 频道 Jono Catliff 发布 34 分钟教程,称把此前 11 万播放的本地 SEO 大师课打包成一套免费 Claude Code 代理蓝图,托管在 GitHub,需在 VS Code 中安装 Claude Code 并连接 Semrush。
展开详情
作者演示的流程包括:用 /gbp 命令生成 Google Business Profile 优化清单(主类别参考前三名竞争对手、服务按 Semrush 搜索量排序)、用 /review-generator 搭建评论筛选表单(好评跳转 Google、差评经 Make.com 推送到 Slack)、批量生成 GBP 帖子、用 /keyword-research 找本地关键词、生成服务页与本地博客、经 GitHub 与 Vercel 发布,并用 Blotato 转成 LinkedIn 与 X 帖子。作者称其上一家公司月获 5 万次 Google 点击、本地 SEO 一到三个月见效,这些均为其个人说法。
尚未明确:未独立实测该代理的实际排名效果;作者所称 5 万次月点击、50 万美元收入和一到三个月见效均无第三方验证;视频为 Semrush 合作内容且含多处联盟链接,存在利益关联;蓝图仓库与 Make.com 场景的实际可用性、Google 是否容忍自动回复评论与批量生成页面均未说明。
MIT Technology Review 10月2日刊出Thore Graepel署名观点文章。他自述是DeepMind AlphaGo团队核心成员,近期已离开Google DeepMind。文章回顾2016年AlphaGo对李世石第二局第37手:策略网络认为该手只有约万分之一的人类棋手会下,是搜索机制权衡后续变化后选中它。
展开详情
他据此提出,当前大模型靠逐token预测和思维链,缺少显式、可检查、可修订的认知状态,知识与推理混在权重里,思维链还常是事后编造,因此不算真正推理;主张借鉴AlphaGo的博弈树结构,让系统维护信念状态并由独立部分按证据评估每一步。
尚未明确:文章为署名观点,未给出新系统原型、实验数据或可复现评测;所提'认知状态+独立评估'架构能否在开放世界落地、成本与效果如何均未说明;离开DeepMind后的具体去向与计划未披露。
宝玉在 X 上称,他在测试 Manus 时总结出一个画图提示词技巧:不靠文字描述控制样式风格,而是直接提供一张参考图,图中包含颜色、字体示范、宣纸纤维、墨迹边缘、水痕、远山、印章与留白规则等,这样出图稳定性更高,内容提示词可以写得很简单。他给出两张示例页的 content_prompt,主题为“茶与慢生活”“把日常慢下来”,要求遵循参考图的水墨极简、侘寂、宣纸纹理与留白风格,并附上完整英文演示页提示词。
展开详情
以上均为作者自述的测试经验,非官方功能说明。
尚未明确:作者未说明测试的具体 Manus 版本、生成次数与对比条件,也未给出成功率或失败案例;参考图是否对文字排版、中文字形同样稳定,材料中未验证;该技巧是否适用于 Manus 之外的模型未知。
整理于 2026-10-03 06:48(北京时间) · 部分来源暂未获取