AI 情报
· 49 条 · 北京时间
YouTube 频道 Futurepedia 发布 9 分钟视频,称 Gemini 已上线 Skills 功能,可在 Gemini 聊天和其更偏代理化的平台 Gemini Spark 中使用。作者演示三种创建方式:在普通聊天里用提示词生成、手动填写名称描述与指令、上传含 skill.md 和参考文件(如定价 CSV)的技能包;并演示把会议纪要、模仿本人语气写邮件、提案撰写等多个技能同时调用串联。
展开详情
作者称技能可下载后在 ChatGPT、Claude 与 Gemini 之间迁移,并提供了含 25 个技能的免费指南。以上为作者演示与说法,未独立实测。
尚未明确:Gemini Skills 的正式发布范围、地区与账号限制、Gemini Spark 的可用性、跨平台技能文件是否真能通用,以及视频中演示效果是否可复现,均未在材料中说明。
YouTube 创作者 Riley Brown 在 24 分钟视频中汇总一周 AI 动态:Anthropic 在 Opus 5.5 发布六天后推出 Sonnet 5.5,他称 Sonnet 在代理编程上超过 Opus 5.5,价格约为其一半(输入 2 美元/百万 token、输出 10 美元/百万 token,Opus 为 4 与 20 美元);OpenAI 开发者日发布 ChatGPT 桌面端个人代理 Dots(他命名为 Bluey)、类 Notion 的 GPT Space 与插件扩展,他演示语音指挥代理发邮件、发 Slack 并启动本地 Codex 会话改落地页;Google 发布 Gemini 4 Argon,仅向“网络防御者”开放;GrokBot 新增主动建议、内联邮件草稿、Slack 团队机器人与流量经本机路由。
展开详情
以上多为作者自述体验,非独立实测。
尚未明确:Sonnet 5.5 与 Opus 5.5 的基准对比、Gemini 4 Argon 实际能力、Dots 与 GPT Space 的开放范围与定价均未获官方材料证实;视频为自动字幕,模型名如 GPT 6.1 Soul、Astra 等拼写与真实性待核。
The Decoder报道,Google Cloud AI Research与多所大学提出RRSI(正则化递归自改进智能体框架)方法。论文称,让语言模型反复重写智能体harness时,智能体会记住有限的测试任务,训练分上升但新任务收益缩小甚至消失。RRSI在提出改动时限制单次可捆绑的独立编辑数量并逐步收紧,同时用critic剔除硬编码任务名、答案等基准特定技巧,只接受有可测性能收益的算力增加。
展开详情
在8个覆盖编程、办公与工程设计的基准上,底层模型Claude Opus 4.8保持冻结,RRSI训练任务最高提升14.1分,5个未见基准最高提升4.7分,运行时token比未正则化版本少约30%。代码已在GitHub发布。
尚未明确:论文与报道未说明RRSI在模型权重会变化时的表现,作者也明确研究仅覆盖冻结模型;8个基准之外的真实业务任务泛化能力、与其他优化方法的长期稳定性仍待验证。
TechCrunch 报道,Reflection AI 正式发布其首个前沿开源权重模型 Beam,为纯文本混合专家模型:5010亿总参数、230亿激活参数,预训练用23.8万亿 token,上下文窗口100万 token。公司称 Beam 在高级推理基准上与 Z.ai 的 GLM-5.2 相当,并优于当前领先的西方开源模型,推理算力用量少3-4倍;这些性能说法尚未被独立验证。
展开详情
Reflection 将其定位为企业、公共部门和开发者的“主力模型”,并计划本月放出权重与完整技术细节,通过超大规模云和 neocloud 分发。
尚未明确:性能对标与“3-4倍更省算力”均为厂商自述,未经独立复现;权重是否如期本月开放、实际推理成本与部署门槛、许可证条款、与 GLM-5.2 及 Inkling 的第三方对比结果均未知。
YouTube 频道 Sharbel A. 发布 14 分钟视频,演示其自用的开源 AI agent Hermes 的七个工作流:会议结束后自动抓取 Fireflies 转录、提取行动项并分配为 Notion 任务;监控收件箱并按其语气生成待审草稿;用 webhook 监控注册量、站点、评论等并推送 Telegram 告警;通过 Telegram bot 读取客户群聊、标记沉默或不满意客户;用 Memo 等共享记忆在 Hermes、Claude Code、Codex 间复用上下文;用手机远程操作家中 Mac Mini;每天早晨推送日历、重要邮件与关键数字并追问当日第一优先级。
展开详情
作者称该收件箱流程上月帮助团队成交数万美元订单,但未提供可核验细节。
尚未明确:作者自述的成交金额、任务自动分配准确率、客户流失预警效果均无第三方验证;视频未展示实际界面操作与失败案例;Hermes 的官方仓库、许可证与维护状态未在材料中给出;共享记忆方案 Memo/Super Memory/Zep/Letta 的免费额度与数据隐私细节未核实。
宾夕法尼亚大学沃顿商学院教授 Ethan Mollick 在 X 上回应 Mark Cuban 的流行说法“AI 不会抢走你的工作,但比你更会用 AI 的人会”。Mollick 认为这条建议已不再那么成立,给出三点:一是随着 AI 更易使用,“更会用 AI”背后的持久技能是什么并不清楚;二是越来越明显的是,组织系统而非个体员工成为 AI 收益的瓶颈;三是对就业的影响尚不确定,但可能冲击整个职业类别。
展开详情
这是 Mollick 的个人观点,非研究结论。
尚未明确:Mollick 未给出支撑这三点的具体研究、数据或案例;“组织系统成为瓶颈”的具体机制、适用范围与行业差异均未说明;对职业类别的冲击程度与时间表也未展开。
The Decoder 报道昆尼皮亚克大学民调:47%受访者希望放慢AI开发速度,30%希望在有安全验证前完全停止,仅5%希望加快;86%支持正在讨论的独立安全标准,即使会拖慢进展;74%对AI公司领导层信任很少或没有;73%担心AI最终威胁人类生存。该调查于2026年9月24日至27日访问1202名美国成年人,误差范围正负3.5个百分点。数据属民调机构发布、媒体转述,非独立验证。
补充信息
尚未明确:民调仅覆盖美国成年人,未说明其他地区态度;未披露具体抽样方式与加权细节;也未说明这些态度会如何转化为投票或消费行为。
Nate Herk 频道发布一期与 Dave Ebbelaar 的对谈(时长约1小时9分,播放6.3万)。Dave 自称有十余年 Python 经验、团队交付过50多个 AI 方案,现在“不写一行代码”,全部通过 Codex 或 Claude Code 完成,并称相对2022年专业写代码时期产出约10倍。
展开详情
他提出按风险分四级的“阶梯”:自用工具、团队内部、卖给企业、面向消费者的软件产品,越往上数据隐私与安全责任越大;并称规划与 spec 驱动开发的重要性在下降,改为直接构建、看结果再迭代。以上均为受访者个人说法,非独立实测。
尚未明确:“10倍产出”“100倍”均为受访者主观估计,无基准或数据支撑;视频中提到的模型名称(如 GPT6 Astra、Opus 5.5)与部分时间线疑似转录或口误,未在材料中核实;未审看画面,未独立实测其工作流;未说明其团队规模、项目类型与失败率。
a16z 在 State of Markets II 图表中称 98% 的美国住户尚未为 AI 付费。Box CEO Aaron Levie 转发并评论,认为该指标更多反映消费级 AI 的商业模式,而非 AI 本身的发展状态;他判断面向消费者的 AI 几乎必然通过商业交易、广告或硬件及其他服务购买来补贴和变现,因此这一付费比例可能比预期更早走平。上述数字与判断均来自其公开发言,未见独立核实。
补充信息
尚未明确:a16z 该 98% 数据的具体口径、样本与统计时间未在材料中说明;Levie 关于付费比例走平及补贴变现路径的判断属个人观点,尚无数据验证。
YouTube 频道 Gary Chen 发布 10 分 47 秒影片,称自己读完 Anthropic 为 Opus 5.5 写的官方 Prompting Guide,整理出十三点。
展开详情
他转述的要点包括:effort 默认由上一代 high 改为 medium,官方测试称 medium 在编码与文档处理上可持平或超过上一代 high;建议用自己的任务逐级测试 effort;对话中切换模型不再清空 cache(Bedrock、Google Cloud 暂不适用);一次讲清任务、终点与停止条件;删掉「仔细思考」类提示;不要要求输出推理过程;明确列出不要的设计风格;规定何时停下询问;用文件维护 checklist;把大任务拆给 subagent 并核验证据;给时间预算;Claude Code 支持读取 AGENTS.md;订阅用户有可存的重置券,称 10 月 23 日到期。以上多为作者对官方指南的转述,未独立实测。
尚未明确:影片为作者对官方指南的二手转述,未提供指南原文链接,也未独立实测;字幕中模型名在 Opus 3.5 与 Opus 5.5 之间不一致,疑似转录或口误,具体版本待核;重置券到期日、AGENTS.md 读取优先级、Bedrock/Google Cloud 是否已跟进等细节均未在材料中给出官方出处。
整理于 2026-10-06 06:48(北京时间) · 部分来源暂未获取