AI 情报
· 37 条 · 北京时间
Reddit 用户 Genaforvena 在 r/AI_Agents 发帖称,已开源 mishe-tauftauf,一个面向编码代理的小型本地协调系统,采用 CC0 1.0。作者称其早期版本曾用于三人团队从零搭建广告技术 DSP,约四个月上线,处理约 5 万请求/秒并参与实时 RTB 竞价;他明确说明 DSP 由工程师而非代理构建,代理的作用是让工作、证据、交接与恢复路径保持可见。
展开详情
系统核心是让代理“心智”可随时重启,连续性由状态文档、共享文本带、检查与未完成义务承载;检查返回 GREEN、RED 或 UNKNOWN,证据缺失不会被当作成功。作者邀请他人在真实项目中试用并报告失败模式。
尚未明确:除作者自述外,尚无第三方复现或独立验证;约 5 万请求/秒与四个月上线等数据无外部佐证;系统在陌生代码库、遗留系统或硬件环境中的实际表现未知;作者也承认原环境证据受熟悉度影响。
韩国YouTube频道Deno发布视频,称自己用Claude Opus 5.5与Higgsfield的MCP连接,把对话中构思的短剧先以MiniMax 480p低分辨率出草稿,确认故事、参考图与提示词后,再经Higgsfield MCP生成2K成片。作者称约90秒成片成本约8500韩元,并称因低清阶段已试错,高清输出一次成功;他还称Opus 5.5在长上下文创作中比Codex更不易丢失剧情设定,缓存读取价格较前代下降。
展开详情
以上均为作者个人使用体验与自算成本,非官方数据。
尚未明确:Opus 5.5的基准提升、缓存价格降幅、100万token上下文与Codex 258K等说法均来自作者口述,未见官方来源;8500韩元成本为作者自算,未说明是否含订阅与重试;成片质量评价为主观。
Unity 开发者 Jason Weimann 在视频中演示自己的 playtest 流程:在游戏里按 F10 输入“降落太难,请简化”,报告会保存截图和当前游戏状态变量,写入文件夹,由代理定期检查并修复,下一版构建中生效。
展开详情
嘉宾 Chris Lucian 称其 Ship of Theseus 项目用 Sonnet 生成工具,把资产商店素材切片接入 Dungeon Architect 运行时生成关卡,并用 ElevenLabs 做音效、配音与对白,用 Tripo 生成角色;他还称正让两个模型并行构建同一款四人合作游戏做对比。作者强调系统能生成,但“好玩”仍需人来设计。
尚未明确:视频为作者自述,未独立实测;F10 报告到修复的完整链路、代理自动检查频率、模型对比结果、Tripo 与 ElevenLabs 的实际成本与质量均未给出可验证数据;角色创建器与战斗原型尚未完成。
YouTube 频道「回到Axton」发布 20:43 视频,演示 TypeSafe 的 Jev 判断模型接入 Claude Code。作者称 Jev 不是聊天模型,而是官方称为 System 1 的结构化判断工具,只回答布尔、单选、评分三类问题,返回 0 到 1 的概率。他用 120 条中文反馈、48 篇文档和取消订阅后仍扣款个案做对比:两条路线最终清单相同,但 Jev 第一遍在反馈筛选中有四条判断被 Claude 复核改正。
展开详情
作者表示这批小文件会直接用 Claude Code,只有同一种判断需大量重复执行时才值得测试 Jev,且本片未测量耗时与费用。
尚未明确:视频未测量两条完整流程的耗时和费用,也未说明 Jev 在更大批量或真实数据上的表现;四条被改正的判断只来自作者一次演示,不能当作准确率结论。
OpenAI 官网发布客户案例,称量化交易公司 Jump Trading 使用 ChatGPT 扩展其量化研究工作,做法是把多个数据源接入更长时间运行的 AI 工作流,并在流程中保留人工审核环节。该页面为 OpenAI 官方发布的客户故事,属于供应商对合作方用法的描述,未给出具体模型版本、部署规模、效率或收益数字,也未说明 Jump Trading 自身的评价。
补充信息
尚未明确:具体使用哪些模型与版本、接入哪些数据源、工作流如何搭建、投入与产出指标、是否已规模化落地,材料均未说明;效果描述来自 OpenAI 一方。
Reddit r/AI_Agents 用户 Acrobatic-Laugh1856 发帖称,自己花一个月搭建自主代理浏览 Reddit 和 X、分析购买意图并筛选潜在客户,结果 API 额度消耗巨大且完全失败:代理陷入递归推理循环,把机器人帖和泛行业新闻误判为购买意图。
展开详情
作者称转机来自取消自由浏览,改为两层结构:第一层用确定性关键词流接入实时端点抓新帖,第二层用简化 LLM 提示做二元判断,区分真实抱怨与噪音,并称改用 pumpgtm 承载该受限两层流过滤后执行变得稳定。作者观点是,全自主代理只适合演示,受限流过滤才可扩展且不烧 token。
尚未明确:仅为个人单方叙述,无成本数字、成功率或对比数据;pumpgtm 的具体能力与是否真实解决该问题未经验证;两层方案在其他场景是否可复制未知。
宾夕法尼亚大学沃顿商学院教授 Ethan Mollick 在 X 发帖指出,AI 代写学术论文存在一个不易察觉的问题:AI 在反馈校准上表现不佳,面对质疑往往直接让步。他认为,论文送审后遇到同行评审的挑战,作者本应尝试为自己的想法辩护,只有在确实错误时才放弃;而 AI 通常做不到这种有分寸的坚持。该说法是 Mollick 的个人观察与观点,未附具体实验、数据或案例,也未指明涉及哪个模型或工具。
补充信息
尚未明确:Mollick 未说明该判断基于哪些模型、多少篇论文或何种测试;不同模型、不同提示方式下“让步”程度是否不同未知;也未给出缓解办法或可复现证据。
整理于 2026-10-07 10:03(北京时间) · 部分来源暂未获取