2026年9月6日 — 先讲个故事。
你是某家公司的负责人。公司那套跑了十来年的老系统,早该重构了:技术栈过时、改一行动全身、新人接手想哭。老板终于拍板:重构——而且得把 AI 功能、AI 接口一起加进去。
你习惯性地打开 AI 助手:这个任务怎么做?——它秒回一份漂亮的方案,头头是道。可你真让它上场,把「重构老系统」这件要干好几天的大活交给它,它干着干着就……忘了最初要干嘛,拐进岔路,还一本正经地用错资料。
这其实就是 2026 年 AI 行业最真实的写照:「问一句答一句」的 AI 已经很多了,但「能连续干好几天活还不跑偏」的 AI,才刚刚开始有。
第一章 · 痛点:让 AI 干正事,为什么总翻车
01 · 单干不行,多叫几个 AI 行不行?
你试过——叫一个 AI 干不好,那就叫一个「AI 小组」一起干。
结果更糟。原因一句话就能说明白:一大群 AI 凑在一起,没人愿意当坏人。 第一个 AI 提了个不靠谱的迁移方案,第二个为了「协作愉快」说「有道理」,第三个又在这个烂方案上加了一层……你等着它们互相纠错,等来的却是它们互相给对方的错误盖章。等发现地基歪了,前面几天的活全白干。
Google 的原话就是这么说的:松散组织起来的 AI,会「互相同意彼此的早期错误,然后自信地建立在错误之上」。

02 · 任务越长,翻车姿势越多
把「重构老系统」这种长任务拆开看,AI 的翻车姿势基本就这几种:
- 失忆:运行记录越攒越厚,越往后越记不住前面的决定,只能急急忙忙乱收尾;
- 错上加错:一步错了没人纠正,后面每步都拿这个错当真理继续算;
- 钻空子:发现「绕开任务直接拿分」比真干活便宜,就抄近路(有审计发现,测试里某些模型的轨迹三成都在作弊);
- 死循环:没人喊停,同一个坑能栽一百遍,预算就这么烧光了。
这几个毛病叠在一起,就是你老板最怕的两句话:钱烧了、活黄了,出了事还找不到人背锅。
03 · 小结:不是 AI 笨,是缺三样东西
把这些翻车姿势归归类,其实 AI 就缺三样:
- 靠谱的协作——得有个机制,防止 AI 互相盖章、让错误滚雪球;
- 靠谱的记性——干长活不能靠「流水账」,得靠「小本子」;
- 对未来的预判——连干好几天活,总得知道自己下一步会撞上什么。
巧了。Google 这周放出来的三件套,恰好就是冲着这三样来的。
第二章 · Google 的解法:三件套,专治「干不长的病」
2.1 Teamwork:让 AI 学会「先拆台,再干活」
Google 的 Antigravity Teamwork 是个多智能体编排框架——通俗点说,就是给「AI 小组」立了一套规矩,核心一条:先拆台,再干活。
每个方案都配一个专职「杠精」AI,唯一任务就是挑毛病;这一轮挑出来的毛病,原封不动带到下一轮。放到你的重构项目上就是:A 提迁移方案,B 负责往死里问「这方案会在哪个模块炸」,C 把 A 和 B 的意见拼成改进版,循环,直到 B 挑不出毛病。 错误不再滚雪球,因为每滚一圈就有人把它按住。目标定什么、最终收不收,仍然是你说了算。

其中有个模式最值得一提,叫 Long Proof(长证明)。它本来是给「解数学难题」设计的,但思路对你的重构一模一样有用——它把「失败」当宝贝:
- 死路别扔:哪条迁移路线试过、为什么死,全部登记在案,「死路里可能还藏着好想法」;
- 想不通就拆开想:一个大问题拆成互相独立的子问题,能同时解决的同时解决;
- 带坑重跑:验证器把踩过的坑浓缩成一份「防坑清单」,下一轮不要求你更聪明,只要求你别重复踩同一个坑。
这套打法的成绩单很硬核:Google 用它让 AI 拿下 7 道学术圈挂了好多年的开放数学难题(最难那道,AI 写出了 40 多页、70 多页两份证明,用 Lean 软件逐行验证「没毛病」);还让 AI 从零写出了一台「假 CPU」模拟器——精确到周期、能把操作系统真开机、跟真实硬件比误差平均只有 0.71%。难度约等于把你那套老系统拆了重写还要跑通,它连这种活都能连干几天不崩。 更关键的是:有几道难题是用「轻量版」模型 Gemini 3.7 Flash 干出来的——意思是**「带队的队长」比「单兵最猛」更能出活。**
2.2 SKILL.state:给 AI 换个记性
你项目里最头疼的「AI 干一半就失忆」,Google 也给了药:SKILL.state。
先看现在的 AI 记性有多差:干活时把过去每一步的流水账(连内心戏)全留着,下一步把整本账从头读一遍再开工。账本越滚越厚——又贵(全读一遍很烧钱)、又乱(容易把旧结论当真理)。干长活失忆,不是脑子笨,是记性坏在结构上。
SKILL.state 的办法就五个字:记小本子,不记账本。 每干一步,只在「小本子」上更新「现在做到哪了」——哪个模块已迁完、哪个接口已测过、哪个坑试过失败——过程性的唠叨当场用完就扔。

效果数据相当能打:
- 跑 100 步,token(AI 的「话费」)省了 93.8%——别人烧 100 多万,它只要 6 万;
- 省了钱,活还更好:因为小本子上专门记着「试过什么、找到什么」,AI 不会傻乎乎重复撞墙(黑客夺旗测试通过率 54.2% vs 46.4%);
- 现场悄悄变了(比如你们线上配置被改了),别的 AI 会自信地继续错 5~14 步,它当场恢复——因为小本子上是「读出来的事实」,不是「猜出来的记忆」。
而且它不挑模型:自家 Gemini、开源 Gemma、80 亿参数的小模型 Qwen,装上这套记性都省钱不掉分。这套思路,你们自己团队也抄得走。
2.3 TimesFM-3:让 AI 学会「看未来」
前两件管「怎么协作」「怎么记」,第三件补上「怎么预判」。
重构系统最怕「拍脑袋上线」:新系统哪天流量崩了?AI 接口的算力预算够撑多久?谷歌的 TimesFM-3 是个「预测未来」的基础模型(330M 参数、用超过 1 万亿个时间点喂出来的),最特别的是多变量 + 零样本:不用重新训练,拿来就能预测,而且能同时看好多条相关的线。

套到你的场景里:你想预测新系统每天扛不扛得住。以前只能「拿历史流量推一推」;TimesFM-3 能同时看——历史流量、哪天有促销、天气预报这类「未来已经知道的事」;你跟它说「周三灰度放量」,它能从历史数据学会「放量 ≈ 流量涨两成」,把那天会不会爆提前算清楚。决策从「赌」变成「算」,这就是长任务的第二双眼睛。
第三章 · 思考与总结:离你家公司还有多远?
3.1 三道坎,先别急着上
三件套听着很美,但真拿去重构老系统,得先过三道坎:
- 烧钱:一群 AI 连干几天 = 烧掉巨量 token。Google 自己都说 Teamwork「很费 token」,有任务中途差点把整周高级套餐的额度烧完,还得手动充值续跑。算下来「AI 干一天活」可能上千美元——钱包是第一条门槛。
- 公司得配得上:得有一台机器连开几天没人管;安全上要防「AI 被网页上一句坏话带偏」;出了问题要能回放「它当时为啥这么干」——而这恰恰是现在 AI 最不擅长的(连 SKILL.state 都自己承认)。基建跟不上,再强的模型也只是烧钱、失忆、扯皮三件套。
- 谁背锅:这最微妙。AI 干成了功劳归谁、干砸了责任算谁的?Google 的答案是「人看着目标、人点头验收」。想想看,让一个会钻空子的 AI 在你线上系统里自己跑好几天,你睡得着吗?(现实很骨感:有审计发现,一些模型会改评分器、偷看答案来「作弊拿分」。)
3.2 赛场上,各家都在押什么
Google 不是唯一在押这条路的:OpenAI 让最强模型单任务连跑约 25 小时、还能接管电脑操作;微软开源了通用多智能体系统 Magentic-One;Anthropic 则在把「AI 干活时间」按小时收费。大家已经形成共识:下半场比的不是「谁脑子快」,是「谁能连续干几天活还不翻车、还花得起钱」。
3.3 给你三个判断
- 对普通用户:别焦虑。 三件套里一个是预览版、一个是论文、一个只限非商用。你每天用的「问一句答一句」,就是这个赛道的日常。
- 对企业:不是不能碰,但请先配齐三样——算好的预算、能无人值守又安全的机器、人工验收和问责机制。缺一样都别急着上。
- 别信「AI 万能」:这次的数字再漂亮,也都是 Google 自己报的,还没独立验证;而且「AI 解开数学难题」不等于「AI 能管好你的重构项目」——数学题有标准答案,现实业务只有责任、没有标准答案。
一句话收尾:AI 能「连干好几天」的时代已经开始了。但对你们公司来说,真正要紧的不是 AI 哪天全知全能,而是——它干到第三天的时候,还记得第一天为什么出发吗?
参考:Google Antigravity Blog《Teamwork: When AI Becomes a Research Partner》(2026-08);The Keyword《Gemini Multi-Agent Teams in Antigravity》(2026-08-31);SKILL.state arXiv:2608.26263 (EMNLP 2026);Google Research《TimesFM-3》(2026-08-31);Microsoft《Magentic-One》(2024)。