<?xml version="1.0" encoding="utf-8"?>
<rss version="2.0" xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/">
    <channel>
        <title>Breezedeus.com</title>
        <link>https://www.breezedeus.com/</link>
        <description>善意的AI生产幸福❤</description>
        <lastBuildDate>Sat, 08 Aug 2026 08:27:17 GMT</lastBuildDate>
        <docs>https://validator.w3.org/feed/docs/rss2.html</docs>
        <generator>https://github.com/jpmonette/feed</generator>
        <language>zh-CN</language>
        <copyright>All rights reserved 2026, Breezedeus</copyright>
        <item>
            <title><![CDATA[模型如何边看边听、边回应：实时流式多模态模型技术路线]]></title>
            <link>https://www.breezedeus.com/article/real-time-streaming-multimodal-models</link>
            <guid>https://www.breezedeus.com/article/real-time-streaming-multimodal-models</guid>
            <pubDate>Sat, 01 Aug 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[从每秒一帧的客户端采样到原生全双工 AV2AV，系统梳理实时流式音视频多模态的六条技术路线：增量 prefill 与 KV/GDN 状态、共享时间轴、显式说话触发、异步思考、模态专家，以及因果音视频生成；并拆解 Qwen3.5-Omni、MiniCPM-o、ROMA、DuplexOmni、ELLSA 与 Wan-Streamer 的实现边界与选型要点。]]></description>
            <content:encoded><![CDATA[<div id="notion-article" class="mx-auto overflow-hidden "><main class="notion light-mode notion-page notion-block-3adc0110d33180bc8d3fea6c49df3b9f"><div class="notion-viewport"></div><div class="notion-collection-page-properties"></div><div class="notion-row notion-block-3aec0110d33180c5b6ddf17c61a32553"><div class="notion-column notion-block-3aec0110d33180f3894be7221a3ffd5d" style="width:calc((100% - (2 * min(32px, 4vw))) * 0.25)"><div class="notion-blank notion-block-3aec0110d33180158c2dd619f3ad0364"> </div></div><div class="notion-spacer"></div><div class="notion-column notion-block-3aec0110d3318063aa61e4a85f0224ea" style="width:calc((100% - (2 * min(32px, 4vw))) * 0.5416666666666665)"><div class="notion-text notion-block-3aec0110d3318062a50cff987f3d2928"><b><a class="notion-link" href="https://www.breezedeus.com/" target="_blank" rel="noopener noreferrer">Home</a></b><b> | </b><b><a class="notion-link" href="https://github.com/breezedeus" target="_blank" rel="noopener noreferrer">GitHub</a></b><b> | </b><b><a class="notion-link" href="https://twitter.com/breezedeus" target="_blank" rel="noopener noreferrer">Twitter</a></b><b> | </b><b><a class="notion-link" href="https://www.youtube.com/@breezedeus" target="_blank" rel="noopener noreferrer">Youtube</a></b><b>  |  </b><b><a class="notion-link" href="https://space.bilibili.com/509307267" target="_blank" rel="noopener noreferrer">Bilibili</a></b></div></div><div class="notion-spacer"></div><div class="notion-column notion-block-3aec0110d33180358a2edc1d24a420dc" style="width:calc((100% - (2 * min(32px, 4vw))) * 0.2083333333333335)"><div class="notion-blank notion-block-3aec0110d331807e88ecc761211033a9"> </div></div><div class="notion-spacer"></div></div><div class="notion-row notion-block-3aec0110d33180f4b9fdcf2c12c11ab4"><div class="notion-column notion-block-3aec0110d33180a0bd80e7d0192aae02" style="width:calc((100% - (1 * min(32px, 4vw))) * 0.5)"><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-3aec0110d331807b88c8c3717af30c98"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3A49176ab7-a858-4462-8a69-f7c29c95b5c9%3Aimage.png?table=block&amp;id=3aec0110-d331-807b-88c8-c3717af30c98&amp;t=3aec0110-d331-807b-88c8-c3717af30c98" alt="notion image" loading="lazy" decoding="async"/></div></figure></div><div class="notion-spacer"></div><div class="notion-column notion-block-3aec0110d3318051b9efda9d3e71f9e2" style="width:calc((100% - (1 * min(32px, 4vw))) * 0.5)"><div class="notion-callout notion-gray_background_co notion-block-3aec0110d33180118c55ddd05ed4ef8a"><div class="notion-page-icon-inline notion-page-icon-span"><span class="notion-page-icon" role="img" aria-label="📌">📌</span></div><div class="notion-callout-text"><div class="notion-text notion-block-3aec0110d331809a88a3e43d80de272c"><b>从“每秒传一张图”到原生全双工 AV2AV：真正的实时，取决于状态是否增量更新、说话时机是否可学习，以及音视频输出能否因果生成。</b></div></div></div><div class="notion-blank notion-block-3aec0110d331806db6e7e227dffd8289"> </div></div><div class="notion-spacer"></div></div><hr class="notion-hr notion-block-9aa665c70e054943bab6aaf2b173ebe6"/><div class="notion-text notion-block-e85c0110d3318320a6c68177aeadee96">把摄像头接到一个多模态模型上，不等于模型会“看直播”。</div><div class="notion-text notion-block-92bc0110d33183c3bcf201ad048978f6">最简单的产品也可以每隔一秒截一张 JPEG，与连续音频一起发给云端；模型确实在不断收到新画面，但它可能每次都在重建上下文，并不知道两张图之间发生了什么。更进一步的系统会把新音视频块增量写入 KV Cache，让模型保留对现场的持续记忆。再往前，模型还要决定何时保持沉默、何时插话、用户打断后怎样续接。最激进的方案则连输出视频也放进同一个因果生成过程：模型不只是“看着视频说话”，而是在持续生成一个有声音、有动作、会回应的可见角色。</div><div class="notion-text notion-block-764c0110d3318303914b014a8f69e25f">这些方案都可以被称为“实时多模态”，但它们解决的其实不是同一道题。</div><div class="notion-text notion-block-3a4c0110d331822db5148163aec58c0e">本轮调研覆盖 Qwen3.5-Omni、Gemini Live、MiniCPM-o 4.5、ROMA、DuplexOmni、ELLSA、Wan-Streamer，以及 Artic、vLLM-Omni、百度智能云 RTC 等系统层方案。一个贯穿全文的判断是：</div><blockquote class="notion-quote notion-block-9bce19df4d8548c8a1e7d87d3b4c684d"><div><b>当前流式视频模型的主要技术分野，不在于“有没有视频输入”，而在于把可流式性插入了哪一层：客户端采样、编码与缓存、跨模态时间轴、响应控制、思考调度、模态专家，还是原生音视频生成。</b></div></blockquote><div class="notion-text notion-block-d97d5e796caa45bc984697ec2e2b825b">OpenAI Realtime、Moshi 等常被放进“实时多模态”名单，但没有列为本文重点玩家。以当前 <code class="notion-inline-code">gpt-realtime</code> 为例，它支持实时音频和单张图片输入，官方模型页仍将 Video 标为不支持，产品说明也明确说图片不会被当作 live video stream。<a class="notion-link" href="https://developers.openai.com/api/docs/models/gpt-realtime" target="_blank" rel="noopener noreferrer">S18</a> 这类系统可作为音频主导、按需看图的方案，却不满足本文“视频与音频都持续进入”的严格筛选条件。</div><div class="notion-text notion-block-53ed0a94b8844798b1e08c3b3a5fe78c">下面先建立一把尺子，再逐个拆项目。</div><hr class="notion-hr notion-block-e8d79977b5f5484cab040c8cc7ed5ee5"/><h3 class="notion-h notion-h2 notion-h-indent-0 notion-block-e92b628222624faea43e9175fb5c1a9b" data-id="e92b628222624faea43e9175fb5c1a9b"><span><div id="e92b628222624faea43e9175fb5c1a9b" class="notion-header-anchor"></div><a class="notion-hash-link" href="#e92b628222624faea43e9175fb5c1a9b" title="一、先定义问题：四种“支持视频”不是同一种能力"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">一、先定义问题：四种“支持视频”不是同一种能力</span></span></h3><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-10ce2917308d487aaa5dd4695b8b2dde"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3A80d2b00b-ca8b-422a-a884-a61026ca590b%3A01-streaming-video-capability-ladder.svg?table=block&amp;id=10ce2917-308d-487a-aa5d-d4695b8b2dde&amp;t=10ce2917-308d-487a-aa5d-d4695b8b2dde" alt="notion image" loading="lazy" decoding="async"/></div></figure><div class="notion-text notion-block-06dc76d57be94e4a84130a0ff9256416"><em>图 1：本文采用的 L0—L3 能力分级。三个“实时”——传输、推理和交互——只有同时成立，系统才接近持续在场。</em></div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-041815351af046fc810c6496ffba5ce8" data-id="041815351af046fc810c6496ffba5ce8"><span><div id="041815351af046fc810c6496ffba5ce8" class="notion-header-anchor"></div><a class="notion-hash-link" href="#041815351af046fc810c6496ffba5ce8" title="L0：上传后理解"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">L0：上传后理解</span></span></h4><div class="notion-text notion-block-334bdd6dae504d8ebcdb895a902b94a8">用户录完一段视频，服务端拿到完整文件后统一抽帧、编码和推理。这是视频理解，不是流式视频。它可以回答“刚才发生了什么”，却无法在杯子即将掉落时提醒，也无法在用户演示操作的中途纠错。</div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-4704047fbd6849d6809cb7951bf980c4" data-id="4704047fbd6849d6809cb7951bf980c4"><span><div id="4704047fbd6849d6809cb7951bf980c4" class="notion-header-anchor"></div><a class="notion-hash-link" href="#4704047fbd6849d6809cb7951bf980c4" title="L1：稀疏视觉流"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">L1：稀疏视觉流</span></span></h4><div class="notion-text notion-block-83ddaa8944b847c0a09e3e079d919b92">音频连续上传，视频在客户端被采成周期性图片。Gemini Live 明确把视频作为逐张图片发送，最高 1 FPS；Qwen Realtime 的官方建议也是 JPEG、480p/720p、每秒不超过 1 帧。<a class="notion-link" href="https://ai.google.dev/gemini-api/docs/live-api" target="_blank" rel="noopener noreferrer">S1</a><a class="notion-link" href="https://docs.qwencloud.com/developer-guides/speech/realtime-multimodal-speech" target="_blank" rel="noopener noreferrer">S2</a></div><div class="notion-text notion-block-c122d61f1d6d42a8be0db6069aa1bf12">这一路线很实用：复用成熟的实时会话接口，视觉 token 成本可控，普通网络也扛得住。但它观察到的是一串视觉快照，不是 25 FPS 的连续运动。快速手势、视线变化、短暂遮挡和细粒度动作很容易落在采样间隙里。</div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-97782a0f248245609966c72bf56a1e8f" data-id="97782a0f248245609966c72bf56a1e8f"><span><div id="97782a0f248245609966c72bf56a1e8f" class="notion-header-anchor"></div><a class="notion-hash-link" href="#97782a0f248245609966c72bf56a1e8f" title="L2：增量音视频理解"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">L2：增量音视频理解</span></span></h4><div class="notion-text notion-block-05408a1739a345c1b89580bcd774054d">新帧与新音频块被分块编码，历史状态持续保存在 KV Cache 或其他循环状态中，模型不必每次从头读完会话。此时“流式”进入了模型内部：它能让一段尚未结束的事件逐步改变当前判断，并在合适时刻触发回复。</div><div class="notion-text notion-block-6ed7a9298067481d85ea9a28078710fd">MiniCPM-o 的 <code class="notion-inline-code">streaming_prefill</code>、ROMA 的一秒多模态单元、Qwen3.5-Omni Thinker 的 chunked prefill，都属于这一层的不同实现。<a class="notion-link" href="https://arxiv.org/abs/2604.15804" target="_blank" rel="noopener noreferrer">S3</a><a class="notion-link" href="https://arxiv.org/abs/2604.27393" target="_blank" rel="noopener noreferrer">S4</a><a class="notion-link" href="https://openbmb.github.io/MiniCPM-o-Demo/site/en/model.html" target="_blank" rel="noopener noreferrer">S5</a></div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-4a2e1e1e73284165a3f2a99d3226595a" data-id="4a2e1e1e73284165a3f2a99d3226595a"><span><div id="4a2e1e1e73284165a3f2a99d3226595a" class="notion-header-anchor"></div><a class="notion-hash-link" href="#4a2e1e1e73284165a3f2a99d3226595a" title="L3：原生全双工 AV2AV"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">L3：原生全双工 AV2AV</span></span></h4><div class="notion-text notion-block-662021b2b7bd4c318b5f3fbcdd2237ae">输入和输出的音视频可以重叠进行。模型一边接收用户的声音和画面，一边生成自己的语音、表情或动作；用户插话后，输出可以中止、重规划并继续。</div><div class="notion-text notion-block-29ae5490e0f14f20b8a9a731d8686db2">这里的 AV2AV 是 Audio-Video-to-Audio-Video，不是给语音助手外挂一个口型驱动数字人。后者通常要等语音或文本确定后再渲染头像，输出形象无法反过来参与同一条连续时间线。Wan-Streamer 是目前公开资料中最接近原生 L3 的代表。</div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-2face468c03949a695343ddf6900f7e7" data-id="2face468c03949a695343ddf6900f7e7"><span><div id="2face468c03949a695343ddf6900f7e7" class="notion-header-anchor"></div><a class="notion-hash-link" href="#2face468c03949a695343ddf6900f7e7" title="三种“实时”必须分别测"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">三种“实时”必须分别测</span></span></h4><div class="notion-text notion-block-04889c119fe645c6a7bdf8cd06a237f5">产品文档常用一个“低延迟”覆盖三件事：</div><ol start="1" class="notion-list notion-list-numbered notion-block-52eca5cd44e04dd38415acbc313e93e0" style="list-style-type:decimal"><li><b>传输实时</b>：摄像头和麦克风的数据能否持续抵达服务端；</li></ol><ol start="2" class="notion-list notion-list-numbered notion-block-3d7792f8988f4775b67ed299357cb545" style="list-style-type:decimal"><li><b>推理实时</b>：新到达的块是否增量进入模型状态，还是提问时重新拼接全部历史；</li></ol><ol start="3" class="notion-list notion-list-numbered notion-block-b0288786183d402f8f08252644702ac2" style="list-style-type:decimal"><li><b>交互实时</b>：系统能否感知停顿、保持沉默、主动开口、处理重叠语音并响应打断。</li></ol><div class="notion-text notion-block-90cf89ace6ee4c66b2a222847b2c2132">这也解释了为什么“接口支持 WebRTC”不能证明模型原生流式，“模型声称全双工”也不能保证弱网下的端到端体验。两边要同时成立。</div><hr class="notion-hr notion-block-fb8462352f7d44d38c1880710c0b1b90"/><h3 class="notion-h notion-h2 notion-h-indent-0 notion-block-529503f69c9742b7a76bb64bf4b40187" data-id="529503f69c9742b7a76bb64bf4b40187"><span><div id="529503f69c9742b7a76bb64bf4b40187" class="notion-header-anchor"></div><a class="notion-hash-link" href="#529503f69c9742b7a76bb64bf4b40187" title="二、所有路线都绕不开的五个技术问题"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">二、所有路线都绕不开的五个技术问题</span></span></h3><div class="notion-text notion-block-35eb77fbe4fa40bbb259a4ef1858773b">单看模型结构，很容易被不同项目的命名带跑。把名字拿掉，实时音视频系统最终都要回答五个问题。</div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-35e4677676fc499396867262377762ec" data-id="35e4677676fc499396867262377762ec"><span><div id="35e4677676fc499396867262377762ec" class="notion-header-anchor"></div><a class="notion-hash-link" href="#35e4677676fc499396867262377762ec" title="1. 连续视频怎样压进可承受的 token 预算"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">1. 连续视频怎样压进可承受的 token 预算</span></span></h4><div class="notion-text notion-block-b3bfb648d2ae43cf873b9879b4057d0e">16 kHz 单声道 PCM 每秒有 16000 个采样，经过音频编码后尚可压到个位数或几十个 token；视频则同时包含空间和时间两个维度。假设每秒只取 1 帧，每帧仍可能产生数百乃至上千个视觉 token。若真的按 25 FPS 处理，长会话很快会撞上显存、上下文和首包时延三重限制。</div><div class="notion-text notion-block-7f28e54e197f4d6d805a98b61dc6a4fe">因此，现实系统通常组合使用：</div><ul class="notion-list notion-list-disc notion-block-d42ac730f6bd4b16b493cf0942524b41"><li>客户端降帧率、缩放、JPEG 压缩；</li></ul><ul class="notion-list notion-list-disc notion-block-76f716f917994908862039542fcfcbb8"><li>服务端视觉 resampler，把一帧压成固定数量 token；</li></ul><ul class="notion-list notion-list-disc notion-block-e60626868ccd40539131a166397a4681"><li>相似帧过滤、关键帧选择或事件驱动采样；</li></ul><ul class="notion-list notion-list-disc notion-block-8a84cb1e76474d9eb7cb2e637bd3d96b"><li>对静态背景建立持久表示，只发送变化；</li></ul><ul class="notion-list notion-list-disc notion-block-aef3b0bca9bb49c9819ec6a6d7947b99"><li>用连续 latent 而非离散视觉 token 生成输出视频。</li></ul><div class="notion-text notion-block-2713446a724642538291bdedc4b99ecb">“支持 1080p 输入”与“模型理解 1080p 的每一帧”是完全不同的说法。前者可能只是接口接收上限。</div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-2d970af926e44e7a8cd096c72a6e8a0d" data-id="2d970af926e44e7a8cd096c72a6e8a0d"><span><div id="2d970af926e44e7a8cd096c72a6e8a0d" class="notion-header-anchor"></div><a class="notion-hash-link" href="#2d970af926e44e7a8cd096c72a6e8a0d" title="2. 音频与视频怎样共享时间"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">2. 音频与视频怎样共享时间</span></span></h4><div class="notion-text notion-block-f4dc89fa06ec4f0388cbf3909f902280">一段话和一个动作是否相关，取决于它们是否发生在同一个时间窗。离线模型可以把视频均匀抽帧后整体编码；在线模型没有完整未来，必须在数据到达时建立时间关系。</div><div class="notion-text notion-block-e279401ae17749669be3d05d5f3cec54">主流做法有两类：</div><ul class="notion-list notion-list-disc notion-block-40b88898cf7d451aa2708439d036a7bf"><li><b>显式时间 ID</b>：给音频 token、视频 token 和文本 token 标上统一时间坐标，例如 Qwen3.5-Omni 用 TMRoPE 和显式时间戳对齐动态帧率视频与音频；</li></ul><ul class="notion-list notion-list-disc notion-block-b79fbf9c2a2c46958384263f2bbfad98"><li><b>固定时间窗</b>：把一秒或 160 毫秒内的视觉、音频和输出组织为一个流式单元，例如 MiniCPM-o、ROMA、Wan-Streamer。</li></ul><div class="notion-text notion-block-20d3bbf628d9444e92bf6049ca8b1c94">时间窗越短，交互越灵敏，但序列更长、调度更频繁；时间窗越长，吞吐更好，却可能把 300 毫秒内发生的“抬手—停顿—开口”压成同一块。</div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-e4ced0cc746046d3a0f0c6e90891f14b" data-id="e4ced0cc746046d3a0f0c6e90891f14b"><span><div id="e4ced0cc746046d3a0f0c6e90891f14b" class="notion-header-anchor"></div><a class="notion-hash-link" href="#e4ced0cc746046d3a0f0c6e90891f14b" title="3. 历史怎样留下，未来怎样不泄漏"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">3. 历史怎样留下，未来怎样不泄漏</span></span></h4><div class="notion-text notion-block-2c1ed9bf71de4e17b4ca6b300023d9db">离线 Transformer 可以看到整段序列。流式模型必须保证时间 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 的输出只依赖 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 之前的信息，同时又不能反复计算过去。</div><div class="notion-text notion-block-0356e06fe903464ea16f66878d17e699">典型组合是：</div><ul class="notion-list notion-list-disc notion-block-bdb74ff228b04f78a1b26a81c6558cba"><li>encoder 使用 causal / chunk-causal attention；</li></ul><ul class="notion-list notion-list-disc notion-block-23386c46a89e4d70b3e3f84c51f69593"><li>backbone 持久化 KV Cache；</li></ul><ul class="notion-list notion-list-disc notion-block-ad04aa304ac4451eb89a4e2910ed30c8"><li>语音和视频 decoder 只消费已确认的历史 latent；</li></ul><ul class="notion-list notion-list-disc notion-block-0ef742bea0f245b0985e2ee74ed0b104"><li>分块 prefill 将新输入追加进缓存；</li></ul><ul class="notion-list notion-list-disc notion-block-1979995da3cf45e8948a0b120b8a930f"><li>对长会话做滑窗、压缩记忆或分层状态。</li></ul><div class="notion-text notion-block-7878f4f5d7404503a43c1c3fbf5fe116">如果接口在每次 query 时把缓冲区里的全部帧和音频重新拼成 prompt，即使数据通过 WebSocket 到达，它也仍然只是“流式传输 + 批式推理”。vLLM-Omni 当前的 Streaming Video API 就明确把 session KV reuse 与 incremental prefill 列为尚未实现的限制。<a class="notion-link" href="https://docs.vllm.ai/projects/vllm-omni/en/latest/serving/video_stream_api/" target="_blank" rel="noopener noreferrer">S14</a></div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-280744117f8247879ab288402a8862bc" data-id="280744117f8247879ab288402a8862bc"><span><div id="280744117f8247879ab288402a8862bc" class="notion-header-anchor"></div><a class="notion-hash-link" href="#280744117f8247879ab288402a8862bc" title="4. 模型何时开口"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">4. 模型何时开口</span></span></h4><div class="notion-text notion-block-edf9da34a84f44659f874c0ec5195156">传统语音助手依赖 VAD 判断“用户说完了”。在视频场景里，轮次边界不再只由声音决定：</div><ul class="notion-list notion-list-disc notion-block-1e8aec5cc4e24a22b97c39e4092ab9d6"><li>用户可能沉默地演示一个动作，期待模型及时纠错；</li></ul><ul class="notion-list notion-list-disc notion-block-4ba914f161da4171a14c2933a9a49cde"><li>用户说“你看这里”，真正的信息在随后两秒的画面里；</li></ul><ul class="notion-list notion-list-disc notion-block-f25384f2a4884b3980c230ffe4ade3e0"><li>模型发现危险时应该主动打断；</li></ul><ul class="notion-list notion-list-disc notion-block-8bac89b4f36c45cf91d329241aa63edc"><li>用户只是短暂停顿或转身拿工具，模型不应抢话。</li></ul><div class="notion-text notion-block-87470954fc854503a62d13fad04bd265">这推动了三种机制：</div><ul class="notion-list notion-list-disc notion-block-3e74d7d6f7d74f04b522e6298c9cebb2"><li>外部 VAD / 语义 VAD 决定 turn；</li></ul><ul class="notion-list notion-list-disc notion-block-6d7ab80150fc4d7aab0761d0f6a62b44"><li>在主干上增加 Speak Head，单独学习听或说；</li></ul><ul class="notion-list notion-list-disc notion-block-fea1bdf5a78a41d588760c22f5781310"><li>把 <code class="notion-inline-code">[listen]</code>、<code class="notion-inline-code">[speak]</code>、<code class="notion-inline-code">[interrupt]</code> 等控制信号写进生成序列。</li></ul><div class="notion-text notion-block-f1e2cd57d8f24943bc80adf45cba2ba6">“回答什么”与“现在要不要回答”相关，但不是同一个预测任务。ROMA 把后者显式拆成二分类头，MiniCPM-o 把它做成流内控制。</div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-cb6371adb70048c48a29e0cbc9d58014" data-id="cb6371adb70048c48a29e0cbc9d58014"><span><div id="cb6371adb70048c48a29e0cbc9d58014" class="notion-header-anchor"></div><a class="notion-hash-link" href="#cb6371adb70048c48a29e0cbc9d58014" title="5. 深度思考怎样不阻塞自然交流"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">5. 深度思考怎样不阻塞自然交流</span></span></h4><div class="notion-text notion-block-2654e70a9cb34e5b81e6451e88f4c69a">人类对话里，简单回应可以立刻给出，复杂问题则会边说边想、查资料再补充。若模型必须完成整个 reasoning 或工具调用后才能发出第一段语音，它的能力越强，反而越像卡住。</div><div class="notion-text notion-block-f11beeeb979a4a8ca9de05aa8beb5f74">DuplexOmni 的核心不是换一个视觉编码器，而是把低延迟 Interaction Layer 与可插拔 Thinking Layer 解耦。前者维持“我在听、我先回应”的节奏，后者异步完成复杂推理，再把中间结果逐步回灌。这是流式多模态从“模型结构问题”走向“认知调度问题”的一个明显信号。</div><div class="notion-text notion-block-3aec0110d33180ffbf1fe8a21f6c68c9">&lt;ins/&gt;</div><hr class="notion-hr notion-block-7adcc23f04724580b137163d54bebf4e"/><h3 class="notion-h notion-h2 notion-h-indent-0 notion-block-78259db909114ddf92d17aecb79cfba7" data-id="78259db909114ddf92d17aecb79cfba7"><span><div id="78259db909114ddf92d17aecb79cfba7" class="notion-header-anchor"></div><a class="notion-hash-link" href="#78259db909114ddf92d17aecb79cfba7" title="三、路线一：客户端采帧，把视频降维成稀疏视觉事件"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">三、路线一：客户端采帧，把视频降维成稀疏视觉事件</span></span></h3><div class="notion-text notion-block-36106844845a466f8a8052eeddcfcc2d">这是目前最容易产品化、也最容易被误称为“实时视频模型”的路线。</div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-9bb210bf630348de8e05464e3d47b005" data-id="9bb210bf630348de8e05464e3d47b005"><span><div id="9bb210bf630348de8e05464e3d47b005" class="notion-header-anchor"></div><a class="notion-hash-link" href="#9bb210bf630348de8e05464e3d47b005" title="Gemini Live：一个持续会话，视频仍是逐张图片"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">Gemini Live：一个持续会话，视频仍是逐张图片</span></span></h4><div class="notion-text notion-block-06af3fc85c914ac3817dcb4578f0209e">Gemini Live 使用有状态 WebSocket。客户端持续发送 16 kHz PCM 音频，并将视频转成单张 JPEG 图片，官方限制最高 1 FPS；模型可返回 24 kHz PCM 音频，并支持打断。<a class="notion-link" href="https://ai.google.dev/gemini-api/docs/live-api" target="_blank" rel="noopener noreferrer">S1</a></div><div class="notion-text notion-block-e4b6666666b34ba19fcab6bb04311f05">从工程边界看，它的实时性主要落在会话协议与音频交互上：</div><div class="notion-text notion-block-893acfb97f1e4fbd93fe1674bfade0b5">这一设计有三个直接后果。</div><div class="notion-text notion-block-38092ea124964cdda99cc77657a53c47">第一，视觉成本与原始摄像头帧率脱钩。手机仍可 30 FPS 采集，但只有少量代表帧进入模型。第二，客户端握有采样策略，产品可以根据运动强度、场景变化或网络状态动态取帧。第三，模型端看不到采样间隔中的真实运动，所谓“视频理解”更接近带时间顺序的多图理解。</div><div class="notion-text notion-block-09bca3d608344572a3f4c4e955048e29">因此它适合：</div><ul class="notion-list notion-list-disc notion-block-e4f5f9ef0828413cbb0959b6bcfff1e3"><li>用户举起商品、零件或作业本，让助手识别并讲解；</li></ul><ul class="notion-list notion-list-disc notion-block-e8ce25f2e8464ffdbb88e3bbe9442260"><li>桌面摄像头低频观察场景，音频承担主要交互；</li></ul><ul class="notion-list notion-list-disc notion-block-36baf3d8ec454a4ea261a0b482981989"><li>对动作时序不敏感的导览、陪伴与远程协助。</li></ul><div class="notion-text notion-block-6afd7a5e194e42f8b7b8062901dbc704">它不适合精细动作纠错、手语、快速安全事件、球类轨迹和依赖视听亚秒同步的任务。</div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-add847000b0b4ddc95b2b6bb0bb67e89" data-id="add847000b0b4ddc95b2b6bb0bb67e89"><span><div id="add847000b0b4ddc95b2b6bb0bb67e89" class="notion-header-anchor"></div><a class="notion-hash-link" href="#add847000b0b4ddc95b2b6bb0bb67e89" title="Qwen Realtime：同样的 API 外形，背后连接 Omni 模型"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">Qwen Realtime：同样的 API 外形，背后连接 Omni 模型</span></span></h4><div class="notion-text notion-block-e23ddae3ddca49c6a2de4a8f311ab419">Qwen Realtime 同时提供 WebSocket 与 WebRTC。WebSocket 模式下，音频先进入缓冲区，图片可作为本地文件或实时视频帧持续追加；官方建议 JPEG、480p/720p、单帧不超过 256 KB、每秒不超过 1 帧，并要求先发送音频。WebRTC 模式则直接使用 RTP 音视频轨道。<a class="notion-link" href="https://docs.qwencloud.com/developer-guides/speech/realtime-multimodal-speech" target="_blank" rel="noopener noreferrer">S2</a></div><div class="notion-text notion-block-4c024a241f5545ffb79fcefb8c095ff8">这组约束透露了一个重要的系统事实：即便底层 Qwen3.5-Omni 能处理动态帧率视频，公开实时 API 仍会在接入层把摄像头流约束为稀疏帧。模型能力与产品服务边界不能混为一谈。</div><div class="notion-text notion-block-5e82efb109bc47ae9052c94aec712e3a">官方还为会话设置了视频累计时长、轮次和音频时长上限；不同 Plus / Flash 版本数值不同。<a class="notion-link" href="https://help.aliyun.com/en/model-studio/realtime" target="_blank" rel="noopener noreferrer">S17</a> 这不是无关紧要的计费细节，而是状态管理策略的一部分：实时会话要控制缓存增长、排队和尾延迟。</div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-0f55f04e1ec844089e3441bd9bdd4fc9" data-id="0f55f04e1ec844089e3441bd9bdd4fc9"><span><div id="0f55f04e1ec844089e3441bd9bdd4fc9" class="notion-header-anchor"></div><a class="notion-hash-link" href="#0f55f04e1ec844089e3441bd9bdd4fc9" title="这条路线真正值得优化的是采样器"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">这条路线真正值得优化的是采样器</span></span></h4><div class="notion-text notion-block-4bdf457a9e574f56993cfae161042ef3">固定 1 FPS 只是安全默认值，不是最优策略。更合理的客户端可以根据：</div><ul class="notion-list notion-list-disc notion-block-f4e649f6bb7745468fbd2355afe1a69b"><li>帧间视觉相似度；</li></ul><ul class="notion-list notion-list-disc notion-block-2c856dd242dc4e27826b8c2365fe28ba"><li>光流或运动幅度；</li></ul><ul class="notion-list notion-list-disc notion-block-63ff0fded48c4a9783441ac5128ac413"><li>用户语言中的指示词，如“现在”“这里”“这个动作”；</li></ul><ul class="notion-list notion-list-disc notion-block-7a34829736a549d0a6e5dc745d03c8e1"><li>模型反馈的不确定性；</li></ul><ul class="notion-list notion-list-disc notion-block-3877bbd4a24b49aab0b027865ed5de59"><li>网络带宽与排队长度；</li></ul><div class="notion-text notion-block-da6f5fb02afb48f28bdda2422d712025">动态决定何时送帧。也就是说，第一代实时视频助手的关键模块可能不是更大的 VLM，而是一个<b>面向回答价值的视觉采样控制器</b>。</div><div class="notion-text notion-block-397da23d06eb411c82a5433bcd19923a">Artic 的思路正沿这个方向推进：传输系统根据模型的响应能力和区域重要性调整码率与量化，而不再只优化人眼观看的 VMAF。后文会回到这一点。</div><hr class="notion-hr notion-block-c0c0c40ffb194382b9a99c608d620e18"/><h3 class="notion-h notion-h2 notion-h-indent-0 notion-block-515039a1b8a5409694b4bf6b5cd8c95b" data-id="515039a1b8a5409694b4bf6b5cd8c95b"><span><div id="515039a1b8a5409694b4bf6b5cd8c95b" class="notion-header-anchor"></div><a class="notion-hash-link" href="#515039a1b8a5409694b4bf6b5cd8c95b" title="四、路线二：分块编码与共享时间轴，让模型真正保留“正在发生”"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">四、路线二：分块编码与共享时间轴，让模型真正保留“正在发生”</span></span></h3><div class="notion-text notion-block-a5819cb031f64907890a50358acd56f4">稀疏帧解决了带宽，但没有自动解决持续状态。Qwen3.5-Omni 与 MiniCPM-o 4.5 给出了两种代表性实现。</div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-e1b6d5eff77f4f2fbe6bcb99019d7583" data-id="e1b6d5eff77f4f2fbe6bcb99019d7583"><span><div id="e1b6d5eff77f4f2fbe6bcb99019d7583" class="notion-header-anchor"></div><a class="notion-hash-link" href="#e1b6d5eff77f4f2fbe6bcb99019d7583" title="Qwen3.5-Omni：Thinker–Talker 上的动态时间对齐"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">Qwen3.5-Omni：Thinker–Talker 上的动态时间对齐</span></span></h4><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-3b5ef72024ad4c1899d25977695ffe62"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3A1ff45362-8721-456e-bdb2-f80a46420f58%3A02-qwen35-omni-architecture.svg?table=block&amp;id=3b5ef720-24ad-4c18-99d2-5977695ffe62&amp;t=3b5ef720-24ad-4c18-99d2-5977695ffe62" alt="notion image" loading="lazy" decoding="async"/></div></figure><div class="notion-text notion-block-cb04be04c22b4708a0d280638d68e01d"><em>图 2：Qwen3.5-Omni 的 Thinker–Talker 架构。视觉与 AuT 音频编码结果进入 Hybrid Attention MoE Thinker，Talker 再生成多码本语音 token，并由因果流式 codec decoder 输出波形。来源：Qwen Team, Qwen3.5-Omni Technical Report, Figure 2，CC BY 4.0。</em></div><div class="notion-text notion-block-6b293f81909c4d39a24256ae819310f7">Qwen3.5-Omni 沿用了 Thinker–Talker 分工，但把流式能力推进到编码、注意力与语音生成链路。</div><div class="notion-text notion-block-e8720e68780245b197718938260961f9"><b>输入怎样进入。</b> 视觉编码器接收图片和动态帧率视频。AuT 音频编码器将音频下采样 16 倍，得到约 6.25 Hz 的音频 token——每个 token 对应约 160 毫秒，并用动态注意力窗口兼顾局部低延迟与较长语义。<a class="notion-link" href="https://arxiv.org/abs/2604.15804" target="_blank" rel="noopener noreferrer">S3</a></div><div class="notion-text notion-block-38bfad692f6844d3a480964fbb24d735"><b>时间怎样对齐。</b> 模型使用 TMRoPE，把视频和音频映射到统一时间坐标。报告描述的关键做法是：视频可以是动态 FPS，音频和视频时间 ID 以 160 毫秒为分辨率推进，同时可加入显式 timestamp text。这使“某一帧”和“某一段声音”不必靠序列位置碰巧相邻。<a class="notion-link" href="https://arxiv.org/abs/2604.15804" target="_blank" rel="noopener noreferrer">S3</a></div><div class="notion-text notion-block-32bba756b96e475f8a8c3c00c0ad36bb"><b>状态怎样保留。</b> Thinker 并不会在每个时间点重新计算完整的音视频窗口。新到达的多模态块经过编码后，只对新增 token 执行 chunked prefill；历史则以 full-attention 层的 KV Cache 和 Gated DeltaNet 层的递归状态两种形式继续参与计算。<a class="notion-link" href="https://arxiv.org/abs/2604.15804" target="_blank" rel="noopener noreferrer">S3</a></div><h5 class="notion-h notion-h4 notion-h-indent-2 notion-block-2ce2f9e57cd646889f6d37d0527b4a11" data-id="2ce2f9e57cd646889f6d37d0527b4a11"><span><div id="2ce2f9e57cd646889f6d37d0527b4a11" class="notion-header-anchor"></div><a class="notion-hash-link" href="#2ce2f9e57cd646889f6d37d0527b4a11" title="Chunked prefill：逻辑上看到全部历史，实际只计算新块"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">Chunked prefill：逻辑上看到全部历史，实际只计算新块</span></span></h5><div class="notion-text notion-block-6a52a8d0afc54914b89d6e89b06ef2ac">先区分“模型此刻能够利用的逻辑上下文”和“本次前向真正送入的 token”。假设音视频流被切成 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 三个时间块，普通无状态调用会反复提交完整输入；有状态的流式 prefill 则逐块追加：</div><div class="notion-text notion-block-9d91502e2c6a42eb939665a5e0c14e2c">处理 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 时，Thinker 在逻辑上可以利用 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span>，但送入<b>主干</b>做本次 prefill 的通常只有 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 新产生的 embedding。<span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 和 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 已经进入主干缓存，不需要重新执行整条 Hybrid MoE 前向。</div><div class="notion-text notion-block-fb2ef8f3832547bf9313144c35041756">这里要把 encoder 和主干分开看。<span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 的原始音频与视频仍需经过各自 encoder，才能变成新增 embedding；至于应用再次提交重叠帧时，历史原始帧会不会重新编码，则取决于运行时是否只摄取新数据、是否缓存 encoder 输出。技术报告确认音视频 encoder 能沿时间维输出 chunk、Thinker 支持 chunked prefill，但没有公开线上服务的视觉特征缓存策略。因此，可以确定的是“进入 Thinker 的历史 token 不做完整主干重算”，不能仅凭 chunked prefill 推导出“任何历史画面都绝不会再次经过视觉 encoder”。<a class="notion-link" href="https://arxiv.org/abs/2604.15804" target="_blank" rel="noopener noreferrer">S3</a></div><div class="notion-text notion-block-f3170da0ed2349289e50fc04dc826aac">“chunked”表示一次摄取一块新 token，而不是像自回归解码那样每次只处理一个 token。假设历史长度为 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span>，新块包含 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 个 token，模型会并行处理位置 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 到 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span>。chunk 内仍使用因果 mask：第一个新 token 只能读取历史，第二个还可以读取第一个，依此类推。这样既保留了流式因果性，又能利用 GPU 的块状矩阵计算。</div><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-7dfb608b43b34e4eb070f6210552cb1d"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3A6298a14d-240f-42b5-8369-faffbb513d9a%3A02b-qwen-chunked-prefill-state.svg?table=block&amp;id=7dfb608b-43b3-4e4e-b070-f6210552cb1d&amp;t=7dfb608b-43b3-4e4e-b070-f6210552cb1d" alt="notion image" loading="lazy" decoding="async"/></div></figure><div class="notion-text notion-block-19494f2e1c294a339ea5486e7474c9b5"><em>图 2.1：本文根据 Qwen3.5-Omni 报告与 Qwen3.5 Hybrid Attention 结构重绘。进入 Thinker 主干的新增 token 只做一次增量 prefill；full-attention 层追加 KV，GDN 层更新固定形状的递归状态。图中不假设服务端一定缓存视觉 encoder 输出。</em></div><h5 class="notion-h notion-h4 notion-h-indent-2 notion-block-e7c15323e5c64f5bbc25a9cc91014228" data-id="e7c15323e5c64f5bbc25a9cc91014228"><span><div id="e7c15323e5c64f5bbc25a9cc91014228" class="notion-header-anchor"></div><a class="notion-hash-link" href="#e7c15323e5c64f5bbc25a9cc91014228" title="Full attention：旧 token 保留 K/V，新 token 只计算自己的 Q/K/V"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">Full attention：旧 token 保留 K/V，新 token 只计算自己的 Q/K/V</span></span></h5><div class="notion-text notion-block-a2e0a948f1d242c5949eff2779cac185">在 full-attention 层，历史 token 已经产生了 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 和 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span>。新块到来时，只需计算：</div><span role="button" tabindex="0" class="notion-equation notion-equation-block"><span></span></span><div class="notion-text notion-block-8fadff96d96e453c84fa36b8de387e98">随后，新 query 同时读取历史 KV 与本块前序位置：</div><span role="button" tabindex="0" class="notion-equation notion-equation-block"><span></span></span><div class="notion-text notion-block-ddb0775820cb4e99b943f0e14805a643">处理完毕后，<span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 被追加进 KV Cache，供下一个音视频块使用。旧 token 的 hidden state 不需要更新，因为因果模型中位置 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 的表示只依赖 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 及其之前的信息，未来 token 的到来不会改变它。</div><div class="notion-text notion-block-a4dc4d4c9ebe48b9808454069d43b0c7">若忽略常数和头数，重新计算长度 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 的完整前缀需要约 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 的注意力计算；复用 KV 后，新块只需约 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span>。它省掉了旧 token 之间已经完成的计算。不过，新 query 仍要读取历史 KV，因此上下文越长，full-attention 层的显存占用与 KV I/O 仍会增长。</div><h5 class="notion-h notion-h4 notion-h-indent-2 notion-block-e456c0e6ccb84020ac193fdd23815820" data-id="e456c0e6ccb84020ac193fdd23815820"><span><div id="e456c0e6ccb84020ac193fdd23815820" class="notion-header-anchor"></div><a class="notion-hash-link" href="#e456c0e6ccb84020ac193fdd23815820" title="Gated DeltaNet：历史被压进递归状态，而不是逐 token KV"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">Gated DeltaNet：历史被压进递归状态，而不是逐 token KV</span></span></h5><div class="notion-text notion-block-7374fcf7a4314cb59336aa4b0d8acd07">Gated DeltaNet（GDN）走的是另一条路。它不会为每个历史 token 保存一对完整 K/V，而是把过去的信息连续更新到一个固定形状的状态 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 中。省略具体门控和 delta rule 后，可以把单步过程写成：</div><span role="button" tabindex="0" class="notion-equation notion-equation-block"><span></span></span><span role="button" tabindex="0" class="notion-equation notion-equation-block"><span></span></span><div class="notion-text notion-block-ed7fd5109423422996ffcd973cc9baa6">当一个包含 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 个 token 的新块到来时，GDN 从块开始前的 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 出发，依次吸收新块信息，最后得到 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span>。实现时可以使用面向 chunk 的并行 scan / kernel，不必从第一个历史 token 重新递推。下一块只需要接着这个最终状态继续更新。</div><div class="notion-text notion-block-5fb80d023cf045d5956add44a9c2e7b0">因此，两类层保存的“历史”并不相同：</div><ul class="notion-list notion-list-disc notion-block-16a89511adf849e5b4d17055a71d2259"><li>full-attention 层保存随上下文增长的 token 级 K/V，能够让新 query 精确访问具体历史位置；</li></ul><ul class="notion-list notion-list-disc notion-block-00b9d4c2acee4cc8a20130d5818b0135"><li>GDN 层保存固定形状的递归状态，避免在每一层搬运完整历史 KV；</li></ul><ul class="notion-list notion-list-disc notion-block-4364af356b554fdb82fcc0a26b5eddbb"><li>Hybrid backbone 将二者交错：GDN 承担更便宜的长序列状态传播，间隔出现的 full attention 保留精确的全局 token 交互能力；</li></ul><ul class="notion-list notion-list-disc notion-block-11bc28d3d0a9418484ab08b2e9694e6d"><li>MoE 解决的是每个新 token 激活哪些前馈专家，降低计算量，但不负责会话状态的保存。</li></ul><div class="notion-text notion-block-6f2c0f6f9ba84b65bcbd43b76a48774d">这就是报告所说 GDN 能降低长音视频推理中的 KV-cache I/O 的具体含义：它不是“把所有旧 KV 压缩后仍按 token 查询”，而是把一部分层改造成递归状态机。Qwen3.5 系列公开实现采用 GDN 与 full attention 的混合层布局；Qwen3.5-Omni 报告确认 Thinker 和 Talker 都使用包含 GDN 的 Hybrid MoE，但没有公开每个 Omni 版本的完整层数和服务端缓存配置。<a class="notion-link" href="https://arxiv.org/abs/2604.15804" target="_blank" rel="noopener noreferrer">S3</a><a class="notion-link" href="https://huggingface.co/docs/transformers/model_doc/qwen3_5" target="_blank" rel="noopener noreferrer">S19</a></div><h5 class="notion-h notion-h4 notion-h-indent-2 notion-block-3e30f6af5d6346edb69af2b88176efd8" data-id="3e30f6af5d6346edb69af2b88176efd8"><span><div id="3e30f6af5d6346edb69af2b88176efd8" class="notion-header-anchor"></div><a class="notion-hash-link" href="#3e30f6af5d6346edb69af2b88176efd8" title="套回滑动窗口： 到  是否重算"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">套回滑动窗口：<span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 到 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 是否重算</span></span></h5><div class="notion-text notion-block-1ee663aea92044d2abbadf4195ebcf28">如果上一个时刻的逻辑窗口是：</div><span role="button" tabindex="0" class="notion-equation notion-equation-block"><span></span></span><div class="notion-text notion-block-b53618db64a04cf6a1858cfcc478a5af">当前窗口是：</div><span role="button" tabindex="0" class="notion-equation notion-equation-block"><span></span></span><div class="notion-text notion-block-fc4b90ac67d04f00a499a8c37ad71193">那么在有状态流式推理里，不应把整个 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 当作一条新 prompt 再算一次。真正新增的只有 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span>：</div><div class="notion-text notion-block-8ebc5795877a4507afe7a12834f2f37e">如果应用每次都把完整 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 发给一个无状态接口，并且服务端没有 prefix cache，窗口内 token 才会被全部重新计算。</div><div class="notion-text notion-block-41c8e26bb2624e538dbabe71b824dcb6">严格的固定长度滑窗还有一个边界。full-attention KV Cache 可以淘汰最旧位置，使新 query 不再访问它；但 GDN 的递归状态已经吸收了早期 token，一般不能精确地把某个最旧 token 的贡献“减掉”。因此，Qwen3.5-Omni 更适合被理解为<b>前缀状态持续增长或累积</b>，而不是每一步都执行可逆的固定 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 长度滑窗。256K 是模型训练和支持的最大逻辑上下文，并不表示每次流式更新都会重新计算 256K token；超过上限后采用截断、重建、摘要还是其他缓存回收方式，技术报告没有公开。<a class="notion-link" href="https://arxiv.org/abs/2604.15804" target="_blank" rel="noopener noreferrer">S3</a></div><div class="notion-text notion-block-d103ef8aa0dd4a7294ce6a46c98a7764"><b>输出怎样流出。</b> Talker 不直接生成完整波形，而是通过多 token 预测生成 RVQ codec token，因果式 Code2Wav 再把已到达的 codec 块立刻解码成语音。ARIA（Adaptive Rate Interleave Alignment）用于协调文本 token 与语音 token 的不同生成速率，避免固定比例把语音节奏绑死。<a class="notion-link" href="https://arxiv.org/abs/2604.15804" target="_blank" rel="noopener noreferrer">S3</a></div><div class="notion-text notion-block-81c0504b51fa40e3924efbbd955f5aaa">这是一条非常典型的“<b>统一理解主干 + 独立流式语音解码</b>”路线。它能持续看和听，能低延迟说，但输出视频不在生成闭环里，因此属于 L2，而不是原生 AV2AV。</div><div class="notion-text notion-block-4ea1ac75dec74255b2a1e31d9373a081">报告给出了视频输入在单并发下的首包时延：Flash 约 426 ms、Plus 约 651 ms；音频分别约 235 ms、435 ms。<a class="notion-link" href="https://arxiv.org/abs/2604.15804" target="_blank" rel="noopener noreferrer">S3</a> 这些数字只适合说明同一报告内的相对量级，不能与其他项目的“首个音频块”“模型侧 latency”直接横比，因为输入长度、网络、硬件和计时边界都不同。</div><div class="notion-text notion-block-3aec0110d3318038b17bd94c067b2136">&lt;ins/&gt;</div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-38f61f24afba4aba8f973fed24f7025d" data-id="38f61f24afba4aba8f973fed24f7025d"><span><div id="38f61f24afba4aba8f973fed24f7025d" class="notion-header-anchor"></div><a class="notion-hash-link" href="#38f61f24afba4aba8f973fed24f7025d" title="MiniCPM-o 4.5：Omni-Flow 把输入和输出切到同一条流"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">MiniCPM-o 4.5：Omni-Flow 把输入和输出切到同一条流</span></span></h4><div class="notion-text notion-block-d253db91373e4314acf4825029fd734c">MiniCPM-o 4.5 的实现更适合观察“流式模型内部到底存什么”。它不是简单地把图片和音频拼进 prompt，而是把环境输入与模型输出组织成连续时间窗。<a class="notion-link" href="https://arxiv.org/abs/2604.27393" target="_blank" rel="noopener noreferrer">S4</a></div><h5 class="notion-h notion-h4 notion-h-indent-2 notion-block-03729f12a8724a4b81967ed36d912497" data-id="03729f12a8724a4b81967ed36d912497"><span><div id="03729f12a8724a4b81967ed36d912497" class="notion-header-anchor"></div><a class="notion-hash-link" href="#03729f12a8724a4b81967ed36d912497" title="先分清 MiniCPM-o 4.5 与 Omni-Flow"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">先分清 MiniCPM-o 4.5 与 Omni-Flow</span></span></h5><div class="notion-text notion-block-a1dddf053a4d4f6280b78a30af41ea8d"><b>MiniCPM-o 4.5 是一套具体的多模态模型与推理系统，Omni-Flow 则是它实现全双工交互时采用的建模和执行范式。</b> 前者回答“哪些模块负责理解和生成”，后者回答“输入、控制和输出怎样沿时间排列，状态怎样跨时间窗延续”。两者不是并列的两个模型，Omni-Flow 也不是一层可以单独画在网络结构里的神经模块。<a class="notion-link" href="https://arxiv.org/abs/2604.27393" target="_blank" rel="noopener noreferrer">S4</a><a class="notion-link" href="https://huggingface.co/openbmb/MiniCPM-o-4_5" target="_blank" rel="noopener noreferrer">S20</a></div><div class="notion-text notion-block-276cc753904b4907b9e31aabd4f5f0cb">因此，<code class="notion-inline-code">streaming_prefill</code> 和 <code class="notion-inline-code">streaming_generate</code> 是公开实现用来执行 Omni-Flow 的接口，不是 Omni-Flow 本身；而 Qwen3-8B、视觉与音频 encoder、语音 decoder 才是实际参与计算的模型组件。概念上可以把 Omni-Flow 理解为 MiniCPM-o 4.5 的“全双工运行规则”，公开代码中的状态结构和接口则是这套规则的具体落地。<a class="notion-link" href="https://huggingface.co/openbmb/MiniCPM-o-4_5" target="_blank" rel="noopener noreferrer">S20</a></div><h5 class="notion-h notion-h4 notion-h-indent-2 notion-block-762a249c6a2a45dca9188e50dd29071a" data-id="762a249c6a2a45dca9188e50dd29071a"><span><div id="762a249c6a2a45dca9188e50dd29071a" class="notion-header-anchor"></div><a class="notion-hash-link" href="#762a249c6a2a45dca9188e50dd29071a" title="先看实际结构：不是两套名为 Thinker–Talker 的大模型"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">先看实际结构：不是两套名为 Thinker–Talker 的大模型</span></span></h5><div class="notion-text notion-block-4b852ecd6aaa46ef859e4abf856759b9">这里需要先校正一个容易由术语产生的误解：<b>Omni-Flow 不是一对叫作 Thinker 和 Talker 的模型模块，而是把输入、控制和输出排列到共享时间轴上的序列化与交互框架。</b> MiniCPM-o 4.5 的实际模型结构更接近“一个中心语义主干，加一条轻量语音生成链”。<a class="notion-link" href="https://arxiv.org/abs/2604.27393" target="_blank" rel="noopener noreferrer">S4</a><a class="notion-link" href="https://huggingface.co/openbmb/MiniCPM-o-4_5" target="_blank" rel="noopener noreferrer">S20</a></div><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-6e702810e3b3468bad415ee6e3d4fec4"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3A27f44264-e0f5-46f2-85b1-dec6d35d3e00%3A03a-minicpmo-end-to-end-architecture.svg?table=block&amp;id=6e702810-e3b3-468b-ad41-5ee6e3d4fec4&amp;t=6e702810-e3b3-468b-ad41-5ee6e3d4fec4" alt="notion image" loading="lazy" decoding="async"/></div></figure><div class="notion-text notion-block-5b646f96a5dc46b882c0324f4e8f07d2"><em>图 3：本文根据 MiniCPM-o 4.5 论文与公开实现重绘的端到端结构。图中的 thinker-like / talker-like 只是功能类比，不是论文定义的模块名。</em></div><div class="notion-text notion-block-367adb346fb84960a2cfc3528735302b">视觉和音频先由各自的 encoder 压缩成 embedding，再共同进入唯一的 <b>Qwen3-8B</b> 主干。这个主干承担三类工作：理解当前音视频和历史上下文；生成 <code class="notion-inline-code">&lt;|listen|&gt;</code> / <code class="notion-inline-code">&lt;|speak|&gt;</code> 控制；在需要开口时生成文本 token 及其 hidden states。论文给出的全双工文本解码速度约为每秒 3—4 个 token。<a class="notion-link" href="https://arxiv.org/abs/2604.27393" target="_blank" rel="noopener noreferrer">S4</a></div><div class="notion-text notion-block-dc9e1ecc2cef4719a089f2ae40f002df">当主干决定说话时，新增文本 token 与对应的 LLM hidden states 会一起送入约 <b>0.3B 的轻量 Llama 语音 token decoder</b>。它不重新理解视频和音频，而是把主干已经形成的语义表示展开为约 25 token/s 的 S3 语音 token；之后，流式 flow-matching decoder 再结合参考音频，把这些语音 token 增量还原成可播放波形。TAIL 位于文本与语音时间线之间，负责限制文本前瞻并协调语音生成和实际播放进度。<a class="notion-link" href="https://arxiv.org/abs/2604.27393" target="_blank" rel="noopener noreferrer">S4</a></div><div class="notion-text notion-block-c18d2e5e53b440e0be6ffaba180c95f4">因此，如果只讨论功能，可以把 Qwen3-8B 称为 <b>thinker-like</b>，把“语音 token decoder + 波形 decoder”称为 <b>talker-like</b>；但它和 Qwen3.5-Omni 的显式 Thinker–Talker 架构并不相同。MiniCPM-o 没有另一套与语义主干对称的 Talker Hybrid MoE，也不是两套大主干各自持续推理；它是<b>中心 LLM 先给出控制、文本与 hidden states，轻量声学生成链再消费这些状态</b>。所谓全双工主要来自跨时间窗的重叠：模型一边播放上一窗生成的语音，一边继续摄取下一窗的画面和声音。</div><h5 class="notion-h notion-h4 notion-h-indent-2 notion-block-25e2a2d431134337ac9bb88beeac99cf" data-id="25e2a2d431134337ac9bb88beeac99cf"><span><div id="25e2a2d431134337ac9bb88beeac99cf" class="notion-header-anchor"></div><a class="notion-hash-link" href="#25e2a2d431134337ac9bb88beeac99cf" title="视觉与音频先被压到相近量级"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">视觉与音频先被压到相近量级</span></span></h5><div class="notion-text notion-block-e9beae5f77954f7f8001f60ac082d030">MiniCPM-o 4.5 使用约 0.4B 的 SigLIP 视觉模块。一张图片可按 slice 处理，每个 slice 原本有 1024 个 token，再经 resampler 压缩为 64 个，压缩比 16 倍。全双工设置下单 slice 最大约 448×448。<a class="notion-link" href="https://arxiv.org/abs/2604.27393" target="_blank" rel="noopener noreferrer">S4</a></div><div class="notion-text notion-block-7bf4312d4ba443638db1af0bc6fa2794">音频侧使用约 0.3B 的 Whisper Medium。原始编码约 50 token/s，再压缩 5 倍到 10 token/s。这样音频和低帧率视觉可以在同一秒内进入主干，而不会让视觉 token 完全淹没其他模态。<a class="notion-link" href="https://arxiv.org/abs/2604.27393" target="_blank" rel="noopener noreferrer">S4</a></div><h5 class="notion-h notion-h4 notion-h-indent-2 notion-block-efb95c73b5e54695be175cb846895f11" data-id="efb95c73b5e54695be175cb846895f11"><span><div id="efb95c73b5e54695be175cb846895f11" class="notion-header-anchor"></div><a class="notion-hash-link" href="#efb95c73b5e54695be175cb846895f11" title="Omni-Flow 不再把输入、回答当作两个阶段"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">Omni-Flow 不再把输入、回答当作两个阶段</span></span></h5><div class="notion-text notion-block-dc4a6fb88b1245b593e5b093c281166f">上面的模型结构说明“由哪些模块计算”；接下来沿一个时间窗展开 Omni-Flow，看这些模块接收的输入和产生的输出如何进入同一条因果序列。</div><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-10d9cea2f8134aee8381d5d041fdcd94"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3Ab785d88f-20c0-4427-b5c7-820ec47390fa%3A03-shared-timeline-and-trigger.svg?table=block&amp;id=10d9cea2-f813-4aee-8381-d5d041fdcd94&amp;t=10d9cea2-f813-4aee-8381-d5d041fdcd94" alt="notion image" loading="lazy" decoding="async"/></div></figure><div class="notion-text notion-block-4625577811e54abc9de141e39329cc32"><em>图 3.1：上半部分是本文根据 MiniCPM-o Omni-Flow 重绘的时间窗；下半部分是 ROMA 的显式 Speak Head。两者都把轮次问题改写为时间上的连续决策。</em></div><div class="notion-text notion-block-fa3d10eaabd34aecb7c1a9bfb74ab3ea">对时间窗 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span>，可以把流式单元抽象为：</div><span role="button" tabindex="0" class="notion-equation notion-equation-block"><span></span></span><div class="notion-text notion-block-eb44e6661812473ba08ae72947299dda">其中 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 是环境视觉，<span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 是环境音频，<span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 是模型在该窗的文本/语音输出，<span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 是 listen / speak 控制。模型没有输出时，不是留空，而是写入 <code class="notion-inline-code">[listen]</code>。于是“沉默”也成为可学习的序列状态。</div><div class="notion-text notion-block-780695a4e24f4565b8ac160d0809d36f">论文的消融值得注意：在其训练设置里，1.0 秒时间窗优于 0.2 秒和 0.1 秒；显式边界有帮助；独立的 Listen–Speak 控制也优于只靠文本内容暗示状态。<a class="notion-link" href="https://arxiv.org/abs/2604.27393" target="_blank" rel="noopener noreferrer">S4</a> 这说明更细的切片并不自动带来更好的实时性。调度次数、短块语义不足和训练分布都可能抵消理论上的低延迟。</div><h5 class="notion-h notion-h4 notion-h-indent-2 notion-block-6ad04f6259044240b3469efbce323b91" data-id="6ad04f6259044240b3469efbce323b91"><span><div id="6ad04f6259044240b3469efbce323b91" class="notion-header-anchor"></div><a class="notion-hash-link" href="#6ad04f6259044240b3469efbce323b91" title="TAIL 解决文本、语音和播放进度的错位"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">TAIL 解决文本、语音和播放进度的错位</span></span></h5><div class="notion-text notion-block-d35cd330412940af82e9bd8084ca5af7">主干大约生成 3—4 个文本 token/s，语音 decoder 则约 25 个 speech token/s。如果机械地按固定比例交错，文本可能思考得太快，语音来不及播放；也可能文字不足，声音被迫等待。<a class="notion-link" href="https://arxiv.org/abs/2604.27393" target="_blank" rel="noopener noreferrer">S4</a></div><div class="notion-text notion-block-e9896ad468704477a32b13c094b0c023">TAIL（论文中的时间对齐机制）根据累计播放进度动态调整当前生成的文本量，并限制前瞻范围。目标不是让所有模态 token 一一对齐，而是保证<b>可听见的输出时间线</b>不被文本解码节奏拖垮。</div><h5 class="notion-h notion-h4 notion-h-indent-2 notion-block-d8166fbc18d549b4839301910c0690f0" data-id="d8166fbc18d549b4839301910c0690f0"><span><div id="d8166fbc18d549b4839301910c0690f0" class="notion-header-anchor"></div><a class="notion-hash-link" href="#d8166fbc18d549b4839301910c0690f0" title="推理接口暴露了真正的状态边界"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">推理接口暴露了真正的状态边界</span></span></h5><div class="notion-text notion-block-638cef51b3174af3bb576a0fb2679ad8">有必要把 <code class="notion-inline-code">streaming_prefill</code> 和 <code class="notion-inline-code">streaming_generate</code> 展开，因为它们不是普通 chat API 的两个方便函数，而是 Omni-Flow 在推理时的直接落地。不过也要避免倒因为果：Omni-Flow 是训练和序列化范式，这两个接口只是公开实现用来执行每个时间窗的方法。</div><div class="notion-text notion-block-88510715ff5a40d3997cc67dfcf98c25">全双工模型先通过 <code class="notion-inline-code">as_duplex()</code> 切换模式，再由 <code class="notion-inline-code">prepare()</code> 初始化一次会话。<code class="notion-inline-code">prepare()</code> 会清空上次交互状态，将 system prompt 和可选的参考音频预填进主干，并初始化 TTS、Token2Wav 与滑动窗口状态。此后，每个约 1 秒的时间窗都运行同一个循环：<a class="notion-link" href="https://openbmb.github.io/MiniCPM-o-Demo/site/en/model.html" target="_blank" rel="noopener noreferrer">S5</a><a class="notion-link" href="https://huggingface.co/openbmb/MiniCPM-o-4_5" target="_blank" rel="noopener noreferrer">S20</a></div><div class="notion-text notion-block-2d3fa3b17d174d349cbcfcc4d7b09f1c">这不是“先听完整段，再回答”的两阶段流程。<code class="notion-inline-code">prefill → generate</code> 会在每个时间窗重复，前一个窗生成的输出和后一个窗新到达的环境输入都会进入同一条因果序列：</div><div class="notion-text notion-block-832c2bc9e2b14a04aeb975c7320abe90">或者：</div><div class="notion-text notion-block-9b2f96d3c07549c2aa48ea9da14d20e5">下一秒到来时，<span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 直接追加在 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 后面。于是“监听”不是没有调用模型，也不是由外部 VAD 暂停生成，而是模型明确生成进历史的一种输出状态。</div><div class="notion-text notion-block-ff41b30e4d26416f9144f07d5e354bd1"><code class="notion-inline-code"><b>streaming_prefill</b></code><b> 负责把当前环境写进状态。</b> 源码会先判断这一窗属于 <code class="notion-inline-code">AUDIO</code>、<code class="notion-inline-code">VISION</code>、<code class="notion-inline-code">OMNI</code> 还是 <code class="notion-inline-code">TEXT</code>，然后写入 <code class="notion-inline-code">&lt;unit&gt;</code> 边界。视频帧经 SigLIP 与 resampler 变成视觉 embedding；音频经过支持增量 KV Cache 的 Whisper encoder、投影和池化后变成音频 embedding。两类 embedding 随后被送进 Qwen3 主干。主干更新自己的 KV Cache，但此时不展开完整回答，只保存最后位置产生的 <code class="notion-inline-code">pending_logits</code>。<a class="notion-link" href="https://huggingface.co/openbmb/MiniCPM-o-4_5" target="_blank" rel="noopener noreferrer">S20</a></div><div class="notion-text notion-block-7ee9cf243dcd4164922911bc0c73da97">可以把 <code class="notion-inline-code">pending_logits</code> 理解为“模型看完这一秒以后，对下一个控制 / 内容 token 的即时分布”。它连接了摄取和决策，使 <code class="notion-inline-code">streaming_generate</code> 不必再把这一秒的图像和音频重新前向一次。</div><div class="notion-text notion-block-61ffcbef307d4ec4b3e4097faaf947ca"><code class="notion-inline-code"><b>streaming_generate</b></code><b> 先决定 listen 还是 speak，再决定说什么。</b> 它直接消费 <code class="notion-inline-code">streaming_prefill</code> 留下的 <code class="notion-inline-code">pending_logits</code>。在论文采用的显式 Listen–Speak 控制里，第一个关键输出是 <code class="notion-inline-code">&lt;|listen|&gt;</code> 或 <code class="notion-inline-code">&lt;|speak|&gt;</code>：</div><ul class="notion-list notion-list-disc notion-block-0ea1bf23e9a84e20897aa8c56fc7ec26"><li>若为 <code class="notion-inline-code">&lt;|listen|&gt;</code>，该时间窗立即以 <code class="notion-inline-code">&lt;/unit&gt;</code> 结束，返回 <code class="notion-inline-code">is_listen=True</code> 和静音波形；</li></ul><ul class="notion-list notion-list-disc notion-block-585118eed513409d86ade027e45a66e4"><li>若为 <code class="notion-inline-code">&lt;|speak|&gt;</code>，主干在该窗内继续生成一小段文本，公开实现默认最多生成 20 个 speak/text token；</li></ul><ul class="notion-list notion-list-disc notion-block-c65141bc8ca245368a1cf5d5cf9bcd35"><li>新文本 token 对应的 LLM hidden states 被送入轻量语音 decoder，后者复用自己的 TTS KV Cache，生成约一秒的语音 token；</li></ul><ul class="notion-list notion-list-disc notion-block-c0193232b4714fa7b1485eb3dbbd34bc"><li>Token2Wav 再把语音 token 增量转换为可播放波形；如果轮次尚未结束，TTS 和 waveform cache 会保留给下一时间窗继续使用。<a class="notion-link" href="https://huggingface.co/openbmb/MiniCPM-o-4_5" target="_blank" rel="noopener noreferrer">S20</a></li></ul><div class="notion-text notion-block-8d0c1685a8e742089412fef162d7b99f">一次循环实际维护的不只是“一个 KV Cache”，而是几组生命周期不同的状态：</div><table class="notion-simple-table notion-block-2182a2b97610428f991f60b7927101ae"><tbody><tr class="notion-simple-table-row notion-simple-table-header-row notion-block-00f7de2305224e6096d249690ef52fae"><td class="" style="width:120px"><div class="notion-simple-table-cell">状态</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">由谁更新</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">保存什么</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">何时重置或回收</div></td></tr><tr class="notion-simple-table-row notion-block-fc61100f63d046f6a38586b915cb898e"><td class="" style="width:120px"><div class="notion-simple-table-cell">LLM / Omni-Flow 状态</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">prefill 与 generate 都会更新</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">system prompt、历次 <code class="notion-inline-code">&lt;unit&gt;</code>，以及视觉/音频 embedding、listen/speak 和文本产生的主干 KV</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">会话重置，或按 basic/context 滑动窗口回收</div></td></tr><tr class="notion-simple-table-row notion-block-f1ff25c79a3443099e99d43a0e808999"><td class="" style="width:120px"><div class="notion-simple-table-cell">音频 encoder 状态</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell"><code class="notion-inline-code">streaming_prefill</code></div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">Whisper encoder 的历史 KV、尚未消费的音频 buffer、chunk 计数</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">encoder 上下文到顶或会话重置</div></td></tr><tr class="notion-simple-table-row notion-block-2b0c1424383340c29c82dbbd2390d1ff"><td class="" style="width:120px"><div class="notion-simple-table-cell"><code class="notion-inline-code">pending_logits</code></div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">prefill 产生，generate 消费</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">当前时间窗末尾的下一 token 分布</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">每个时间窗只消费一次</div></td></tr><tr class="notion-simple-table-row notion-block-955306e7a0d3435aa8b30a04454158fe"><td class="" style="width:120px"><div class="notion-simple-table-cell">TTS 状态</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell"><code class="notion-inline-code">streaming_generate</code></div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">已生成语音 token 的 KV、文本进度和当前发言起点</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">一次发言结束后重置</div></td></tr><tr class="notion-simple-table-row notion-block-a7d5b08a0d7c4726a0424731bae4df50"><td class="" style="width:120px"><div class="notion-simple-table-cell">Token2Wav 状态</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell"><code class="notion-inline-code">streaming_generate</code></div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">尚未合成为波形的语音 token、flow / vocoder cache</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">发言结束并 flush 后重置</div></td></tr></tbody></table><div class="notion-text notion-block-00d63409de6644acb0099385dd19dd33">这种拆分解释了“全双工”是怎样出现的：模型在第 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 秒生成的语音可以继续播放；第 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 秒的新画面和环境音频仍可进入下一次 prefill，模型再根据更新后的现场决定续说、结束或保持监听。输入与输出在墙上时钟中重叠，但在因果 token 序列里仍按“本窗输入在前、本窗决策与输出在后”的顺序组织。</div><div class="notion-text notion-block-8d7ca7deaa424e3db9d6855bd75f785e">公开实现还在每个 <code class="notion-inline-code">&lt;/unit&gt;</code> 后登记时间单元，并提供两种长会话回收策略：<code class="notion-inline-code">basic</code> 只保留最近的 token；<code class="notion-inline-code">context</code> 额外保护 system prompt 与最近上下文。这里的滑窗是推理系统的缓存管理，不是 Omni-Flow 的训练定义。<a class="notion-link" href="https://openbmb.github.io/MiniCPM-o-Demo/site/en/model.html" target="_blank" rel="noopener noreferrer">S5</a><a class="notion-link" href="https://huggingface.co/openbmb/MiniCPM-o-4_5" target="_blank" rel="noopener noreferrer">S20</a></div><div class="notion-text notion-block-deec7e96f12d4e0db070900d31d0709c">还要区分模型仓库里的另一组同名方法。半双工 streaming 示例使用 <code class="notion-inline-code">streaming_prefill(session_id, msgs, ...)</code> 逐块摄取完整用户输入，等最后一个 chunk 到达后才调用一次 <code class="notion-inline-code">streaming_generate</code>；它的目标主要是降低回答的首 token 延迟。全双工 Omni-Flow 使用的则是 <code class="notion-inline-code">as_duplex()</code> 后的接口：每个时间窗都交替调用一次 prefill 和 generate，并在当窗输出 listen 或 speak。只看函数名，很容易把两者误认为同一种执行方式。<a class="notion-link" href="https://huggingface.co/openbmb/MiniCPM-o-4_5" target="_blank" rel="noopener noreferrer">S20</a></div><div class="notion-text notion-block-5465c735a7064a4eacd2cafa9d4a6846">对外的 Realtime API 又隐藏了这层区别。客户端只需通过 WebSocket 连续发送 <code class="notion-inline-code">input.append</code>——16 kHz 单声道 float32 PCM 和可选 JPEG 帧——并接收 <code class="notion-inline-code">listen</code>、<code class="notion-inline-code">text</code>、<code class="notion-inline-code">audio</code> 三类 <code class="notion-inline-code">response.output.delta</code>。Gateway 与 PyTorch 或 C++ worker 在内部驱动上述时间窗循环。<a class="notion-link" href="https://openbmb.github.io/MiniCPM-o-Demo/site/en/model.html" target="_blank" rel="noopener noreferrer">S5</a></div><div class="notion-text notion-block-fc73197c905a4e5e8aeac3f15f616028">因此，这两个接口最值得读者记住的不是名称，而是状态边界：<b>prefill 摄取当前一秒并留下下一 token 分布；generate 消费这份分布，完成 listen/speak 决策和当窗输出；两者共同把 Omni-Flow 的一个 </b><span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span><b> 写进持续会话。</b></div><div class="notion-text notion-block-f33c7ab4bc444b16ab0c27d1920e9f85">作者还声称模型可在低于 12 GB RAM 的边缘设备运行。<a class="notion-link" href="https://arxiv.org/abs/2604.27393" target="_blank" rel="noopener noreferrer">S4</a> 这应理解为特定量化、后端与配置下的项目目标，不宜直接推导成所有实时视频工作负载都能在消费设备上满速运行。</div><div class="notion-text notion-block-3aec0110d3318096b80add7db9a8fc1b">&lt;ins/&gt;</div><hr class="notion-hr notion-block-1c7db524f21d4729b7d5694cd765a467"/><h3 class="notion-h notion-h2 notion-h-indent-0 notion-block-42def830476243918bc4aae780595fee" data-id="42def830476243918bc4aae780595fee"><span><div id="42def830476243918bc4aae780595fee" class="notion-header-anchor"></div><a class="notion-hash-link" href="#42def830476243918bc4aae780595fee" title="五、路线三：把“何时说”从“说什么”里拆出来"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">五、路线三：把“何时说”从“说什么”里拆出来</span></span></h3><div class="notion-text notion-block-6ab06618a4ca4722ac0f350099e6ed89">共享时间轴让模型知道发生了什么，但并不能保证它学会自然轮次。ROMA 的设计很克制：它基本沿用 Qwen2.5-Omni，只新增一个很小的 Speak Head，把主动响应变成显式预测任务。<a class="notion-link" href="https://arxiv.org/abs/2601.10323" target="_blank" rel="noopener noreferrer">S6</a></div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-34c9e902f7434fb798ca44c01283b70e" data-id="34c9e902f7434fb798ca44c01283b70e"><span><div id="34c9e902f7434fb798ca44c01283b70e" class="notion-header-anchor"></div><a class="notion-hash-link" href="#34c9e902f7434fb798ca44c01283b70e" title="ROMA：一秒多模态单元 + 二分类触发头"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">ROMA：一秒多模态单元 + 二分类触发头</span></span></h4><div class="notion-text notion-block-1ffac09e3f3e4a8a8b826aac3883a82b">ROMA 将每 1 秒音频和同一秒的视频帧组成一个 multimodal unit。视频与音频 token 按固定顺序包装，使用 chunked TMRoPE：<a class="notion-link" href="https://arxiv.org/abs/2601.10323" target="_blank" rel="noopener noreferrer">S6</a></div><ul class="notion-list notion-list-disc notion-block-e370d250cecc4282b910804f279c70cb"><li>同一单元内的视频 token 共享时间 ID；</li></ul><ul class="notion-list notion-list-disc notion-block-b3cc7da3aa524ba9b1ebb5fa4d2a75bc"><li>音频 token 按 40 ms 分辨率推进；</li></ul><ul class="notion-list notion-list-disc notion-block-6ef27bdaba34401b9a6faaaf4b7ec8ef"><li>后续单元延续全局时间 ID；</li></ul><ul class="notion-list notion-list-disc notion-block-5c961186df2a4788a7e2d6509b1da1a8"><li>历史通过持久 KV Cache 保留。</li></ul><div class="notion-text notion-block-cca38ea46ea042a495be54b8e6bd33c8">模型推理时以 2 FPS 读取视频，每帧像素数限制在 65,536 以内。论文报告单个流式单元的平均编码时间约 0.3697 秒，这让每秒一次的在线决策在其测试硬件上具备可行性。<a class="notion-link" href="https://arxiv.org/abs/2601.10323" target="_blank" rel="noopener noreferrer">S6</a></div><div class="notion-text notion-block-ced0aaa1d1c049558633de73424efe35">Speak Head 是一个两层 MLP，与语言模型输出头并行。它不是只看最后一层 hidden state，而是对最后 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 层做加权组合，然后每个流式单元输出一次“触发 / 不触发”。这样做的直觉是：中间层可能保留更多音视频时序线索，最后一层则更偏向下一个文本 token。<a class="notion-link" href="https://arxiv.org/abs/2601.10323" target="_blank" rel="noopener noreferrer">S6</a></div><div class="notion-text notion-block-55aee7748cd1461b9863bbf23e3e8759">训练分两阶段：</div><ol start="1" class="notion-list notion-list-numbered notion-block-7a741b4ae67740919a4fb1c249483645" style="list-style-type:decimal"><li>先做 streaming format alignment，让原本按完整轮次训练的 Omni 模型适应一秒一块的输入格式；</li></ol><ol start="2" class="notion-list notion-list-numbered notion-block-6ee878b45e1748d8b5392b34b335cedd" style="list-style-type:decimal"><li>再用 timing BCE 训练 Speak Head，同时保留一个较小权重的问答语言模型损失，避免模型只学会时机却丢掉回答能力。</li></ol><div class="notion-text notion-block-b641d1a20a294500ba30ccdd83432086">训练数据也围绕响应时机分层：约 2.7 万主动在线交互样本、10.9 万旁白样本、54 万反应式问答样本。这里“主动”不是营销标签，而是监督信号里真的存在“看见某事后，不等用户提问就开口”。<a class="notion-link" href="https://arxiv.org/abs/2601.10323" target="_blank" rel="noopener noreferrer">S6</a></div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-17e62407f6944091a36cf62ba2062972" data-id="17e62407f6944091a36cf62ba2062972"><span><div id="17e62407f6944091a36cf62ba2062972" class="notion-header-anchor"></div><a class="notion-hash-link" href="#17e62407f6944091a36cf62ba2062972" title="为什么一个小 Head 值得单列为路线"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">为什么一个小 Head 值得单列为路线</span></span></h4><div class="notion-text notion-block-881f0d55cf01439ebdd0eb7d800835c0">它提供了很强的工程可解释性：</div><ul class="notion-list notion-list-disc notion-block-9f32f03f71a34f2db02034c311c0eed6"><li>threshold 可以按场景调节，安全提醒宁可敏感，陪伴对话可以更克制；</li></ul><ul class="notion-list notion-list-disc notion-block-2da8c6c611554c9e8d1ce8c1cb2486a9"><li>Speak Head 可以单独做 ROC、误触发和漏触发评估；</li></ul><ul class="notion-list notion-list-disc notion-block-ced58bf1fb7549009f86d3df977e8b34"><li>主干模型与语音合成链路可以保持相对稳定；</li></ul><ul class="notion-list notion-list-disc notion-block-cd6190cd0a424aa086263146ba8e661d"><li>轮次数据量不够时，不必重训整套音视频生成模型。</li></ul><div class="notion-text notion-block-f7eda822eb8a47ef9c3029ef645114c7">代价也明显。每秒一次的二分类仍是粗粒度控制；它判断“现在是否说”，但重叠语音、被打断后的续接、后台工具调用等复杂交互仍需额外状态机。ROMA 更像是从回合制走向全双工的最小改造，而不是终点。</div><hr class="notion-hr notion-block-a072dfee91d04156b2b9eeff945a9ef3"/><h3 class="notion-h notion-h2 notion-h-indent-0 notion-block-27b7138dd7f1434198de04f37f197e20" data-id="27b7138dd7f1434198de04f37f197e20"><span><div id="27b7138dd7f1434198de04f37f197e20" class="notion-header-anchor"></div><a class="notion-hash-link" href="#27b7138dd7f1434198de04f37f197e20" title="六、路线四：交互层与思考层异步，让“先接住话”不必等“完全想清楚”"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">六、路线四：交互层与思考层异步，让“先接住话”不必等“完全想清楚”</span></span></h3><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-5aef767bf675498db36f35a08164ea81"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3A1b55b295-ebbb-4fc9-9617-baef51398424%3A05-duplexomni-architecture.svg?table=block&amp;id=5aef767b-f675-498d-b36f-35a08164ea81&amp;t=5aef767b-f675-498d-b36f-35a08164ea81" alt="notion image" loading="lazy" decoding="async"/></div></figure><div class="notion-text notion-block-2fadbbc2fbc14cc88778b8d7fbc1448b"><em>图 4：DuplexOmni 将实时 Interaction Layer 与可插拔 Thinking Layer 解耦；Interaction Model 内部再以时间片驱动 Thinker–Talker。来源：DuplexOmni, Figure 2。</em></div><div class="notion-text notion-block-047920d1f1be48b59cbaa3cdb502638b">许多全双工模型的矛盾是：交互要求 500 毫秒内有反应，复杂推理却可能需要数秒。DuplexOmni 把这个冲突变成架构边界。<a class="notion-link" href="https://arxiv.org/abs/2606.09186" target="_blank" rel="noopener noreferrer">S7</a></div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-e5fe5318b3964fc4bcc872df4d7beeea" data-id="e5fe5318b3964fc4bcc872df4d7beeea"><span><div id="e5fe5318b3964fc4bcc872df4d7beeea" class="notion-header-anchor"></div><a class="notion-hash-link" href="#e5fe5318b3964fc4bcc872df4d7beeea" title="先分清两组容易混淆的名字"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">先分清两组容易混淆的名字</span></span></h4><div class="notion-text notion-block-f16c6f0a70344464af61d0c141ae77ab">论文层面的 <b>Interaction Layer / Thinking Layer</b>，和 Interaction Model 内部的 <b>Thinker / Talker</b> 不是同一组模块：<a class="notion-link" href="https://arxiv.org/abs/2606.09186" target="_blank" rel="noopener noreferrer">S7</a><a class="notion-link" href="https://github.com/MuyeHuang/DuplexOmni" target="_blank" rel="noopener noreferrer">S21</a></div><ul class="notion-list notion-list-disc notion-block-a9959f4022d84f0fb2fb75a7dcfd2369"><li><b>Interaction Layer（S1）</b> 是整套实时 DuplexOmni 模型，负责持续听、看、控制节奏并输出文本和语音；</li></ul><ul class="notion-list notion-list-disc notion-block-1b3d328daab2401187c68fa0738d9c27"><li><b>Thinking Layer（S2）</b> 是外接的慢速推理或工具服务，可以是更强的 LLM、检索系统或 Agent；</li></ul><ul class="notion-list notion-list-disc notion-block-7024d39300224cddb1f6b7edea6212c5"><li><b>Thinker</b> 是 S1 内部的多模态语言主干；</li></ul><ul class="notion-list notion-list-disc notion-block-7ff76d554d2e43b081d0e4ff36872daa"><li><b>Talker</b> 也是 S1 内部的语音 codec 生成模块。</li></ul><div class="notion-text notion-block-56c34891be2b410fb8b18883b85978ee">因此，问“Interaction Layer 和 Thinking Layer 是否一起训练”时，答案是：<b>没有证据表明 S1 与外部 S2 做了端到端联合训练。</b> S2 是通过 OpenAI-compatible endpoint 接入的可插拔服务；论文实验的默认配置甚至直接使用 Gemini-3.1-Flash-Lite 作为 Thinking Layer。<b>训练的重点是让 S1 学会何时请求 S2、等待或取消，以及怎样把 S2 返回的片段组织成适合当前对话的表达，而不是把梯度反传进 S2。</b><a class="notion-link" href="https://arxiv.org/abs/2606.09186" target="_blank" rel="noopener noreferrer">S7</a><a class="notion-link" href="https://github.com/MuyeHuang/DuplexOmni" target="_blank" rel="noopener noreferrer">S21</a></div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-7c9c4164aeb44a9fa40363fa5109b813" data-id="7c9c4164aeb44a9fa40363fa5109b813"><span><div id="7c9c4164aeb44a9fa40363fa5109b813" class="notion-header-anchor"></div><a class="notion-hash-link" href="#7c9c4164aeb44a9fa40363fa5109b813" title="真正进入训练流水线的是 S1 内部的 Thinker 与 Talker"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">真正进入训练流水线的是 S1 内部的 Thinker 与 Talker</span></span></h4><div class="notion-text notion-block-f9c48a988dcb4e328be89413325ce5b0">DuplexOmni 从 Qwen3-Omni 初始化，进行两阶段 SFT：第一阶段用大规模语音交互数据建立基础的全双工听说能力，第二阶段用更高质量的复杂交互和视频通话数据强化打断、后台思考和视觉场景。<a class="notion-link" href="https://arxiv.org/abs/2606.09186" target="_blank" rel="noopener noreferrer">S7</a></div><div class="notion-text notion-block-5c0fdc8f140d4f5a95715e9c46beb84d">但 Thinker 与 Talker 也不是在同一个 step 里同时更新。论文描述的是<b>交替优化</b>：训练 Thinker 时冻结 Talker，只计算 Thinker 的交叉熵；训练 Talker 时冻结 Thinker，只计算 Talker MoE 与 MTP 的交叉熵，两部分数据比例为 1:1。公开训练 README 给出的标准路径更明确地采用<b>先训练 Thinker，再从 Thinker checkpoint 训练 Talker</b>，并注明不要求 joint training。两种表述的执行粒度略有区别，但共同点一致：Thinker 与 Talker 共享训练数据和接口约束，却没有同时接受一条端到端梯度。<a class="notion-link" href="https://arxiv.org/abs/2606.09186" target="_blank" rel="noopener noreferrer">S7</a><a class="notion-link" href="https://github.com/MuyeHuang/DuplexOmni" target="_blank" rel="noopener noreferrer">S21</a></div><div class="notion-text notion-block-9f82c93680a240998e5c5fc16ce9d2ec">可以把 Thinker 的监督写成 masked next-token cross-entropy：</div><span role="button" tabindex="0" class="notion-equation notion-equation-block"><span></span></span><div class="notion-text notion-block-ce2d76c9b4514ce9a2b31a988c5a2787">其中 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 包括按时间片组织的音频、视频、历史和 S2 feedback；<span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 是训练标签不等于 <code class="notion-inline-code">-100</code> 的位置。目标 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 不只是普通回答文本，还覆盖数据中显式标注的交互控制与语义输出，因此 Thinker 会学习“现在继续听、开始说、停止播放、请求或暂停后台思考”等行为。公开实时实现把这些结果具体解析为 <code class="notion-inline-code">asr</code>、<code class="notion-inline-code">tts</code>、<code class="notion-inline-code">tts_control</code> 和 <code class="notion-inline-code">system2_control</code>。<a class="notion-link" href="https://arxiv.org/abs/2606.09186" target="_blank" rel="noopener noreferrer">S7</a><a class="notion-link" href="https://github.com/MuyeHuang/DuplexOmni" target="_blank" rel="noopener noreferrer">S21</a></div><div class="notion-text notion-block-e1d85e3016f248d6a852511285dbdc21">Talker 的损失又分成两部分。主自回归分支预测每个 speech frame 的第 0 层 RVQ codec：</div><span role="button" tabindex="0" class="notion-equation notion-equation-block"><span></span></span><div class="notion-text notion-block-ee680db610ca4a4598b403e38d986dc5">MTP / code predictor 再根据 Talker hidden state、第 0 层 codec 和已经生成的残差层，预测其余 RVQ codebook：</div><span role="button" tabindex="0" class="notion-equation notion-equation-block"><span></span></span><div class="notion-text notion-block-7409695bd97a44019ddf7371b8ca82f5">源码中的统一形式是：</div><span role="button" tabindex="0" class="notion-equation notion-equation-block"><span></span></span><div class="notion-text notion-block-100ff4bcbbbd4b709e4592c66c31d75e">公开 Talker recipe 设置 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span>、<span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span>、<span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span>，同时冻结 language model 与 visual module，只训练 Talker；代码里最后一项变量仍叫 <code class="notion-inline-code">mlp_loss</code>，实际计算的是各残差 RVQ codebook 的 MTP cross-entropy。Thinker 阶段则使用标准语言模型交叉熵。这里没有一项“Interaction–Thinking alignment loss”，因为外部 S2 根本不在这条梯度图里。<a class="notion-link" href="https://github.com/MuyeHuang/DuplexOmni" target="_blank" rel="noopener noreferrer">S21</a></div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-c6673551c9d34d08930a4b561afe2a0d" data-id="c6673551c9d34d08930a4b561afe2a0d"><span><div id="c6673551c9d34d08930a4b561afe2a0d" class="notion-header-anchor"></div><a class="notion-hash-link" href="#c6673551c9d34d08930a4b561afe2a0d" title="推理时，S1 与 S2 通过控制 token 和流式片段协作"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">推理时，S1 与 S2 通过控制 token 和流式片段协作</span></span></h4><div class="notion-text notion-block-daae832c7fda4addba223f1ea8ca26c1">每个约 480 ms 的时间片，Interaction Layer 持续接收当前音频、同时间片采样的视频帧、对话历史，以及此前已经到达的 S2 片段。它不会因为发起慢思考而暂停：</div><div class="notion-text notion-block-41fc1bf080c642b992fd0ccfe3a93ee9">论文层面的协议是：S1 需要帮助时，把对话文本、视频信息与任务状态发给 S2；S2 用特殊控制 token 包装中间结果并流式返回；如果用户补充条件或任务已经变化，S1 可以停止当前 S2 输出，再用新上下文发起请求。S1 始终保留最终表达权——S2 返回的是“后台材料”，不是直接绕过 S1 播放给用户的答案。<a class="notion-link" href="https://arxiv.org/abs/2606.09186" target="_blank" rel="noopener noreferrer">S7</a></div><div class="notion-text notion-block-b2d96b445eac424f8e01f4e3e84adab4">公开实时服务给出了更具体的实现。S1 每片输出 <code class="notion-inline-code">system2_control</code>：<code class="notion-inline-code">[THINK]</code> 会创建一个异步 S2 streaming task，<code class="notion-inline-code">[WAIT]</code> 会停止或取消旧任务。S2 输出被拆成 <code class="notion-inline-code">【…】</code> 短片段放入队列，随后以 <code class="notion-inline-code">from_s2</code> 字段逐片注入后续 S1 请求；实现还在相邻 S2 片段之间加入约 0.5—1.0 秒的调度间隔，避免后台模型一次吐出过多文字，压垮实时说话节奏。如果 S1 生成 <code class="notion-inline-code">[STOP]</code>，服务会丢弃尚未播放的 Talker 音频并清空播放缓冲，用于处理打断。<a class="notion-link" href="https://github.com/MuyeHuang/DuplexOmni" target="_blank" rel="noopener noreferrer">S21</a></div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-a3f16850b92849c8a774f9cf1d27043c" data-id="a3f16850b92849c8a774f9cf1d27043c"><span><div id="a3f16850b92849c8a774f9cf1d27043c" class="notion-header-anchor"></div><a class="notion-hash-link" href="#a3f16850b92849c8a774f9cf1d27043c" title="S1 内部，Thinker 与 Talker 也按流水线解耦"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">S1 内部，Thinker 与 Talker 也按流水线解耦</span></span></h4><div class="notion-text notion-block-c4047a0a82b14e66ab13e2720344fd9a">在时间片 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span>，Thinker 生成 Assistant 文本 token、对应 embedding <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 和 hidden states <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span>。二者分别投影后逐位置相加，形成 Talker 条件：</div><span role="button" tabindex="0" class="notion-equation notion-equation-block"><span></span></span><div class="notion-text notion-block-f667862ac5bb47e89f5ca826eab1f1b2">Talker 的 prefix 不只包含当前 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span>，还保留此前各时间片的条件序列和完整 RVQ codec 历史。它在当前片生成六个 codec frame，对应约 480 ms 语音，再由 Code2Wav 解码。公开服务进一步把 Thinker、Talker 和 orchestrator 拆成独立服务：Thinker 先返回文本、token id 与对齐 hidden states，orchestrator 将这些张量放入异步队列，Talker worker 随后生成音频。这样下一轮感知与文本决策可以继续推进，不必和上一片语音生成严格串行。<a class="notion-link" href="https://arxiv.org/abs/2606.09186" target="_blank" rel="noopener noreferrer">S7</a><a class="notion-link" href="https://github.com/MuyeHuang/DuplexOmni" target="_blank" rel="noopener noreferrer">S21</a></div><div class="notion-text notion-block-bfa7fbaede3a4f498e1135004bda2a6c">Talker 复用 KV Cache 与 codec history，Thinker 和 Talker 再配合图执行优化，目标是让实时因子 RTF 小于 1——即生成一秒语音所需计算少于一秒。外层的 S1–S2 异步解决“慢思考阻塞交互”，内层的 Thinker–Talker 流水线解决“文本决策阻塞语音生成”；这是 DuplexOmni 实际上存在的两级解耦。</div><div class="notion-text notion-block-3aec0110d33180d790b8e7c2107e0728">&lt;ins/&gt;</div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-c63b3cf7ae5149fdbf1c699a9f233595" data-id="c63b3cf7ae5149fdbf1c699a9f233595"><span><div id="c63b3cf7ae5149fdbf1c699a9f233595" class="notion-header-anchor"></div><a class="notion-hash-link" href="#c63b3cf7ae5149fdbf1c699a9f233595" title="训练数据必须包含“对话中的不完美时序”"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">训练数据必须包含“对话中的不完美时序”</span></span></h4><div class="notion-text notion-block-115c9e1dbd3343dd86cf4c0278021872">DuplexOmni 使用 Writer–Director 方式构造包含重叠、沉默、补充、打断和延迟思考的训练场景。这个细节比模型参数量更值得关注：回合制语料里没有“用户在模型说到一半时插话”，结构再先进也学不会自然恢复。</div><div class="notion-text notion-block-45bd25593dfd4d7190c0a89e138f2389">公开模型卡显示权重采用 Apache-2.0 发布，Thinker 与 Talker 合计约 35B BF16；项目建议至少 8 张 H20 才能获得低延迟，并明确列出意外沉默和语音质量问题。<a class="notion-link" href="https://huggingface.co/MuyeHuang/DuplexOmni" target="_blank" rel="noopener noreferrer">S8</a> 这给出了一个很现实的定位：DuplexOmni 展示的是强全双工交互架构，不是轻量生产方案。</div><div class="notion-text notion-block-2d47fc962be6432fba3c26325bc439ed">论文表格给出约 0.506 秒 latency。<a class="notion-link" href="https://arxiv.org/abs/2606.09186" target="_blank" rel="noopener noreferrer">S7</a> 与 Qwen 或 Wan 的数字一样，应按该项目测量边界阅读，而非放进排行榜。</div><hr class="notion-hr notion-block-c0e51f03a44f4931bec74fb2d858a442"/><h3 class="notion-h notion-h2 notion-h-indent-0 notion-block-4e660800a33d4d40bcda7266243c494f" data-id="4e660800a33d4d40bcda7266243c494f"><span><div id="4e660800a33d4d40bcda7266243c494f" class="notion-header-anchor"></div><a class="notion-hash-link" href="#4e660800a33d4d40bcda7266243c494f" title="七、路线五：模态专家各算各的，但在同一个注意力空间里交流"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">七、路线五：模态专家各算各的，但在同一个注意力空间里交流</span></span></h3><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-63cc3f17d02347f8b9f835c64046a710"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3A54e33465-8c6b-46bd-b2c7-bbddd893d89b%3A06-ellsa-sa-moe.svg?table=block&amp;id=63cc3f17-d023-47f8-b9f8-35c64046a710&amp;t=63cc3f17-d023-47f8-b9f8-35c64046a710" alt="notion image" loading="lazy" decoding="async"/></div></figure><div class="notion-text notion-block-dcf010529f6b4038bbac0cbbda629617"><em>图 5：ELLSA 的 Self-Attention Mixture-of-Experts。Speech Expert 与 Action Expert 保留各自参数，但产生的 K/V 按同一因果序列进入统一注意力上下文。来源：ELLSA, Figure 1。</em></div><div class="notion-text notion-block-f532f7098ee6450fb9258340c5afbbd6">ELLSA 面向的不只是视频通话，而是机器人与具身交互：输入有语音和视觉，输出除了语音，还可能是离散动作。它采用 SA-MoE（Self-Attention Mixture-of-Experts）避免让一个稠密主干同时承担所有模态计算。<a class="notion-link" href="https://arxiv.org/abs/2510.16756" target="_blank" rel="noopener noreferrer">S9</a></div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-cbaefcf70c1a4beab0bd21a213484b94" data-id="cbaefcf70c1a4beab0bd21a213484b94"><span><div id="cbaefcf70c1a4beab0bd21a213484b94" class="notion-header-anchor"></div><a class="notion-hash-link" href="#cbaefcf70c1a4beab0bd21a213484b94" title="第一步不是“融合特征”，而是把四条流排成一条因果时间线"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">第一步不是“融合特征”，而是把四条流排成一条因果时间线</span></span></h4><div class="notion-text notion-block-83de63d62add426c8a6c7e6bb4b25d35">ELLSA 默认以一秒为一个 time block。第 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 个块不是简单地把四种 embedding 相加，而是构造成一段有固定语法的交错序列：<a class="notion-link" href="https://arxiv.org/abs/2510.16756" target="_blank" rel="noopener noreferrer">S9</a></div><div class="notion-text notion-block-305b7901309947c99150d89317d86ea7">这里的 <code class="notion-inline-code">&lt;bos&gt;</code> 是 begin-of-speech，不是通常语言模型里的 begin-of-sequence；<code class="notion-inline-code">boi</code>、<code class="notion-inline-code">bot</code>、<code class="notion-inline-code">boa</code> 分别表示 image、text 和 action 的开始。模态边界 token 同时承担两个功能：一是告诉模型当前区间该走哪个专家，二是把“什么时候说、什么时候动”变成可监督的序列预测问题。</div><div class="notion-text notion-block-bb8ba2c4c2734b638f373da84b1c1744">具体到每个块：</div><ul class="notion-list notion-list-disc notion-block-b04b572b25b64e80baf8b46aa921239e"><li><b>语音输入</b>先经过 32 层、hidden size 2048 的流式 Mamba encoder，以 25 Hz 产生表示；每 5 帧拼接一次，下采样到 5 Hz，所以一秒最终只向主干送入 5 个 speech embedding。</li></ul><ul class="notion-list notion-list-disc notion-block-0cb7bb17339e4e9f9e1aca22ae743afe"><li><b>视觉输入</b>由 Emu3-VisionTokenizer 离散化。在 LIBERO 设置里，每秒不是只有一张图，而是前视相机和夹爪相机各取一帧；时间采样仍然只有 1 Hz。</li></ul><ul class="notion-list notion-list-disc notion-block-92b74efe74ab4a9a99d07386e8d94fd4"><li><b>文本输出</b>每块最多生成 8 个 token。没有必要开口时，模型必须显式生成 <code class="notion-inline-code">&lt;silence&gt;</code>，而不是依赖外部 VAD 替它决定。</li></ul><ul class="notion-list notion-list-disc notion-block-c58cf287c3e0464dabf74826628bfaf0"><li><b>动作输出</b>由 FAST tokenizer 表示。公开的一秒配置每块生成约 10 个 action frame 对应的 token；不应移动时则生成 dummy action。</li></ul><div class="notion-text notion-block-0ae4f9a4a0ac4ba493bd661038c9c59e">固定顺序也确定了块内因果关系：当前动作可以依赖刚刚听到的语音、当前画面和本块生成的文本；文本可以依赖语音与画面，但不能反过来看到尚未生成的动作。跨块再按时间继续追加，因此整体仍是一条标准的 causal sequence。</div><div class="notion-text notion-block-a3b10c4760e044aabac69e1598c6a7e1">语音输出是一个例外：它不作为第五段 codec token 塞回主序列。ELLSA 从 Speech Expert 生成文本时的 hidden states 中抽取条件，经两层 MLP 投影后交给 CosyVoice2-0.5B。TTS 模块每 8 个文本 embedding 生成 25 个 speech codec。这样，文本承担“这一秒说什么”的语义骨架，codec 模型承担“怎样发声”。<a class="notion-link" href="https://arxiv.org/abs/2510.16756" target="_blank" rel="noopener noreferrer">S9</a><a class="notion-link" href="https://github.com/bytedance/SALMONN/tree/ELLSA" target="_blank" rel="noopener noreferrer">S22</a></div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-7a715ded4cfd40df82ffd2a64600eb87" data-id="7a715ded4cfd40df82ffd2a64600eb87"><span><div id="7a715ded4cfd40df82ffd2a64600eb87" class="notion-header-anchor"></div><a class="notion-hash-link" href="#7a715ded4cfd40df82ffd2a64600eb87" title="SA-MoE 不是常见的 Top-K MoE"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">SA-MoE 不是常见的 Top-K MoE</span></span></h4><div class="notion-text notion-block-ba5198d1c23f4f55b5a8981655f88053">“Speech Expert 与 Action Expert 共享注意力”很容易被理解成共享同一套 attention 权重，实际并不是。两套专家各自保留预训练得到的 Q/K/V projection、output projection、LayerNorm 和 MLP；所谓 unified self-attention，指的是它们产生的 K/V 按原始 token 顺序进入同一个因果注意力上下文。<a class="notion-link" href="https://arxiv.org/abs/2510.16756" target="_blank" rel="noopener noreferrer">S9</a><a class="notion-link" href="https://github.com/bytedance/SALMONN/tree/ELLSA" target="_blank" rel="noopener noreferrer">S22</a></div><div class="notion-text notion-block-4dbad9dfe6a64934ab4df3364cb62f2b">对第 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 层、第 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 个 token，先由模态边界确定专家：</div><span role="button" tabindex="0" class="notion-equation notion-equation-block"><span></span></span><div class="notion-text notion-block-78dd6ca4fb2748d39303508cad360c9f">然后只用该专家的投影计算当前位置的 query、key 和 value：</div><span role="button" tabindex="0" class="notion-equation notion-equation-block"><span></span></span><div class="notion-text notion-block-07c0529cfb304a62a5b3613c25b9154e">但注意力读取的是此前<b>所有专家</b>写入的统一 K/V 序列：</div><span role="button" tabindex="0" class="notion-equation notion-equation-block"><span></span></span><div class="notion-text notion-block-7b70697c67f84e9f8005e0f915940979">最后，attention output projection 和 MLP 又按 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 路由回对应专家。以一个 text token 为例：它的 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 来自 Speech Expert，却能注意到前面由 Action Expert 编码的前视图和夹爪图 K/V；以随后生成的 action token 为例，它用 Action Expert 的参数计算，但可以读取刚刚的语音、视觉和回答文本。因此，“专家各算各的”与“跨模态共享状态”同时成立。</div><div class="notion-text notion-block-418042b035a14d328200a01935b6cd95">它与普通 MoE 有三个关键区别：</div><ul class="notion-list notion-list-disc notion-block-ee2ed89f4231494a9fc7b2d8c0eccca8"><li>没有学习型 router，也没有 Top-K、负载均衡或 expert capacity；模态区间直接决定路由。</li></ul><ul class="notion-list notion-list-disc notion-block-c01825f345a74978aaf8807501ec700a"><li>一个位置只激活一套专家参数，但 attention 的历史不按专家隔离。</li></ul><ul class="notion-list notion-list-disc notion-block-b22588d2ae5d4062b669626f70ce9a93"><li>两个专家必须逐层对齐。ELLSA 恰好选择了配置相容的 Llama-3.1-8B-Instruct 与 Emu3-Base：都是 32 层、hidden size 4096、32 个 attention head 和 8 个 KV head，所以每一层都能直接交汇，构建 SA-MoE 本身不需要新增主干参数。两者保留各自的 RoPE 设置，但共享全局 token index。<a class="notion-link" href="https://arxiv.org/abs/2510.16756" target="_blank" rel="noopener noreferrer">S9</a></li></ul><div class="notion-text notion-block-af34cd48bdbe4bd99620932cdf3da618">这也是作者把 speech 与 text 合成一个专家、vision 与 action 合成另一个专家的原因：前者尽量继承 Llama 的语言能力，后者尽量继承 Emu3 / UniVLA 的视觉—动作能力。论文的三专家消融显示，继续把 speech/text 或 vision/action 拆开并没有带来稳定收益。</div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-813cbb8f6c324aa4ad3d54f7a6cf4074" data-id="813cbb8f6c324aa4ad3d54f7a6cf4074"><span><div id="813cbb8f6c324aa4ad3d54f7a6cf4074" class="notion-header-anchor"></div><a class="notion-hash-link" href="#813cbb8f6c324aa4ad3d54f7a6cf4074" title="推理时，一秒钟内实际发生什么"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">推理时，一秒钟内实际发生什么</span></span></h4><div class="notion-text notion-block-37cab4746a90433da7aee661b11f892b">可以顺着一个“机器人一边放碗、一边回答问题”的时间块看：</div><ol start="1" class="notion-list notion-list-numbered notion-block-c4742e6d3aa340e48e8c21ade5cdc78f" style="list-style-type:decimal"><li>Mamba encoder 增量编码这一秒新到达的语音，得到 5 个 speech embedding。</li></ol><ol start="2" class="notion-list notion-list-numbered notion-block-0d146fff27604a03b9b4fdc7a22a1b94" style="list-style-type:decimal"><li>系统抽取当前前视图和夹爪图，视觉 tokenizer 将两张图变成离散 token。</li></ol><ol start="3" class="notion-list notion-list-numbered notion-block-15a31dbefd1a43a299c5ea20ef692151" style="list-style-type:decimal"><li>SA-MoE 对“语音 → 图像”做 causal prefill，把两种专家产生的 K/V 写入同一缓存。</li></ol><ol start="4" class="notion-list notion-list-numbered notion-block-37e07872549140b9abd75e2e7aed0e4a" style="list-style-type:decimal"><li>Speech Expert 自回归生成最多 8 个 text token；若听到普通问题就回答，若无人说话则生成 <code class="notion-inline-code">&lt;silence&gt;</code>，若听到打断命令可生成 <code class="notion-inline-code">Action Cancelled</code>。</li></ol><ol start="5" class="notion-list notion-list-numbered notion-block-ff28315aa4b24518b266605391111350" style="list-style-type:decimal"><li>文本 hidden states 同时送往 CosyVoice 条件接口，生成该段话的 speech codec。</li></ol><ol start="6" class="notion-list notion-list-numbered notion-block-5ae0a575d8044279819d9d297082d6e2" style="list-style-type:decimal"><li>插入 <code class="notion-inline-code">&lt;boa&gt;</code> 后切换到 Action Expert，自回归生成 FAST action token。动作专家能看到本块文本，因此可以区分“继续动作并回答”和“停止动作并确认取消”。</li></ol><div class="notion-text notion-block-047510a570ce464b82b51f297912c3a0">这里的“同时说和做”是<b>同一时间块上的并发输出语义</b>，不意味着 GPU 在一个瞬间并行采样两串 token。公开参考实现仍按“文本在前、动作在后”的块内顺序解码；随后语音和动作覆盖同一个输出时间段。固定顺序换来的好处是因果关系明确，代价是动作必须等本块文本决策完成。</div><div class="notion-text notion-block-0c8876ef315f40d19b62fcad5cce3a4a">ELLSA 对不同历史采用不同保留策略：语音输入与文本输出保留完整会话历史，以维持对话连贯；视觉与动作只保留最近两秒，避免每秒数百个图像 token 让上下文迅速膨胀。这不是把过去画面“总结”进一个专门记忆模块，而是直接承认具身控制更依赖近期观测，语言对话更依赖长期历史。<a class="notion-link" href="https://arxiv.org/abs/2510.16756" target="_blank" rel="noopener noreferrer">S9</a></div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-103e6543234748b9abd678a4b5bdc32b" data-id="103e6543234748b9abd678a4b5bdc32b"><span><div id="103e6543234748b9abd678a4b5bdc32b" class="notion-header-anchor"></div><a class="notion-hash-link" href="#103e6543234748b9abd678a4b5bdc32b" title="两个专家怎样训练到能彼此读懂"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">两个专家怎样训练到能彼此读懂</span></span></h4><div class="notion-text notion-block-b447acdb7c1d4e3a9be810c53ec6f085">ELLSA 不是把 Llama 和 Emu3 拼起来后直接端到端全量训练，而是分三阶段降低能力互相覆盖的风险。<a class="notion-link" href="https://arxiv.org/abs/2510.16756" target="_blank" rel="noopener noreferrer">S9</a></div><div class="notion-text notion-block-0e0e6766c2c5466798dcfd3880cd5457"><b>第一阶段：分别建立专家。</b> Mamba speech encoder 先在 LibriHeavy 与 GigaSpeech 上预训练 300k steps；随后连接 Llama-3.1-8B，在 ASR 和 speech QA 上训练 40k steps，此时只训练连接器和 Llama LoRA，encoder 与 Llama 主体冻结。Action Expert 则直接继承 UniVLA：其 Emu3-Base 已经过 world-model post-training 和 policy learning，最后 1,024 个词表位置被替换成 FAST action token。</div><div class="notion-text notion-block-23cb219d75a943b590fcc99c3249d0e5"><b>第二阶段：训练 SA-MoE 的跨专家协作。</b> 两个专家都挂 rank 256、scale 1.0 的 LoRA，在 ASR、语音问答、语音条件机器人控制、边说边做、场景问答、错误指令拒绝和 action barge-in 的混合数据上训练。论文配置为 batch size 1024、学习率 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span>、500 steps。输入 speech embedding 和 image token 的 label 被 mask，只监督模型应该生成的 text 与 action token。<a class="notion-link" href="https://arxiv.org/abs/2510.16756" target="_blank" rel="noopener noreferrer">S9</a><a class="notion-link" href="https://github.com/bytedance/SALMONN/tree/ELLSA" target="_blank" rel="noopener noreferrer">S22</a></div><div class="notion-text notion-block-fcf97756358844619eeebebb19672592">公开实现将主损失写成按有效 token 数归一化的两路 next-token cross-entropy：</div><span role="button" tabindex="0" class="notion-equation notion-equation-block"><span></span></span><div class="notion-text notion-block-eafb51a183b84b1fa87eb979d71c61b7">其中：</div><span role="button" tabindex="0" class="notion-equation notion-equation-block"><span></span></span><div class="notion-text notion-block-3f457f59a9db4a41baebe43d4fea5024"><span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 和 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 分别是未被 <code class="notion-inline-code">-100</code> mask 的文本与动作位置；<span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 对应代码里的 <code class="notion-inline-code">action_loss_weight</code>。关键不只是“同时有两个 loss”，而是两路梯度都要穿过共享的跨专家 attention 信息流：文本 loss 会迫使 Speech Expert 学会读取视觉 K/V，动作 loss 会迫使 Action Expert 学会读取语音和文本 K/V。</div><div class="notion-text notion-block-433da52fdd3e4dc0841272e0bcc6a55f"><b>第三阶段：接入语音生成。</b> 主 SA-MoE 冻结，随机初始化的两层 connector 把 Speech Expert hidden states 投到 CosyVoice2-0.5B 的输入空间，只微调 synthesizer 的 language-model 部分。此时优化目标切换为 speech codec 的生成 loss：</div><span role="button" tabindex="0" class="notion-equation notion-equation-block"><span></span></span><div class="notion-text notion-block-c7b579579ba74878b9d4ae9b9777af5b">论文配置训练 20k steps。公开代码在这一阶段把原 SA-MoE loss 乘零，只保留 CosyVoice 返回的 codec loss，因此“会不会说、做什么”与“声音怎样合成”在训练上也是分开的。<a class="notion-link" href="https://arxiv.org/abs/2510.16756" target="_blank" rel="noopener noreferrer">S9</a><a class="notion-link" href="https://github.com/bytedance/SALMONN/tree/ELLSA" target="_blank" rel="noopener noreferrer">S22</a></div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-6b0d7ba7b2a14e919c4c7ddcd5831eb6" data-id="6b0d7ba7b2a14e919c4c7ddcd5831eb6"><span><div id="6b0d7ba7b2a14e919c4c7ddcd5831eb6" class="notion-header-anchor"></div><a class="notion-hash-link" href="#6b0d7ba7b2a14e919c4c7ddcd5831eb6" title="为什么选择一秒，而不是更细的时间块"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">为什么选择一秒，而不是更细的时间块</span></span></h4><div class="notion-text notion-block-34ba11b30b07402ab7848a7c0b53ec37">一秒块看起来不够“实时”，但它是语音响应速度和动作连续性之间的折中。论文在 A100 上测得一秒配置每块 speech-to-speech 约 854 ms、speech-to-action 约 786 ms，能在下一块到来前完成。作者也训练了 0.48 秒版本：语音每块改成 4 个文本 token，动作改成 5 帧，延迟降到约 455 / 428 ms；但动作专家的 LIBERO LONG 成功率从 94.0% 降到 81.0%，整套 SA-MoE 的 LONG 成功率从 84.4% 降到 71.6%。作者推测，动作片段太短会削弱时间连续性。<a class="notion-link" href="https://arxiv.org/abs/2510.16756" target="_blank" rel="noopener noreferrer">S9</a></div><div class="notion-text notion-block-eb3cffcf222d4ca6902352c9e06748e2">这个消融揭示了 ELLSA 与视频聊天模型不同的实时约束：聊天模型通常希望块越小越好，机器人策略却需要一段足够长的 action chunk 才稳定。块长度不是纯粹的系统延迟参数，它也改变了学习目标。</div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-89773672b30f4efe97211cf6b7bc24bf" data-id="89773672b30f4efe97211cf6b7bc24bf"><span><div id="89773672b30f4efe97211cf6b7bc24bf" class="notion-header-anchor"></div><a class="notion-hash-link" href="#89773672b30f4efe97211cf6b7bc24bf" title="这条路线解决了什么，又没有解决什么"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">这条路线解决了什么，又没有解决什么</span></span></h4><div class="notion-text notion-block-d23caf11f0464dafa97e7340c74fb739">ELLSA 真正解决的是：<b>多输入、多输出怎样共享一条因果状态，同时避免每个 token 都穿过全部模态参数。</b> 对具身系统，它允许语言专家和动作专家分别继承已有能力，再通过统一 K/V 时序学会协作。</div><div class="notion-text notion-block-6ce9a0e5abc4400da9d5bbb6d64ebe27">但它还不是高帧率视频理解方案。默认每个相机每秒只取一帧，适合桌面操作、慢速导航和状态问答，不足以捕捉快速手势或细粒度运动。图像 token 也远多于语音 token：论文估计一张图约 300 token，而十秒语音只有约 50 个 token，这种长度失衡会让跨模态对齐偏向视觉。SA-MoE 合并后，相比独立专家，论文报告 speech 与 action 性能仍分别有约 10.3% 和 6.4% 的相对下降。<a class="notion-link" href="https://arxiv.org/abs/2510.16756" target="_blank" rel="noopener noreferrer">S9</a></div><div class="notion-text notion-block-4f42d5593f7a4e39ae8c37cf328c13d0">项目在 2026 年 4 月公开模型与推理代码，仓库采用 Apache-2.0；但官方 README 仍将完整训练支持列为待办，当前代码更适合复现实验和理解架构，而不是直接作为成熟的实时机器人 serving stack。<a class="notion-link" href="https://github.com/bytedance/SALMONN" target="_blank" rel="noopener noreferrer">S10</a><a class="notion-link" href="https://github.com/bytedance/SALMONN/tree/ELLSA" target="_blank" rel="noopener noreferrer">S22</a></div><div class="notion-text notion-block-3aec0110d331806d8d8dfa4578f9a178">&lt;ins/&gt;</div><hr class="notion-hr notion-block-56352e4b1ea14897a9f152d5d57679ba"/><h3 class="notion-h notion-h2 notion-h-indent-0 notion-block-b3c6e2086c54464591d1d6119bf7d45f" data-id="b3c6e2086c54464591d1d6119bf7d45f"><span><div id="b3c6e2086c54464591d1d6119bf7d45f" class="notion-header-anchor"></div><a class="notion-hash-link" href="#b3c6e2086c54464591d1d6119bf7d45f" title="八、路线六：原生因果 AV2AV，让输出视频进入同一条时间线"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">八、路线六：原生因果 AV2AV，让输出视频进入同一条时间线</span></span></h3><div class="notion-text notion-block-df8480d3b33e4da4bcfa2c83118b8021">前面五条路线的输出主要是文本和语音。Wan-Streamer 把问题推到更难的一层：模型除理解用户音视频之外，还要连续生成自己的声音、画面和行为。<a class="notion-link" href="https://arxiv.org/abs/2606.25041" target="_blank" rel="noopener noreferrer">S11</a></div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-43f6459fd4504a5785b6674742aa4f9e" data-id="43f6459fd4504a5785b6674742aa4f9e"><span><div id="43f6459fd4504a5785b6674742aa4f9e" class="notion-header-anchor"></div><a class="notion-hash-link" href="#43f6459fd4504a5785b6674742aa4f9e" title="v0.1：单 Transformer 混合离散文本与连续音视频 latent"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">v0.1：单 Transformer 混合离散文本与连续音视频 latent</span></span></h4><div class="notion-text notion-block-a2c0284c9df8448fbafd5bd851459719">Wan-Streamer v0.1 使用严格因果的音频 / 视频 VAE、encoder 和 decoder。时间被切成 160 ms 单元，目标输出视频为 25 FPS。<a class="notion-link" href="https://arxiv.org/abs/2606.25041" target="_blank" rel="noopener noreferrer">S11</a></div><div class="notion-text notion-block-b379d44a77ec4ed892c801c7941a2cd3">在同一个 Transformer 内：</div><ul class="notion-list notion-list-disc notion-block-76742e469a284ed3b9aaa2cdb6c8ba4d"><li>文本是离散 token，用 next-token prediction；</li></ul><ul class="notion-list notion-list-disc notion-block-0aa3169a0f8e4d0aaf132c0c28ff3f16"><li>音频和视频是连续 latent，用联合 conditional flow matching；</li></ul><ul class="notion-list notion-list-disc notion-block-33334ce40ada44c19cf959b6b734765b"><li>输入、历史输出和当前待生成 latent 通过 block-causal attention 连接；</li></ul><ul class="notion-list notion-list-disc notion-block-d9fa52fe2795480baddd1da861032e82"><li>一旦当前块完成生成，其 clean latent 会被提交到历史，供下一块条件化。</li></ul><div class="notion-text notion-block-30c8afcda0d34b858c3d037fec5823fb">这与“LLM 先写文本—TTS 合成声音—数字人再驱动嘴型”有本质差异。后者是串联流水线，前一阶段的延迟会累积，且视频动作只被动跟随已确定的语音；Wan-Streamer 让声音和画面在同一生成状态中共同演进。</div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-aef6cf5f6d1a435c8d4f4f0b003327a1" data-id="aef6cf5f6d1a435c8d4f4f0b003327a1"><span><div id="aef6cf5f6d1a435c8d4f4f0b003327a1" class="notion-header-anchor"></div><a class="notion-hash-link" href="#aef6cf5f6d1a435c8d4f4f0b003327a1" title="为什么要用 flow matching，而不是把视频全离散化"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">为什么要用 flow matching，而不是把视频全离散化</span></span></h4><div class="notion-text notion-block-2e5dd7f73c04432b8f8382eb41c32b7a">视频若全部变成离散 token，25 FPS 输出会形成极长序列；连续 latent 更适合保留细节，但每个块需要多步去噪。Wan-Streamer 用三阶段训练降低这个成本：</div><ol start="1" class="notion-list notion-list-numbered notion-block-100c12d97b8c407486a1273770fa4a6c" style="list-style-type:decimal"><li>文本、音频、视频能力分别预训练；</li></ol><ol start="2" class="notion-list notion-list-numbered notion-block-cb40f896a8ed4ae89ed5cc611442e899" style="list-style-type:decimal"><li>用双工互动数据训练共同的流式行为；</li></ol><ol start="3" class="notion-list notion-list-numbered notion-block-204872eba41a4b7c811f605a632181cf" style="list-style-type:decimal"><li>用更多 solver steps 和 classifier-free guidance 的教师蒸馏出更快的学生，并通过 rolling distillation / self-forcing 缓解训练与自回归推理的分布差异。</li></ol><div class="notion-text notion-block-0682ae5400a441b49b2a8479fe951f1d">这里的难点已经不只是 token 数，而是必须在下一个 160 ms 截止前完成当前块的多步连续生成。</div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-f25b2eece7394b0a8e8f1e7243902449" data-id="f25b2eece7394b0a8e8f1e7243902449"><span><div id="f25b2eece7394b0a8e8f1e7243902449" class="notion-header-anchor"></div><a class="notion-hash-link" href="#f25b2eece7394b0a8e8f1e7243902449" title="v0.2 / v0.3 的 Thinker–Performer：训练是一个模型，部署才拆成两条计算路径"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">v0.2 / v0.3 的 Thinker–Performer：训练是一个模型，部署才拆成两条计算路径</span></span></h4><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-09fbd0ec822649b4b8de8e5eb90e48ec"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3Add7cebfe-5e00-4232-801a-88c0004667c7%3A07a-wan-thinker-performer.svg?table=block&amp;id=09fbd0ec-8226-49b4-b8de-8e5eb90e48ec&amp;t=09fbd0ec-8226-49b4-b8de-8e5eb90e48ec" alt="notion image" loading="lazy" decoding="async"/></div></figure><div class="notion-text notion-block-43cd29a26c834dbfb50e94b2560d38f5"><em>图 6：本文根据 Wan-Streamer v0.2 Figure 2 重绘，v0.3 原样继承这套部署流水。单 GPU Thinker 在处理当前输入 </em><span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span><em> 和更新 </em><span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span><em> 的同时，解码上一块 </em><span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span><em>；多 GPU Performer 并行生成当前块 latent。</em></div><div class="notion-text notion-block-f5919afaf81f4356ae320775b9a6ac60">先明确一个边界：Thinker 和 Performer 不是两套分别训练、用文本协议串起来的模型。Wan-Streamer 训练时仍是一个端到端 Transformer；只有实时 serving 时，才按照计算特征把同一模型拆成单 GPU Thinker 和多 GPU Performer。v0.3 没有重新设计这套部署拓扑，而是完整继承 v0.2。<a class="notion-link" href="https://arxiv.org/abs/2607.15038" target="_blank" rel="noopener noreferrer">S12</a><a class="notion-link" href="https://arxiv.org/abs/2607.04443" target="_blank" rel="noopener noreferrer">S23</a></div><div class="notion-text notion-block-6a0d9dfe5c7d4da5afc5c4a716325f51"><b>Thinker 负责延迟敏感但序列较短的路径：</b></div><ul class="notion-list notion-list-disc notion-block-67864c0d78554afd914c1422ae0e1206"><li>用因果 audio / video encoder 编码当前 160 ms 用户输入 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span>；</li></ul><ul class="notion-list notion-list-disc notion-block-7002f8a77c70415b9490ca5d01d3d4d7"><li>运行较短的 token-causal Transformer pass，更新语言、行为和交互状态；</li></ul><ul class="notion-list notion-list-disc notion-block-93efe5485d324e279f4161b2ceefd9e2"><li>为每一层产生本块新增的、Performer-compatible K/V slice；</li></ul><ul class="notion-list notion-list-disc notion-block-e5e89328d9994d19a6f87c9992bda71e"><li>接收 Performer 上一块返回的 clean audio / video latent <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span>；</li></ul><ul class="notion-list notion-list-disc notion-block-8d82b57ab8b549ce9df71a9e25e44ddb"><li>用因果 decoder 把 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 解码成可以立即发送的 RGB 帧与音频波形。</li></ul><div class="notion-text notion-block-1a17e23d31bc4576a165edd56cfc9908"><b>Performer 只负责计算最重的 latent generation：</b></div><ul class="notion-list notion-list-disc notion-block-a7735e7fa46e4b1fb3d3ec8638d7147d"><li>接收 Thinker 刚生成的 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span>，写入各 GPU 已经预分片的历史 KV Cache；</li></ul><ul class="notion-list notion-list-disc notion-block-559d8d25076b4e9a9cad3f2333e6c923"><li>用 conditional flow matching 为下一输出单元 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 迭代去噪；</li></ul><ul class="notion-list notion-list-disc notion-block-25f71af03aa942529fe86bc2950fa21e"><li>将高分辨率 video latent 的长序列切到多个 rank 上，执行 Ulysses-style context parallel attention；</li></ul><ul class="notion-list notion-list-disc notion-block-7dd4a1fa27344715930b63004887cb5f"><li>生成完成后把 clean latent 交回 Thinker，而不是自己做最终像素与波形解码。</li></ul><div class="notion-text notion-block-75fc4d19c16d40f18bad444046cd90ba">两者之间真正传输的主要是：</div><span role="button" tabindex="0" class="notion-equation notion-equation-block"><span></span></span><div class="notion-text notion-block-4e93b12fc9b5428ea31e6152b4745017">语言与行为 token 不需要作为另一条长序列发送给 Performer，因为它们已经被折叠进 Thinker 构建的 K/V 条件。边界因此比“LLM 输出一大段 prompt，再交给视频模型”紧凑得多。</div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-1eb8df1cd2894ee2a96df0dfe29c0cb2" data-id="1eb8df1cd2894ee2a96df0dfe29c0cb2"><span><div id="1eb8df1cd2894ee2a96df0dfe29c0cb2" class="notion-header-anchor"></div><a class="notion-hash-link" href="#1eb8df1cd2894ee2a96df0dfe29c0cb2" title="Ulysses 并行到底并行了什么"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">Ulysses 并行到底并行了什么</span></span></h4><div class="notion-text notion-block-f31480e34d1c492da8a90dc5c717e9ff">640×368 视频的 latent 序列明显长于同一 160 ms 内的音频 latent。v0.2 / v0.3 因此只对视频序列做 context parallel：每个 Performer rank 保存一部分预分片 KV，并持有当前 video latent 序列的一段；attention 前后通过 Ulysses all-to-all / gather 交换所需分片，使一次去噪 step 能利用完整上下文。音频 latent 很短，若也切分，通信开销可能比计算收益更大，所以保持不分片。<a class="notion-link" href="https://arxiv.org/abs/2607.04443" target="_blank" rel="noopener noreferrer">S23</a></div><div class="notion-text notion-block-10a685cd483546a887b5a0c90f5f3e60">这里的并行对象不是“四帧分别给四张卡生成”。160 ms 在 25 FPS 下恰好对应约 4 帧，但视频帧已经编码成一条联合 latent sequence；Ulysses 沿这条序列分片，并在 attention 内交换信息，所以跨帧运动和音视频条件仍处于同一次联合生成中。</div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-d3be2b9903c049879fc90c7b86b9fe8a" data-id="d3be2b9903c049879fc90c7b86b9fe8a"><span><div id="d3be2b9903c049879fc90c7b86b9fe8a" class="notion-header-anchor"></div><a class="notion-hash-link" href="#d3be2b9903c049879fc90c7b86b9fe8a" title="相邻三个时间块怎样重叠"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">相邻三个时间块怎样重叠</span></span></h4><div class="notion-text notion-block-a817ca4c9e554534985946e3d0928cfe">把图中的 unit <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 展开，会看到三项工作同时发生：</div><ol start="1" class="notion-list notion-list-numbered notion-block-77c33aaa5d114e528b5114188e20e779" style="list-style-type:decimal"><li>Thinker 编码当前用户输入 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span>，并将新增语义写成 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span>；</li></ol><ol start="2" class="notion-list notion-list-numbered notion-block-e5070d98856d4cef98c40cf73960e5c0" style="list-style-type:decimal"><li>Thinker 解码 Performer 已经完成的上一响应 latent <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span>，立即对外播放；</li></ol><ol start="3" class="notion-list notion-list-numbered notion-block-18a0175d64a74e9d98b85a8abd004326" style="list-style-type:decimal"><li>Performer 用 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 和历史 cache 去噪生成下一响应 latent <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span>。</li></ol><div class="notion-text notion-block-6fd2b39177994a26a6091ce3afc74ce4">到 unit <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 时，<span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 被送回 Thinker 解码，Performer 已经开始算 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span>。因此，系统不是按下面的串行路径运行：</div><div class="notion-text notion-block-2b7b69d8afe64e4fa01823f4c33051c7">而是形成跨块流水：</div><div class="notion-text notion-block-d2bbe0b08f1c4913959b37a7d1b99a0c">实时吞吐的硬约束是 Performer 计算、Thinker–Performer 传输和 Performer 组内通信必须大体装进一个 160 ms cadence；否则未完成的 latent 会逐块积压。端到端 signal-to-signal latency 则从 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 可用开始，经过编码、状态更新、latent generation 和解码，到对应响应可以发送为止，论文报告约 200 ms。两者不矛盾：160 ms 是稳定流水的吞吐节拍，200 ms 是一个信号穿过整条流水线的延迟。<a class="notion-link" href="https://arxiv.org/abs/2607.04443" target="_blank" rel="noopener noreferrer">S23</a></div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-e8f0a6dd136145e2ab9fa06cac1d0bcc" data-id="e8f0a6dd136145e2ab9fa06cac1d0bcc"><span><div id="e8f0a6dd136145e2ab9fa06cac1d0bcc" class="notion-header-anchor"></div><a class="notion-hash-link" href="#e8f0a6dd136145e2ab9fa06cac1d0bcc" title="v0.3：把长期不变的 World 与不断变化的 Event Stream 分离"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">v0.3：把长期不变的 World 与不断变化的 Event Stream 分离</span></span></h4><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-42f9f75f6a6b4b76a5c1700cd886bb45"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3Adc431827-df36-477e-bc15-cbb98782ae54%3A07-wan-world-event-stream.svg?table=block&amp;id=42f9f75f-6a6b-4b76-a5c1-700cd886bb45&amp;t=42f9f75f-6a6b-4b76-a5c1-700cd886bb45" alt="notion image" loading="lazy" decoding="async"/></div></figure><div class="notion-text notion-block-4ecc1368268e4a6b864f4b7715537d55"><em>图 7：本文根据 Wan-Streamer v0.3 Figure 2 与 World–Event formalization 重绘。角色、场景、声学与音色等持久 World context 只预填一次，之后每个时间块持续追加用户输入、语言形式的事件和同步音视频 realization。</em></div><div class="notion-text notion-block-718f2a86cf27423c9885949253a9b007">v0.3 将条件分成两类：</div><ul class="notion-list notion-list-disc notion-block-5dc6b7ea3b9a416fab0be7b7faa0928e"><li><b>World</b>：场景、角色身份、外观、音色、声学环境等长时间稳定的信息；</li></ul><ul class="notion-list notion-list-disc notion-block-dea64f27c8d04682b5bfbf15020fe4c1"><li><b>Event Stream</b>：用户当前声音、画面、行为文本和即时事件。</li></ul><div class="notion-text notion-block-e516507a730047489edaa1bb1c7c2ffa">World 可以写成一个字段可变的结构化记录：</div><span role="button" tabindex="0" class="notion-equation notion-equation-block"><span></span></span><div class="notion-text notion-block-ff3a2b1662a04bfdbe46c21453f1920a">其中可以包含 scene、layout、character identity、appearance、persona、ambient sound 和 voice timbre。它不是每 160 ms 重复拼进 prompt，而是在会话开始时 tokenization 并 prefill 一次。官方 v0.2 演示页给出的部署口径是 Thinker 与 Performer 都会完成场景 prefill，约 0.5 秒后新场景进入实时状态；v0.3 延续这条机制，只是 World 描述比早期单一角色 prompt 更结构化。<a class="notion-link" href="https://arxiv.org/abs/2607.15038" target="_blank" rel="noopener noreferrer">S12</a><a class="notion-link" href="https://arxiv.org/abs/2607.04443" target="_blank" rel="noopener noreferrer">S23</a></div><div class="notion-text notion-block-d04b7cf4c86449099942347eb6e39a3d">随后，每个时间局部事件写成：</div><span role="button" tabindex="0" class="notion-equation notion-equation-block"><span></span></span><div class="notion-text notion-block-284d26f1615f43fd986bf7aca86004bb"><span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 是事件生效区间，<span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 指向 World 中的角色或“无角色”事件，<span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 用自然语言描述说话、动作、镜头移动、环境变化或声音。多个事件可以时间重叠，例如一个角色边说话、边转头，同时背景里有门关闭。</div><div class="notion-text notion-block-c33ccd7cd1da480b9d3294023d9db107">流式生成的概率分解为：</div><span role="button" tabindex="0" class="notion-equation notion-equation-block"><span></span></span><div class="notion-text notion-block-ca5f5980824a4e94b7054afb63e42820">其中 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 是到当前为止的用户文本、音频和视频。离散的语言与行为 directive 继续做 next-token prediction；连续的 audio / video latent 在同一个 clean context 下做 conditional flow matching。当前块得到的 clean latent 会提交回历史，下一块不仅能看到用户做过什么，也能看到智能体自己上一刻的表情、姿态和声音。<a class="notion-link" href="https://arxiv.org/abs/2607.15038" target="_blank" rel="noopener noreferrer">S12</a></div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-a13bd99f459d4b4e9b475f4251e88e95" data-id="a13bd99f459d4b4e9b475f4251e88e95"><span><div id="a13bd99f459d4b4e9b475f4251e88e95" class="notion-header-anchor"></div><a class="notion-hash-link" href="#a13bd99f459d4b4e9b475f4251e88e95" title="World/Event 怎样落到 Thinker–Performer 上"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">World/Event 怎样落到 Thinker–Performer 上</span></span></h4><div class="notion-text notion-block-7e7fa473b2b84501ab225da0d3cabb49">World/Event 是建模语义，Thinker/Performer 是部署切分，两者并不是平行的四个模块。对应关系可以这样理解：</div><table class="notion-simple-table notion-block-a07a7a1e1a1e4a138312c97fb47a7d5a"><tbody><tr class="notion-simple-table-row notion-simple-table-header-row notion-block-a405b11086f44c59ba9fe8c7fba8b65d"><td class="" style="width:120px"><div class="notion-simple-table-cell">状态</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">会话中怎样更新</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">主要落点</div></td></tr><tr class="notion-simple-table-row notion-block-005d31b8058e450f90a5395353093265"><td class="" style="width:120px"><div class="notion-simple-table-cell">World tokens</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">建立会话时 prefill，之后通常不重复编码</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">Thinker 的 token/state history；对应 K/V 同步到 Performer cache</div></td></tr><tr class="notion-simple-table-row notion-block-ca288576967f4c3e891fec66d8cb2121"><td class="" style="width:120px"><div class="notion-simple-table-cell">用户 Event 输入 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span></div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">每 160 ms 由新文本、音频和视频追加</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">Thinker encoder 与 token-causal pass</div></td></tr><tr class="notion-simple-table-row notion-block-e61f19f1d2f04b9da4fb90ed4de974c6"><td class="" style="width:120px"><div class="notion-simple-table-cell">语言形式的 agent event <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span></div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">Thinker 预测说话内容和行为 directive</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">Thinker 的语言/状态流，并写入新增 K/V</div></td></tr><tr class="notion-simple-table-row notion-block-e61cb662b95942a28c075e0709c59ed4"><td class="" style="width:120px"><div class="notion-simple-table-cell">Audio/video realization <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span></div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">Performer 根据 World、历史和 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> flow-matching 生成</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">Performer latent path；完成后交回 Thinker 解码</div></td></tr></tbody></table><div class="notion-text notion-block-7eac38992d79485881386f1a342fa334">因此，World“只 prefill 一次”并不意味着 Performer 后续不再使用它。World 的影响已经固化在双方的前缀 KV Cache 中；每个新块只需传播增量 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span>，而不是重新传整份角色和场景描述。</div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-e9376f3bb5134012ba3b2ce190e0b9b8" data-id="e9376f3bb5134012ba3b2ce190e0b9b8"><span><div id="e9376f3bb5134012ba3b2ce190e0b9b8" class="notion-header-anchor"></div><a class="notion-hash-link" href="#e9376f3bb5134012ba3b2ce190e0b9b8" title="自由行为为什么没有引入新的慢路径"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">自由行为为什么没有引入新的慢路径</span></span></h4><div class="notion-text notion-block-20b6a7ed35a14059855badf2ecf7b322">v0.3 不建立一个单独的动作规划器，而是在智能体语言流里交错两类 token：</div><div class="notion-text notion-block-c84570782c3b44f7adea45037995339f">括号内是开放词表行为，括号外是真正说出的内容。Thinker 在同一 token-causal pass 中预测二者，它们一起进入 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span>；Performer 随后把“拿杯子、望向窗外”和“说出这句话”共同渲染成同步音视频。因此行为不是 TTS 完成后再由动作模型补上的后处理，也不需要新增一条 latency-critical RPC。<a class="notion-link" href="https://arxiv.org/abs/2607.15038" target="_blank" rel="noopener noreferrer">S12</a></div><div class="notion-text notion-block-b29a5f54a0f345fe9ee6f8714b98db70">模型输出仍为 640×368、25 FPS，每 160 ms 一个同步音视频单元。v0.3 改变的是预训练目标和表达空间，而不是 v0.2 已经确定的分辨率、时间块和 Thinker–Performer serving topology。<a class="notion-link" href="https://arxiv.org/abs/2607.15038" target="_blank" rel="noopener noreferrer">S12</a></div><div class="notion-text notion-block-ce8fbb03971a423982448d3303c6aebd">这个设计揭示了长时视频交互的另一条主线：不要把“这个角色长什么样”和“他此刻抬起了左手”以同样频率重复编码。持久世界与瞬时事件分离，既节省上下文，也减少角色漂移。</div><div class="notion-text notion-block-3aec0110d331805c9ba5f39458319db1">&lt;ins/&gt;</div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-22632ce5705b46d1a8af72c9fe7bf5c1" data-id="22632ce5705b46d1a8af72c9fe7bf5c1"><span><div id="22632ce5705b46d1a8af72c9fe7bf5c1" class="notion-header-anchor"></div><a class="notion-hash-link" href="#22632ce5705b46d1a8af72c9fe7bf5c1" title="原生 AV2AV 的代价"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">原生 AV2AV 的代价</span></span></h4><div class="notion-text notion-block-1a30e5bde79345f8833bc5c39e84d89a">Wan-Streamer 接近能力阶梯的 L3，但成本最高：</div><ul class="notion-list notion-list-disc notion-block-64706fb2e66a482ca551aefbd2eed18a"><li>训练数据必须包含同步输入输出音视频和自然重叠；</li></ul><ul class="notion-list notion-list-disc notion-block-c0c645c8e1a14b1ebe25737fb4db0c3a"><li>因果视频 decoder 的画质与延迟直接冲突；</li></ul><ul class="notion-list notion-list-disc notion-block-582b6c9abb884b959070e70eef62f353"><li>任何流式误差都会进入历史并持续累积；</li></ul><ul class="notion-list notion-list-disc notion-block-8c07b31261864594b847ca00ad4951ef"><li>打断不再只是停止音频队列，还要安全终止视频 latent 并重建动作连续性；</li></ul><ul class="notion-list notion-list-disc notion-block-8610a72a66f34da59bf5b376ee5a7e77"><li>服务端必须同时满足高吞吐 Transformer 与低尾延迟 flow solver。</li></ul><div class="notion-text notion-block-cb69947a14be4623ac9a29f5b74007d7">因此，原生 AV2AV 不会立刻替代语音输出型 Omni 模型。它更可能先用于虚拟角色、远程呈现和高价值陪伴，再逐步下沉。</div><hr class="notion-hr notion-block-31775eef89ca4da69cf28d0a0de66e56"/><h3 class="notion-h notion-h2 notion-h-indent-0 notion-block-86059358e81b405d88509809fb55373e" data-id="86059358e81b405d88509809fb55373e"><span><div id="86059358e81b405d88509809fb55373e" class="notion-header-anchor"></div><a class="notion-hash-link" href="#86059358e81b405d88509809fb55373e" title="九、模型之外：实时视频最终是 RTC、推理服务与反馈控制的共同问题"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">九、模型之外：实时视频最终是 RTC、推理服务与反馈控制的共同问题</span></span></h3><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-c0730b93b8ff4df9b96cc8bc4364b240"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3A00f968e4-0383-4d6f-aea7-d9ecdfbdf692%3A08-production-reference-architecture.svg?table=block&amp;id=c0730b93-b8ff-4df9-b96c-c8bc4364b240&amp;t=c0730b93-b8ff-4df9-b96c-c8bc4364b240" alt="notion image" loading="lazy" decoding="async"/></div></figure><div class="notion-text notion-block-d5810f852deb48eb91c1ac9d26f3fcd5"><em>图 8：生产系统参考架构。模型侧首包只是总延迟的一段；终端采样、网络、排队、播放缓冲和打断清理同样决定体验。</em></div><div class="notion-text notion-block-3d6b1174e45a49edaeacaef9eaeb6df1">把模型部署成一个 WebSocket endpoint 只是起点。端到端延迟可以粗略拆成：</div><span role="button" tabindex="0" class="notion-equation notion-equation-block"><span></span></span><div class="notion-text notion-block-e9d22769974d47429712761cc5133ed5">如果用户在模型说话时打断，还要加上 VAD / 语义判断、服务端 cancel 传播、客户端播放队列清空和回声闭环隔离。</div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-a0c217cd4d1e44e6aa71da33138312b8" data-id="a0c217cd4d1e44e6aa71da33138312b8"><span><div id="a0c217cd4d1e44e6aa71da33138312b8" class="notion-header-anchor"></div><a class="notion-hash-link" href="#a0c217cd4d1e44e6aa71da33138312b8" title="Artic：传视频不是为了好看，而是为了让模型答对"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">Artic：传视频不是为了好看，而是为了让模型答对</span></span></h4><div class="notion-text notion-block-15ef41f8914a4320be381c74cfca1469">传统 RTC 的 ABR 主要优化分辨率、帧率、卡顿和 VMAF。视频助手的接收者是模型：有些区域即使人眼觉得模糊，模型仍能答对；另一些看似轻微的压缩却会抹掉标签、手势或工具细节。</div><div class="notion-text notion-block-bd7e9ba0ede64f9aaa17d8411b975d34">Artic 提出两类机制：<a class="notion-link" href="https://arxiv.org/abs/2602.12641" target="_blank" rel="noopener noreferrer">S13</a></div><ul class="notion-list notion-list-disc notion-block-aa002999fea24799aa074dd0054584e1"><li><b>ReCapABR</b>：根据模型“回答能力随码率何时饱和”来限制视频码率，为网络波动留出余量；</li></ul><ul class="notion-list notion-list-disc notion-block-adf8e992bc9f490e9ad0c4d3ffadfdc5"><li><b>ZeCoStream</b>：利用模型反馈定位与当前回答相关的区域，客户端在低带宽时调整量化参数，把比特留给关键区域。</li></ul><div class="notion-text notion-block-bc0a75b4d5394d60b91d676646166988">作者在 DeViBench 上报告，相比基线准确率提升 15.12%，延迟降低 135.31 ms。<a class="notion-link" href="https://arxiv.org/abs/2602.12641" target="_blank" rel="noopener noreferrer">S13</a> 这仍是特定数据集与网络轨迹下的结果，但方向很重要：未来的视频传输控制目标会从“像不像原视频”转向“足不足以支持当前决策”。</div><div class="notion-text notion-block-b92e846019344d3f8de56cd8ac67a4e6">这里也有明显风险。模型此刻认为不重要的区域，可能在十秒后变成推理关键。因此 ZeCoStream 只在带宽紧张时激进压缩，并需要保留足够的未来上下文。</div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-91467c5125ff496d9be78d39ed3e5292" data-id="91467c5125ff496d9be78d39ed3e5292"><span><div id="91467c5125ff496d9be78d39ed3e5292" class="notion-header-anchor"></div><a class="notion-hash-link" href="#91467c5125ff496d9be78d39ed3e5292" title="vLLM-Omni：接口流式不代表计算增量"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">vLLM-Omni：接口流式不代表计算增量</span></span></h4><div class="notion-text notion-block-9d4bc796bf56403186cec9a8d4c1c5a6">vLLM-Omni 的 Streaming Video API 提供 <code class="notion-inline-code">/v1/video/chat/stream</code> WebSocket endpoint。客户端可发送 base64 JPEG/PNG 帧和可选的 16 kHz PCM 音频，服务端返回 text / audio delta；还可用 EVS 阈值过滤近重复帧。默认每次使用 4 帧，最大缓冲 50 帧。<a class="notion-link" href="https://docs.vllm.ai/projects/vllm-omni/en/latest/serving/video_stream_api/" target="_blank" rel="noopener noreferrer">S14</a></div><div class="notion-text notion-block-a9a3092267d9494b899fad1bc67791cb">但当前文档明确指出：session KV reuse 与 incremental prefill 尚未实现，每次 query 会从缓冲的帧和音频重建 prompt。<a class="notion-link" href="https://docs.vllm.ai/projects/vllm-omni/en/latest/serving/video_stream_api/" target="_blank" rel="noopener noreferrer">S14</a></div><div class="notion-text notion-block-c99cb4b416e8428cb1bcc185efb11f46">这正好提供了选型时必须追问的边界：</div><ul class="notion-list notion-list-disc notion-block-2fa45949ec7140eda089aedc85f1f103"><li>帧是到达即编码，还是提问时统一编码？</li></ul><ul class="notion-list notion-list-disc notion-block-825aaebc206a4f87b99388803bd31671"><li>同一帧会不会在多次 query 中重复 prefill？</li></ul><ul class="notion-list notion-list-disc notion-block-b2451f9ff2db4c278e77707a10e3042b"><li>长会话显存随时间怎样增长？</li></ul><ul class="notion-list notion-list-disc notion-block-80e53944036e4bc0bc3d3d883d7b02b6"><li>相似帧过滤发生在解码前还是视觉编码后？</li></ul><ul class="notion-list notion-list-disc notion-block-17d816319ca94958b36758ade1a2a459"><li>多租户 batching 会不会破坏每个会话的时间节奏？</li></ul><div class="notion-text notion-block-8b7ba4bd5f1e4a40a859f432bdd49a1d">如果这些问题没有答案，“支持流式视频 API”仍不能推导出稳定的低延迟。</div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-5158e303beb74e039eefe23b6a67c45f" data-id="5158e303beb74e039eefe23b6a67c45f"><span><div id="5158e303beb74e039eefe23b6a67c45f" class="notion-header-anchor"></div><a class="notion-hash-link" href="#5158e303beb74e039eefe23b6a67c45f" title="百度智能云 RTC：生产链路会保留级联系统"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">百度智能云 RTC：生产链路会保留级联系统</span></span></h4><div class="notion-text notion-block-9da204c14a534c22b5aa4640dc72e771">百度智能云的多模态互动 RTC 将端侧 SDK、云端 RTC、降噪 / 分离 / 声纹 / VAD、智能打断，以及 ASR—LLM—TTS 或多模态模型连接成一套服务；产品页还强调智能抽帧，并支持文本、图片、语音流、视频流输入。<a class="notion-link" href="https://cloud.baidu.com/product/RTC/multimodal.html" target="_blank" rel="noopener noreferrer">S15</a></div><div class="notion-text notion-block-e920895e5c5946a0a7b03679a40a65e9">这代表另一种务实路线：生产系统不会因为端到端 Omni 模型出现，就立刻删除所有可观测、可替换的组件。级联链路在很多场景仍有优势：</div><ul class="notion-list notion-list-disc notion-block-a8981ec791b5465da73cd6f09e89a833"><li>ASR 文本便于审计、检索和规则控制；</li></ul><ul class="notion-list notion-list-disc notion-block-b56b2a7c239043fc8400d7a5862ff0ea"><li>独立 VAD 与打断模块更易调参；</li></ul><ul class="notion-list notion-list-disc notion-block-0a7ecde85c564dbaa3551df1513f19b0"><li>TTS 可稳定复用品牌音色；</li></ul><ul class="notion-list notion-list-disc notion-block-23764e9e7d4a43baafcefe4240303195"><li>视觉模型只在必要时唤起，控制 GPU 成本。</li></ul><div class="notion-text notion-block-b4d04c02ad72421da3e04085e42e0a61">厂商给出的 1.4 秒语音端到端和 0.8 秒内打断属于产品侧口径，应该在自己的地区、网络、并发与终端设备上复测。<a class="notion-link" href="https://cloud.baidu.com/product/RTC/multimodal.html" target="_blank" rel="noopener noreferrer">S15</a></div><hr class="notion-hr notion-block-2a502b0fa43c479eb8f7821c0a2b2117"/><h3 class="notion-h notion-h2 notion-h-indent-0 notion-block-1cfca965cb324cbfa0e6fe3aa7451b1d" data-id="1cfca965cb324cbfa0e6fe3aa7451b1d"><span><div id="1cfca965cb324cbfa0e6fe3aa7451b1d" class="notion-header-anchor"></div><a class="notion-hash-link" href="#1cfca965cb324cbfa0e6fe3aa7451b1d" title="十、训练数据与评测：今天的瓶颈越来越不像“模型不够大”"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">十、训练数据与评测：今天的瓶颈越来越不像“模型不够大”</span></span></h3><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-81d377606cd549aab9e1724a4eff7fdb" data-id="81d377606cd549aab9e1724a4eff7fdb"><span><div id="81d377606cd549aab9e1724a4eff7fdb" class="notion-header-anchor"></div><a class="notion-hash-link" href="#81d377606cd549aab9e1724a4eff7fdb" title="流式数据不能由离线问答直接替代"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">流式数据不能由离线问答直接替代</span></span></h4><div class="notion-text notion-block-e76b168f68da42ec99dc18b07ec56144">离线 VQA 常见格式是“完整视频 + 问题 + 答案”。全双工训练至少还需要：</div><ul class="notion-list notion-list-disc notion-block-8cf42ce7518d4ab4960912a570038705"><li>每段输入的真实时间戳；</li></ul><ul class="notion-list notion-list-disc notion-block-82f45cc82a2040e8aeda7a0811811e39"><li>模型应该沉默的区间；</li></ul><ul class="notion-list notion-list-disc notion-block-937fb08dd8cd4d92969ad447c128e864"><li>主动开口的触发点；</li></ul><ul class="notion-list notion-list-disc notion-block-bd68aa5f9e2c43758276d9b88622d329"><li>用户和模型重叠说话；</li></ul><ul class="notion-list notion-list-disc notion-block-7fb82ac9de034de3b89e8866c4f972de"><li>用户中途打断；</li></ul><ul class="notion-list notion-list-disc notion-block-84cd9b486c2548b4981ae8089dfd905c"><li>说到一半发现新视觉证据后的修正；</li></ul><ul class="notion-list notion-list-disc notion-block-3b533baaa6af417e94cd90f28421bcb9"><li>输出语音、动作或视频的同步轨迹。</li></ul><div class="notion-text notion-block-d71bec65cf39432a8491f660b68c2d92">ROMA 用主动、旁白和反应式数据训练时机；DuplexOmni 专门合成 overlap、silence、supplement、interruption 和 delayed thinking；Wan-Streamer 还要构造双向同步音视频。三者的共同结论是：<b>轮次和时间本身就是监督信号</b>。</div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-18ea12b03c834cf19e7461df9d8c37e6" data-id="18ea12b03c834cf19e7461df9d8c37e6"><span><div id="18ea12b03c834cf19e7461df9d8c37e6" class="notion-header-anchor"></div><a class="notion-hash-link" href="#18ea12b03c834cf19e7461df9d8c37e6" title="只测“视频问答准确率”会掩盖两类崩溃"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">只测“视频问答准确率”会掩盖两类崩溃</span></span></h4><div class="notion-text notion-block-77c778c2f3c445bb964c52ba75f54e04">VideoFDB 收集 237 段双人互动片段，覆盖 11 类非语言动态，用来评估 AV2AV 全双工会话代理。作者将其称为首个面向该任务的视听全双工 benchmark。<a class="notion-link" href="https://arxiv.org/abs/2605.30256" target="_blank" rel="noopener noreferrer">S16</a></div><div class="notion-text notion-block-ea34d3588e3143049b16d6a0c9d3a72f">论文观察到两种典型失败：</div><ol start="1" class="notion-list notion-list-numbered notion-block-d4390895255848648eced588c88f4055" style="list-style-type:decimal"><li><b>captioning collapse</b>：模型不断描述画面，而不是参与对话；</li></ol><ol start="2" class="notion-list notion-list-numbered notion-block-a84eb2d3affe41fc93dfee5c36398b00" style="list-style-type:decimal"><li><b>visual-stream ignorance</b>：模型在显式 VQA 时会用视觉，一进入持续对话就主要依赖音频，忽略正在变化的画面。</li></ol><div class="notion-text notion-block-eb00751ccf794c8596465890b38c2de0">这说明“单轮问图能答对”并不等于“长会话里会持续看”。真实评测至少要分开测：</div><table class="notion-simple-table notion-block-26a054bf6b8c4536bbc51ff7bb40e6be"><tbody><tr class="notion-simple-table-row notion-simple-table-header-row notion-block-b680b5677dbd45ba97051989cf6d0cbe"><td class="" style="width:120px"><div class="notion-simple-table-cell">维度</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">应测问题</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">常见错误</div></td></tr><tr class="notion-simple-table-row notion-block-2871d3db0eaa4f7bb6487de5410fcae1"><td class="" style="width:120px"><div class="notion-simple-table-cell">时间定位</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">能否把声音与同一时刻动作关联</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">用错帧、提前使用未来信息</div></td></tr><tr class="notion-simple-table-row notion-block-5c0d968bfcad4e78a70aa9812e5ceb8f"><td class="" style="width:120px"><div class="notion-simple-table-cell">持续视觉</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">没有显式提问时是否仍跟踪画面</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">只听音频、视觉状态停滞</div></td></tr><tr class="notion-simple-table-row notion-block-2edada3b9b7e4d5ab28d65f38b824014"><td class="" style="width:120px"><div class="notion-simple-table-cell">响应时机</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">该沉默时沉默，该提醒时提醒</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">抢话、漏报、机械等 VAD</div></td></tr><tr class="notion-simple-table-row notion-block-2bce53e0af434ad0826257a840e0d7eb"><td class="" style="width:120px"><div class="notion-simple-table-cell">打断恢复</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">被插话后能否停止并续接</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">旧音频继续播放、重复回答</div></td></tr><tr class="notion-simple-table-row notion-block-7336347b6a4e40cca451e8bf8670c4c7"><td class="" style="width:120px"><div class="notion-simple-table-cell">长时一致性</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">数分钟后是否记得对象与位置变化</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">KV 膨胀、身份漂移、背景重算</div></td></tr><tr class="notion-simple-table-row notion-block-8d7db0f44aec40099332d8fe8ccf5dd8"><td class="" style="width:120px"><div class="notion-simple-table-cell">弱网鲁棒性</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">降帧、丢包、抖动时是否保住关键判断</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">画面虽流畅但答案错误</div></td></tr><tr class="notion-simple-table-row notion-block-e8d1d1052129499d89c3fe45f2aa1124"><td class="" style="width:120px"><div class="notion-simple-table-cell">输出同步</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">语音、字幕、动作、视频是否同拍</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">口型和语义错位、动作滞后</div></td></tr></tbody></table><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-f3e3f2a8e9b1486fa2ea26ca1d24450a" data-id="f3e3f2a8e9b1486fa2ea26ca1d24450a"><span><div id="f3e3f2a8e9b1486fa2ea26ca1d24450a" class="notion-header-anchor"></div><a class="notion-hash-link" href="#f3e3f2a8e9b1486fa2ea26ca1d24450a" title="延迟指标必须写清计时边界"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">延迟指标必须写清计时边界</span></span></h4><div class="notion-text notion-block-917d3f4773264b5bae3206a40acdfe56">目前论文里的 latency 可能分别指：</div><ul class="notion-list notion-list-disc notion-block-be861d5a75e34ed692409c67d546f63a"><li>单个多模态单元编码耗时；</li></ul><ul class="notion-list notion-list-disc notion-block-8e8858b4eea54d638ec0beca41dee47a"><li>最后一个输入包到首个文本 token；</li></ul><ul class="notion-list notion-list-disc notion-block-bca973810a70477fb4cb7a31e01a316e"><li>最后一个输入包到首个 codec token；</li></ul><ul class="notion-list notion-list-disc notion-block-253eae3117474de0b3cdbd6ad8f6abfe"><li>服务端收到数据到首个可播放音频块；</li></ul><ul class="notion-list notion-list-disc notion-block-da86f85827794b54832b2d30b732248a"><li>包含网络的用户端到用户端；</li></ul><ul class="notion-list notion-list-disc notion-block-0ee93e3d9d7e4d27ba00b3014829b265"><li>平均值、P50 或 P95；</li></ul><ul class="notion-list notion-list-disc notion-block-bbc36bfe874e46f993b3bdf15c9e39bf"><li>单并发或满载。</li></ul><div class="notion-text notion-block-ed021b7ca1fa4d1eacabb7d53c4090a0">因此，本文没有制作“谁最快”的排行榜。一个更有用的实验表应该同时报告：硬件、输入帧率与分辨率、音频块长度、并发、上下文长度、首文本、首音频、RTF、P95、网络与播放缓冲。</div><div class="notion-text notion-block-3aec0110d331808a869cd6a864be382a">&lt;ins/&gt;</div><hr class="notion-hr notion-block-3de2c31423e44f2aa17cae2a6b62f79d"/><h3 class="notion-h notion-h2 notion-h-indent-0 notion-block-bb122ab968a543fb98316e3379bd558e" data-id="bb122ab968a543fb98316e3379bd558e"><span><div id="bb122ab968a543fb98316e3379bd558e" class="notion-header-anchor"></div><a class="notion-hash-link" href="#bb122ab968a543fb98316e3379bd558e" title="十一、横向比较：六条技术路线分别在优化什么"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">十一、横向比较：六条技术路线分别在优化什么</span></span></h3><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-893be437bf1f44aa9bd8e11c48a2f0a8"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3Ae4a27456-0512-494c-9fe1-8e60b11cb6e3%3A04-six-route-map.svg?table=block&amp;id=893be437-bf1f-44aa-9bd8-e11c48a2f0a8&amp;t=893be437-bf1f-44aa-9bd8-e11c48a2f0a8" alt="notion image" loading="lazy" decoding="async"/></div></figure><div class="notion-text notion-block-7cc79d8d3ecf4e34a96e082bf7adbb25"><em>图 9：主流方案的差异可以理解为“把可流式性插在哪一层”。现实系统通常同时采用其中两到四层。</em></div><table class="notion-simple-table notion-block-67cff1164b79433a9305f0de8b3c2606"><tbody><tr class="notion-simple-table-row notion-simple-table-header-row notion-block-026110486fb841af97cf89f3b49dc1fb"><td class="" style="width:120px"><div class="notion-simple-table-cell">路线 / 代表项目</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">视频怎样进入</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">状态怎样保留</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">谁决定何时响应</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">输出</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">最强项</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">主要边界</div></td></tr><tr class="notion-simple-table-row notion-block-6832c72a791d4e7cbdb076cff6df1214"><td class="" style="width:120px"><div class="notion-simple-table-cell">客户端采帧：Gemini Live、Qwen Realtime</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">JPEG，通常 ≤1 FPS</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">云端有状态会话，内部细节不完全公开</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">VAD / 语义 VAD / 服务事件</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">文本、语音</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">产品化快、带宽低</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">快速动作与细粒度视听同步不足</div></td></tr><tr class="notion-simple-table-row notion-block-aef6321088da489b8b17875771e59e9b"><td class="" style="width:120px"><div class="notion-simple-table-cell">分块编码：Qwen3.5-Omni</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">动态 FPS 视觉 + AuT 音频 token</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">chunked prefill、Hybrid Attention MoE、长上下文</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">模型与服务控制</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">文本、流式语音</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">统一理解、强通用能力</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">公开服务仍可能限制到稀疏帧；不输出视频</div></td></tr><tr class="notion-simple-table-row notion-block-4305dfdda3964240a654c745b921239d"><td class="" style="width:120px"><div class="notion-simple-table-cell">共享时间轴：MiniCPM-o 4.5</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">压缩视觉 slice + 10 audio token/s</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">Omni-Flow、streaming prefill、KV</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">Listen–Speak 控制</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">文本、语音</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">开源、状态边界清晰、可边缘化</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">视觉帧率和窗口粒度仍有限</div></td></tr><tr class="notion-simple-table-row notion-block-57d0d0be8d604c6abd5442d16ca825a0"><td class="" style="width:120px"><div class="notion-simple-table-cell">显式触发：ROMA</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">每秒单元、2 FPS</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">chunked TMRoPE、持久 KV</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">两层 Speak Head</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">文本、语音</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">时机可单测、改造成本低</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">触发粒度粗，复杂重叠仍靠系统</div></td></tr><tr class="notion-simple-table-row notion-block-929f31944fe1426388f99f8e9b442fb3"><td class="" style="width:120px"><div class="notion-simple-table-cell">异步思考：DuplexOmni</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">连续音视频进入 Interaction Model</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">前台交互状态 + 后台思考反馈</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">时间片控制与 Interaction Layer</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">文本、语音</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">深推理不阻塞即时回应</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">35B、硬件重、公开版本仍有沉默与音质问题</div></td></tr><tr class="notion-simple-table-row notion-block-b998a8d917ac4df5b46815fd8dd252c6"><td class="" style="width:120px"><div class="notion-simple-table-cell">模态专家：ELLSA</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">每秒一帧 + 一秒语音</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">共享 attention / KV，模态专家分算</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell"><code class="notion-inline-code">&lt;silence&gt;</code> 与流内生成</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">文本、语音、动作</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">具身 MIMO、模块可替换</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">视频稀疏，专家边界可能限制细粒度融合</div></td></tr><tr class="notion-simple-table-row notion-block-0af9a641e3634945a2dd54b53a60385f"><td class="" style="width:120px"><div class="notion-simple-table-cell">原生 AV2AV：Wan-Streamer</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">因果音视频 latent，160 ms 单元</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">block-causal attention、历史 clean latent、World/Event</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">单模型内生控制</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">文本、语音、25 FPS 视频</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">输入输出音视频在同一时间线</div></td><td class="" style="width:120px"><div class="notion-simple-table-cell">训练、推理和部署成本最高</div></td></tr></tbody></table><div class="notion-text notion-block-8147bb6537c94e8396ba64378906c7e8">这张表也说明，“哪一个项目最好”没有统一答案。不同场景真正需要的能力不同。</div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-0ebdd0748f964790a95e0301a947eb48" data-id="0ebdd0748f964790a95e0301a947eb48"><span><div id="0ebdd0748f964790a95e0301a947eb48" class="notion-header-anchor"></div><a class="notion-hash-link" href="#0ebdd0748f964790a95e0301a947eb48" title="如果做手机或网页视频助手"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">如果做手机或网页视频助手</span></span></h4><div class="notion-text notion-block-adfeacb28a0b4ae1b4374e57df4ac7f2">优先从 L1 开始：WebRTC / WebSocket + 连续音频 + 自适应 JPEG 采帧。先建立端到端延迟和视觉采样收益曲线，再决定是否需要模型内部增量 prefill。Gemini Live 或 Qwen Realtime 一类托管服务适合验证产品。</div><div class="notion-text notion-block-db86ceb2430443cb83c5a0b625c4ae00">关键投入不应只是 prompt，而是：</div><ul class="notion-list notion-list-disc notion-block-4c3f2b2469554b9d9a021d77f9729c03"><li>运动和语义共同驱动的采帧；</li></ul><ul class="notion-list notion-list-disc notion-block-8f4575b731c54abdbbd093fe281acebf"><li>客户端时间戳；</li></ul><ul class="notion-list notion-list-disc notion-block-50cea32eb8f941c9a3ad647199c11cf8"><li>打断队列管理；</li></ul><ul class="notion-list notion-list-disc notion-block-b33ff4d56dd14a79b5f48e63aef41479"><li>每一段延迟的埋点；</li></ul><ul class="notion-list notion-list-disc notion-block-4425575bd6f2425d8af108090ff6a044"><li>视频缺帧时的降级行为。</li></ul><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-dd4a341c18044637adfeadcebae0cb58" data-id="dd4a341c18044637adfeadcebae0cb58"><span><div id="dd4a341c18044637adfeadcebae0cb58" class="notion-header-anchor"></div><a class="notion-hash-link" href="#dd4a341c18044637adfeadcebae0cb58" title="如果做本地或私有化实时助手"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">如果做本地或私有化实时助手</span></span></h4><div class="notion-text notion-block-f9c119ab82654dca9e4a8901b9443e39">MiniCPM-o 4.5 的接口形态更值得参考：将输入摄取与输出生成显式拆开，持续维护 KV。若现有 Omni 主干已经稳定，ROMA 式 Speak Head 是加入主动性的低风险方式。</div><div class="notion-text notion-block-1eb07e37c297461393c0a56ced70bbf4">不要一开始就追求原生 25 FPS。先验证 1—2 FPS 是否覆盖任务；对真正需要高速视觉的局部模块，可外挂轻量追踪器、姿态模型或事件检测器，把结构化结果作为高频流送给主干。</div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-a44b3485cfd345cabe5274addb2b7d89" data-id="a44b3485cfd345cabe5274addb2b7d89"><span><div id="a44b3485cfd345cabe5274addb2b7d89" class="notion-header-anchor"></div><a class="notion-hash-link" href="#a44b3485cfd345cabe5274addb2b7d89" title="如果做机器人"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">如果做机器人</span></span></h4><div class="notion-text notion-block-6841328e073c43dca71c2ac818189257">ELLSA 的模态专家和共享注意力适合动作空间复杂、模块需要替换的系统；MiniCPM-o / ROMA 更适合以语言交互为中心的设备。安全控制仍应留在独立的确定性回路，不能让大模型的 1 秒时间窗直接承担毫秒级制动。</div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-6a643c6da7204d48a98f2102a8308d21" data-id="6a643c6da7204d48a98f2102a8308d21"><span><div id="6a643c6da7204d48a98f2102a8308d21" class="notion-header-anchor"></div><a class="notion-hash-link" href="#6a643c6da7204d48a98f2102a8308d21" title="如果做虚拟角色或远程呈现"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">如果做虚拟角色或远程呈现</span></span></h4><div class="notion-text notion-block-f3c0db4977f94a85be4bba1e49af6a95">Wan-Streamer 的 World / Event 分离和 Thinker–Performer 流水线是更接近目标的架构。若成本暂时不可接受，可以采用过渡方案：Omni 模型流式输出语义和语音，低延迟表情 / 动作模型消费同一时间戳流。但要清楚，这仍不是原生 AV2AV，打断时需要跨组件回滚。</div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-0327eac4abac451684164a37c6f8fdf6" data-id="0327eac4abac451684164a37c6f8fdf6"><span><div id="0327eac4abac451684164a37c6f8fdf6" class="notion-header-anchor"></div><a class="notion-hash-link" href="#0327eac4abac451684164a37c6f8fdf6" title="如果复杂推理和实时对话同样重要"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">如果复杂推理和实时对话同样重要</span></span></h4><div class="notion-text notion-block-ff77e4b87d3b4c89a0fd2fa0c1b6f7e7">优先借鉴 DuplexOmni 的异步分层，而不是盲目压缩一个大 reasoning model 的首 token。让前台交互模型负责承接、澄清和短反馈，后台模型负责检索、工具和长推理；两者通过可中断、可版本化的中间状态通信。</div><hr class="notion-hr notion-block-a38cfbe5e72e4d5c9d21ba28e38c8ef4"/><h3 class="notion-h notion-h2 notion-h-indent-0 notion-block-ca3838817e944f178859962042f33c73" data-id="ca3838817e944f178859962042f33c73"><span><div id="ca3838817e944f178859962042f33c73" class="notion-header-anchor"></div><a class="notion-hash-link" href="#ca3838817e944f178859962042f33c73" title="十二、给实现团队的一套选型检查表"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">十二、给实现团队的一套选型检查表</span></span></h3><div class="notion-text notion-block-38f2a29d094c49e1a4f84184604f5e37">与供应商或模型团队沟通时，可以直接逐项追问。</div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-c3760c5e825348b598ed1d0f8b061042" data-id="c3760c5e825348b598ed1d0f8b061042"><span><div id="c3760c5e825348b598ed1d0f8b061042" class="notion-header-anchor"></div><a class="notion-hash-link" href="#c3760c5e825348b598ed1d0f8b061042" title="输入链路"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">输入链路</span></span></h4><ul class="notion-list notion-list-disc notion-block-40f0757469da47fea0ca5eec582923de"><li>“视频流”是 RTP 视频轨道，还是客户端转 JPEG？</li></ul><ul class="notion-list notion-list-disc notion-block-0c8b0998cc5c4943a03a2b0884c4c795"><li>推荐和硬上限分别是多少 FPS、分辨率、单帧大小？</li></ul><ul class="notion-list notion-list-disc notion-block-60150588152a47f8b30557773cb5b3ed"><li>音频与视频是否使用同源时间戳？</li></ul><ul class="notion-list notion-list-disc notion-block-90c7f5be9ce141c886da6df38f155b12"><li>快速运动是否有事件驱动采样或专用视觉前端？</li></ul><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-e382de7a175147d29b70980611a38aac" data-id="e382de7a175147d29b70980611a38aac"><span><div id="e382de7a175147d29b70980611a38aac" class="notion-header-anchor"></div><a class="notion-hash-link" href="#e382de7a175147d29b70980611a38aac" title="模型状态"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">模型状态</span></span></h4><ul class="notion-list notion-list-disc notion-block-0c893264f7b94e41a3b3e9825876bb6f"><li>每个新块是否 incremental prefill？</li></ul><ul class="notion-list notion-list-disc notion-block-867377b5eccd430c919d19d75d7dd3a1"><li>KV Cache 是否跨 query / turn 复用？</li></ul><ul class="notion-list notion-list-disc notion-block-7ee02730e2834fe498db958d3448e972"><li>长会话如何滑窗、压缩或持久化？</li></ul><ul class="notion-list notion-list-disc notion-block-a8d730a3043c42cca270cabb1ccd5507"><li>静态画面会不会重复产生视觉 token？</li></ul><ul class="notion-list notion-list-disc notion-block-9bd030227eee40e1af6f8695c4bc7a78"><li>模型在不提问时是否持续更新视觉状态？</li></ul><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-8f56a9418e324e94b716ab3ebcd823f1" data-id="8f56a9418e324e94b716ab3ebcd823f1"><span><div id="8f56a9418e324e94b716ab3ebcd823f1" class="notion-header-anchor"></div><a class="notion-hash-link" href="#8f56a9418e324e94b716ab3ebcd823f1" title="轮次与打断"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">轮次与打断</span></span></h4><ul class="notion-list notion-list-disc notion-block-eae383426fd04675bc95e3785f3fc4d9"><li>只用 VAD，还是有语义 VAD、Speak Head 或流内控制 token？</li></ul><ul class="notion-list notion-list-disc notion-block-28db57b9ce0d4d8ea9f5d49660d8a249"><li>用户与模型重叠说话的数据是否进过训练？</li></ul><ul class="notion-list notion-list-disc notion-block-fe3e146584304ea38d894b59387821b2"><li>cancel 到音频真正停止播放的 P95 是多少？</li></ul><ul class="notion-list notion-list-disc notion-block-9f225d37b83642ec94c94b789718692e"><li>打断后保留哪些已生成文本、语音和视频状态？</li></ul><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-047718e60d5449deaaf8c3b435808798" data-id="047718e60d5449deaaf8c3b435808798"><span><div id="047718e60d5449deaaf8c3b435808798" class="notion-header-anchor"></div><a class="notion-hash-link" href="#047718e60d5449deaaf8c3b435808798" title="性能与部署"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">性能与部署</span></span></h4><ul class="notion-list notion-list-disc notion-block-a9a91782582243dc85708adfb892a53c"><li>latency 从哪里开始、在哪里结束？</li></ul><ul class="notion-list notion-list-disc notion-block-748fbdfd29694172a2206f521f0d5621"><li>是否报告首文本、首音频、RTF、P50 与 P95？</li></ul><ul class="notion-list notion-list-disc notion-block-c60f125610b94b42b63c4ba6b09daf38"><li>测试硬件、并发、输入长度和帧率是什么？</li></ul><ul class="notion-list notion-list-disc notion-block-4bdc72380741459b84f6970e66d17ec3"><li>batching、prefix cache 和多租户排队怎样影响单会话节奏？</li></ul><ul class="notion-list notion-list-disc notion-block-5ac65365d5484da697a858697c00a05d"><li>弱网下优先降帧、降分辨率还是降音频质量？</li></ul><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-b88f38342762423a8ec7c9c9b5b6fbb1" data-id="b88f38342762423a8ec7c9c9b5b6fbb1"><span><div id="b88f38342762423a8ec7c9c9b5b6fbb1" class="notion-header-anchor"></div><a class="notion-hash-link" href="#b88f38342762423a8ec7c9c9b5b6fbb1" title="评测"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">评测</span></span></h4><ul class="notion-list notion-list-disc notion-block-633e3d6dd2f4463db2ec667be0279290"><li>是否测试视觉在长会话中的持续贡献，而不只是单轮 VQA？</li></ul><ul class="notion-list notion-list-disc notion-block-2493dfad91da4eada8dad7f7fa1e4747"><li>是否包含沉默演示、主动提醒、快速打断和画外音？</li></ul><ul class="notion-list notion-list-disc notion-block-d62b62aedcd346f1aa4aea4c1c0188d7"><li>是否检查 captioning collapse 与 visual-stream ignorance？</li></ul><ul class="notion-list notion-list-disc notion-block-f72e8d312256427ba89a49ec1603368b"><li>是否用回答正确率反馈采样和码率策略？</li></ul><div class="notion-text notion-block-28143a0c4a61499181a1494915997c49">如果这些问题没有被量化，模型 demo 再自然，也很难推导出生产表现。</div><hr class="notion-hr notion-block-0cb0b222860a401ebcf66e3fe246b8ab"/><h3 class="notion-h notion-h2 notion-h-indent-0 notion-block-6f2be02df3ee4d8c9f4844d1a73f0527" data-id="6f2be02df3ee4d8c9f4844d1a73f0527"><span><div id="6f2be02df3ee4d8c9f4844d1a73f0527" class="notion-header-anchor"></div><a class="notion-hash-link" href="#6f2be02df3ee4d8c9f4844d1a73f0527" title="结语：未来的竞争点，是谁能维持一个低成本、可打断的“现在”"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">结语：未来的竞争点，是谁能维持一个低成本、可打断的“现在”</span></span></h3><div class="notion-text notion-block-7c479bb0eaed42178cfe24080ba91c33">过去的多模态模型把图片和音频变成更多 prompt token；今天的流式模型开始把<b>时间</b>本身变成一等公民。</div><div class="notion-text notion-block-4f5deedd28154da994a724ccc07814be">近半年的项目已经形成六条清晰路线：</div><ol start="1" class="notion-list notion-list-numbered notion-block-b5e71fdd48404aee97acf6bb8d7403f9" style="list-style-type:decimal"><li>用客户端采帧把视频降成稀疏视觉事件；</li></ol><ol start="2" class="notion-list notion-list-numbered notion-block-9515afe7e3eb4ff1a22b0377f79da4aa" style="list-style-type:decimal"><li>用分块编码、增量 prefill 和 KV Cache 保存正在发生；</li></ol><ol start="3" class="notion-list notion-list-numbered notion-block-084d191626ad40a99c51a55898fb0ba2" style="list-style-type:decimal"><li>用共享时间轴和显式触发学习何时开口；</li></ol><ol start="4" class="notion-list notion-list-numbered notion-block-453b89bd2dcb4789aac42cd909437d8f" style="list-style-type:decimal"><li>用异步 Interaction / Thinking 分层兼顾反应速度与推理深度；</li></ol><ol start="5" class="notion-list notion-list-numbered notion-block-c0527caa876d41839f739bae35173d91" style="list-style-type:decimal"><li>用模态专家和共享注意力承载具身多输入多输出；</li></ol><ol start="6" class="notion-list notion-list-numbered notion-block-8da4f726735a4a56801c7d76961da977" style="list-style-type:decimal"><li>用因果音视频 latent 与 flow matching 走向原生 AV2AV。</li></ol><div class="notion-text notion-block-ea15a4ae9058436c82d28c22aeeb1cfa">它们不是互斥替代关系。一个成熟系统很可能同时使用：端侧自适应采帧、RTC 拥塞控制、模型内共享时间轴、独立 Speak Head、异步工具层和流式语音 decoder。只有对虚拟角色等场景，才值得进一步承担原生视频生成的成本。</div><div class="notion-text notion-block-584ebab85c54453e89b69f2c864c19d9">真正稀缺的也不再只是更强的视觉问答能力，而是一个能够长期维持、持续更新、知道何时沉默、允许随时打断的“现在”。谁能用更低的 token、更少的重算和更稳定的尾延迟守住这个现在，谁才更接近真正的实时多模态。</div><hr class="notion-hr notion-block-cf50f4d621e74b0fb549c00cd99c6cdf"/><h3 class="notion-h notion-h2 notion-h-indent-0 notion-block-bb026f538ea64b01a92059c775559c25" data-id="bb026f538ea64b01a92059c775559c25"><span><div id="bb026f538ea64b01a92059c775559c25" class="notion-header-anchor"></div><a class="notion-hash-link" href="#bb026f538ea64b01a92059c775559c25" title="AI Agents 知识星球"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">AI Agents 知识星球</span></span></h3><div class="notion-text notion-block-9f944dc65f2b4d02a337df4e00f6835d">GUI Agents 技术发展迅猛，想紧跟 GUI/AI agents 技术前沿？我们的知识星球会<b>介绍 Agents 相关的最新项目和工具，并以视频方式解读最新论文</b>，为你开启技术新视野，快来加入吧！</div><div class="notion-sync-block notion-block-260c0110d3318122956bc21e46f27afe"><div class="notion-row notion-block-c9c046ed82664131ae54bf494960163c"><div class="notion-column notion-block-9bfca92ce87b4a2a902c7c1a729bdef6" style="width:calc((100% - (1 * min(32px, 4vw))) * 0.5)"><div class="notion-text notion-block-82a381c6c9884ac19e41aa9d99da6a76">加入知识星球，每周获取会员专享视频👇</div><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-260c0110d331810b9744c1a7d8ae37ce"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3Ad1adc9e1-7b6a-453a-a9f3-2e2e826a3b09%3Aimage.png?table=block&amp;id=260c0110-d331-810b-9744-c1a7d8ae37ce&amp;t=260c0110-d331-810b-9744-c1a7d8ae37ce" alt="notion image" loading="lazy" decoding="async"/></div></figure><div class="notion-blank notion-block-da4f816748d54d2fbe76f12d542a6fb1"> </div></div><div class="notion-spacer"></div><div class="notion-column notion-block-3c596795a25f4528adea89c89458d903" style="width:calc((100% - (1 * min(32px, 4vw))) * 0.5)"><div class="notion-text notion-block-a3ae1b26bc1a4c07855cf3305d202f0b">扫码加微信小助手为好友，备注「agent」，小助手会定期邀请入群👇</div><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-260c0110d33181c792dac1caa43a8fe7"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/https%3A%2F%2Fprod-files-secure.s3.us-west-2.amazonaws.com%2F9341931a-53f0-48e1-b026-0f1ad17b457c%2Feed2e715-74df-4361-bd15-bc084f0d791f%2Fimage.png?table=block&amp;id=260c0110-d331-81c7-92da-c1caa43a8fe7&amp;t=260c0110-d331-81c7-92da-c1caa43a8fe7&amp;width=337.741455078125&amp;cache=v2" alt="notion image" loading="lazy" decoding="async"/></div></figure></div><div class="notion-spacer"></div></div></div><div class="notion-sync-block notion-block-151c0110d33180b3ba16fe7b239b5be6"><div class="notion-text notion-block-446d571c1ef64379a26332ffa4bf728b"><b>当前星球包含的专享视频包括：</b></div><ul class="notion-list notion-list-disc notion-block-e279ee05d7d84f14867c4426e1c40dbb"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1fcSEBMEzr" target="_blank" rel="noopener noreferrer">AI-Agents 中的上下文工程（Context-Engineering）</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-ba3388c448dc4898b72965d6c8b0f98d"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV13wuozDExH" target="_blank" rel="noopener noreferrer">GUI Agents 最新技术综述（2025）</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-3fb739bf89304e2eab663f887c9d6266"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1EeTvzaEBw" target="_blank" rel="noopener noreferrer">GUI Agent 最新技术：MONDAY—从视频自动构建 GUI Agents 轨迹数据</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-b049f409ac8843daad060dac3491d7cb"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1MVG1zsEB7" target="_blank" rel="noopener noreferrer">GUI Agent 最新技术：InfiGUI-R1—从反应式执行向推理式决策的进阶之路</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-37b926f98a28482b93a183a226f56d3f"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1bmdzYzEty" target="_blank" rel="noopener noreferrer">GUI Agent 最新技术：自动驾驶与具身智能技术能带来哪些启示？</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-f54e2c5bc7e648b2aba39ab1985c65c6"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1uyRhY2EFi" target="_blank" rel="noopener noreferrer">GUI Agent 最新技术：ATLaS—同时提升训练效率和模型泛化性</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-0021ce23ee594382abfbedf06ee3582b"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1gm96YrEQY" target="_blank" rel="noopener noreferrer">GUI Agent 技术分享：DigiQ/VEM—使用 RL 提升模型的泛化能力</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-4f3f5fc916124dfb95912767379db9b9"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1pPFceFE42" target="_blank" rel="noopener noreferrer">UI Agent 技术分享： UI-TARS—利用长期记忆和反思调整迭代优化模型</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-989f4fc28f3243e5b2545363fc5bfae0"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1itwkerEyu" target="_blank" rel="noopener noreferrer">AI Agent 技术分享：Insight-V—探索 VLM 的长链条视觉推理能力</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-279ade68f2e74691befa0fd63d4bd627"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1hZcGe1ELm" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：PC-Agent—提升模型认知能力以便更好完成复杂任务</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-6da2c8d0d77148f988157bc8bca8fb05"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1aKrTY7EWB" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：OS-Genesis—自动合成高质量且多样化的训练数据</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-9e3d811d175f473080c7cccf21ae5e8b"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1u26hY5Eyw" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：PAE-通过自动探索新任务不断扩展模型能力</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-3d22b1de3c97465ea2ae3ca46f7f3322"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1dgCNYXEfa" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：Iris-通过自动构造的数据提升模型效果</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-fc8987322bf84ac883f1723c8fd47fe7"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV17VqfYfEjk" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：Falcon-UI—利用无监督数据预训练 UI Agent 模型</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-0bfba06238534895ad33829d495e0672"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1erqxYhEBc" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：Aguvis-来自 HKU &amp; Salesforce 的大一统训练数据和训练框架</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-16f47cc74840469885af43454f46a8d0"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1U86FY9E1G" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：ShowUI-当前最好的 UI Agents 开源模型，还适用中文 APP？</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-0c0eb8f030cd4a2fa702a8c8adabd98a"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1pjBtYnE6C" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：使用世界模型提升 UI Agents 效果？</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-64ec5513bf7445a38cb55d71224e3705"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV14eU7YWEEs" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：来自华为诺亚方舟实验室的 LiMAC</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-20f715d38a624d65acb65337d3f00620"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1c1mpYtEqG" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：来自 LG AI Research 的 Auto-Intent</a></b></span></li></ul><div class="notion-blank notion-block-1fe7ae2650754f9db74d20ee936a5a23"> </div></div><div class="notion-text notion-block-75727aa794324ebc93e00df29090acd8">&lt;ins/&gt;</div><h3 class="notion-h notion-h2 notion-h-indent-0 notion-block-86f18f7351d64a8f8d63d523563a8292" data-id="86f18f7351d64a8f8d63d523563a8292"><span><div id="86f18f7351d64a8f8d63d523563a8292" class="notion-header-anchor"></div><a class="notion-hash-link" href="#86f18f7351d64a8f8d63d523563a8292" title="参考资料"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">参考资料</span></span></h3><ol start="1" class="notion-list notion-list-numbered notion-block-d8a86ef837994a0e86838677ca2a5342" style="list-style-type:decimal"><li>Google AI for Developers, <a class="notion-link" href="https://ai.google.dev/gemini-api/docs/live-api" target="_blank" rel="noopener noreferrer">Live API</a> 与 <a class="notion-link" href="https://ai.google.dev/gemini-api/docs/live-api/capabilities" target="_blank" rel="noopener noreferrer">Live API capabilities</a>。</li></ol><ol start="2" class="notion-list notion-list-numbered notion-block-39c8aa06918f4ce19317a03b7f6c5349" style="list-style-type:decimal"><li>Alibaba Cloud Model Studio, <a class="notion-link" href="https://docs.qwencloud.com/developer-guides/speech/realtime-multimodal-speech" target="_blank" rel="noopener noreferrer">Qwen Realtime multimodal speech</a>。</li></ol><ol start="3" class="notion-list notion-list-numbered notion-block-7ab9d7e2e0604410b56b812b353aa38b" style="list-style-type:decimal"><li>Qwen Team, <a class="notion-link" href="https://arxiv.org/abs/2604.15804" target="_blank" rel="noopener noreferrer">Qwen3.5-Omni Technical Report</a>, 2026。</li></ol><ol start="4" class="notion-list notion-list-numbered notion-block-a9ad205d90bb4826ab9f5db7e7c470e2" style="list-style-type:decimal"><li>OpenBMB, <a class="notion-link" href="https://arxiv.org/abs/2604.27393" target="_blank" rel="noopener noreferrer">MiniCPM-o 4.5: A GPT-4o Level MLLM for Vision, Speech, and Full-Duplex Multimodal Live Streaming on End Devices</a>, 2026。</li></ol><ol start="5" class="notion-list notion-list-numbered notion-block-654d03ae3e4041c5a28d2c56bb33da53" style="list-style-type:decimal"><li>OpenBMB, <a class="notion-link" href="https://openbmb.github.io/MiniCPM-o-Demo/site/en/model.html" target="_blank" rel="noopener noreferrer">MiniCPM-o model documentation</a> 与 <a class="notion-link" href="https://minicpmo45.modelbest.cn/docs/en/realtime-api/overview/" target="_blank" rel="noopener noreferrer">Realtime API overview</a>。</li></ol><ol start="6" class="notion-list notion-list-numbered notion-block-cf3c20460ccb42a6907348fd853cb606" style="list-style-type:decimal"><li><a class="notion-link" href="https://arxiv.org/abs/2601.10323" target="_blank" rel="noopener noreferrer">ROMA: Real-Time Omni Multimodal Assistant with Speak-Time Prediction</a>, 2026。</li></ol><ol start="7" class="notion-list notion-list-numbered notion-block-846241a195554f6bae2dc561380502cb" style="list-style-type:decimal"><li>Muye Huang et al., <a class="notion-link" href="https://arxiv.org/abs/2606.09186" target="_blank" rel="noopener noreferrer">DuplexOmni: Real-Time Listening, Seeing, Thinking, and Speaking for Full-Duplex Interaction</a>, 2026。</li></ol><ol start="8" class="notion-list notion-list-numbered notion-block-c62be4ac11d54232967e3b470b38d888" style="list-style-type:decimal"><li>Muye Huang et al., <a class="notion-link" href="https://huggingface.co/MuyeHuang/DuplexOmni" target="_blank" rel="noopener noreferrer">DuplexOmni model card</a>。</li></ol><ol start="9" class="notion-list notion-list-numbered notion-block-ca1fda64b9854241ba3ac68900f9bf6a" style="list-style-type:decimal"><li>Siyin Wang et al., <a class="notion-link" href="https://arxiv.org/abs/2510.16756" target="_blank" rel="noopener noreferrer">End-to-end Listen, Look, Speak and Act</a>, ICLR 2026。</li></ol><ol start="10" class="notion-list notion-list-numbered notion-block-6841a6e8506545f5a46c1fa587d037f1" style="list-style-type:decimal"><li>ByteDance Research, <a class="notion-link" href="https://github.com/bytedance/SALMONN" target="_blank" rel="noopener noreferrer">SALMONN / ELLSA official repository</a>。</li></ol><ol start="11" class="notion-list notion-list-numbered notion-block-f1f70f3d88414277936e8c90d010ae2c" style="list-style-type:decimal"><li>Alibaba Wan Team, <a class="notion-link" href="https://arxiv.org/abs/2606.25041" target="_blank" rel="noopener noreferrer">Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models</a>, 2026。</li></ol><ol start="12" class="notion-list notion-list-numbered notion-block-6006415d442e498a86e97daad1f33f27" style="list-style-type:decimal"><li>Alibaba Wan Team, <a class="notion-link" href="https://arxiv.org/abs/2607.15038" target="_blank" rel="noopener noreferrer">Video = World + Event Stream</a> 与 <a class="notion-link" href="https://wan-streamer.com/v0.3/" target="_blank" rel="noopener noreferrer">Wan-Streamer v0.3 项目页</a>, 2026。</li></ol><ol start="13" class="notion-list notion-list-numbered notion-block-8ee89240d82d42a5ac8bbd332bda5819" style="list-style-type:decimal"><li><a class="notion-link" href="https://arxiv.org/abs/2602.12641" target="_blank" rel="noopener noreferrer">Artic: AI-Oriented Real-Time Interactive Communication for Video Assistants</a>, 2026。</li></ol><ol start="14" class="notion-list notion-list-numbered notion-block-a99a5d0539844d848a7f77c9c3d6344c" style="list-style-type:decimal"><li>vLLM-Omni, <a class="notion-link" href="https://docs.vllm.ai/projects/vllm-omni/en/latest/serving/video_stream_api/" target="_blank" rel="noopener noreferrer">Streaming Video Chat API</a>。</li></ol><ol start="15" class="notion-list notion-list-numbered notion-block-d73ab582ffed47e18042c12444fe5879" style="list-style-type:decimal"><li>百度智能云, <a class="notion-link" href="https://cloud.baidu.com/product/RTC/multimodal.html" target="_blank" rel="noopener noreferrer">多模态互动 RTC</a>。</li></ol><ol start="16" class="notion-list notion-list-numbered notion-block-f2390e87d44d496791e733e752cea474" style="list-style-type:decimal"><li><a class="notion-link" href="https://arxiv.org/abs/2605.30256" target="_blank" rel="noopener noreferrer">VideoFDB: A Benchmark for Full-Duplex Audio-Visual Conversational Agents</a>, 2026。</li></ol><ol start="17" class="notion-list notion-list-numbered notion-block-f37dba20894f41b8bf06b4a9821f4e49" style="list-style-type:decimal"><li>Alibaba Cloud Model Studio, <a class="notion-link" href="https://help.aliyun.com/en/model-studio/realtime" target="_blank" rel="noopener noreferrer">Qwen Realtime limits and specifications</a>。</li></ol><ol start="18" class="notion-list notion-list-numbered notion-block-b59c2383dd164e92a2ab376c2aa3e13b" style="list-style-type:decimal"><li>OpenAI, <a class="notion-link" href="https://developers.openai.com/api/docs/models/gpt-realtime" target="_blank" rel="noopener noreferrer">GPT-Realtime model</a> 与 <a class="notion-link" href="https://openai.com/index/introducing-gpt-realtime/" target="_blank" rel="noopener noreferrer">Introducing gpt-realtime and Realtime API updates for production voice agents</a>。</li></ol><ol start="19" class="notion-list notion-list-numbered notion-block-6252859fb99e443a9352c1fc3c8809da" style="list-style-type:decimal"><li>Hugging Face Transformers, <a class="notion-link" href="https://huggingface.co/docs/transformers/model_doc/qwen3_5" target="_blank" rel="noopener noreferrer">Qwen3.5 model documentation</a>。</li></ol><ol start="20" class="notion-list notion-list-numbered notion-block-8da842db4f494471b8e72b80cdbf6a28" style="list-style-type:decimal"><li>OpenBMB, <a class="notion-link" href="https://huggingface.co/openbmb/MiniCPM-o-4_5" target="_blank" rel="noopener noreferrer">MiniCPM-o 4.5 official model card</a> 与 <a class="notion-link" href="https://huggingface.co/openbmb/MiniCPM-o-4_5/blob/main/modeling_minicpmo.py" target="_blank" rel="noopener noreferrer">official </a><code class="notion-inline-code"><a class="notion-link" href="https://huggingface.co/openbmb/MiniCPM-o-4_5/blob/main/modeling_minicpmo.py" target="_blank" rel="noopener noreferrer">modeling_minicpmo.py</a></code>。</li></ol><ol start="21" class="notion-list notion-list-numbered notion-block-cbbbf36ca79c4f6483704358d96a306d" style="list-style-type:decimal"><li>Muye Huang et al., <a class="notion-link" href="https://github.com/MuyeHuang/DuplexOmni" target="_blank" rel="noopener noreferrer">DuplexOmni official repository</a>、<a class="notion-link" href="https://github.com/MuyeHuang/DuplexOmni/blob/main/training_framework/README.md" target="_blank" rel="noopener noreferrer">training framework</a>、<a class="notion-link" href="https://github.com/MuyeHuang/DuplexOmni/blob/main/training_framework/qwen3_omni_training/swift/megatron/model/mm_gpt/qwen3_omni_e2e.py" target="_blank" rel="noopener noreferrer">E2E loss computation</a>、<a class="notion-link" href="https://github.com/MuyeHuang/DuplexOmni/blob/main/training_framework/qwen3_omni_training/swift/megatron/trainers/e2e_trainer.py" target="_blank" rel="noopener noreferrer">loss aggregation</a> 与 <a class="notion-link" href="https://github.com/MuyeHuang/DuplexOmni/blob/main/inference_framework/realtime_serving/omni_realtime_server.py" target="_blank" rel="noopener noreferrer">realtime S1–S2 implementation</a>。</li></ol><ol start="22" class="notion-list notion-list-numbered notion-block-8c72536d41204dad848972c923ce1d08" style="list-style-type:decimal"><li>ByteDance Research, <a class="notion-link" href="https://github.com/bytedance/SALMONN/tree/ELLSA" target="_blank" rel="noopener noreferrer">ELLSA official branch</a>、<a class="notion-link" href="https://github.com/bytedance/SALMONN/blob/ELLSA/reference/Emu3/emu3/mllm/modeling_emu3_mix.py" target="_blank" rel="noopener noreferrer">SA-MoE implementation and loss computation</a> 与 <a class="notion-link" href="https://github.com/bytedance/SALMONN/blob/ELLSA/train/train_moe.py" target="_blank" rel="noopener noreferrer">training entry</a>。</li></ol><ol start="23" class="notion-list notion-list-numbered notion-block-c2cca2cb537648c9a458dfcd5302f77c" style="list-style-type:decimal"><li>Alibaba Wan Team, <a class="notion-link" href="https://arxiv.org/abs/2607.04443" target="_blank" rel="noopener noreferrer">Wan-Streamer v0.2: Higher Resolution, Same Latency</a> 与 <a class="notion-link" href="https://wan-streamer.com/v0.2/" target="_blank" rel="noopener noreferrer">v0.2 project page</a>, 2026。</li></ol><hr class="notion-hr notion-block-8a2c30cb033f47a9945955ea7db9ce55"/></main></div>]]></content:encoded>
        </item>
        <item>
            <title><![CDATA[企业 AI 转型路线图：从单点试验到可规模化能力]]></title>
            <link>https://www.breezedeus.com/article/enterprise-ai-transform-roadmap</link>
            <guid>https://www.breezedeus.com/article/enterprise-ai-transform-roadmap</guid>
            <pubDate>Sat, 25 Jul 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[本文基于微软《The AI Strategy Roadmap》，总结企业 AI 从单点试验走向规模化的关键：从边界清晰、结果可测的真实业务问题开始；把数据契约、评测集、权限、监控和人工接管沉淀为可复用资产；再用清晰的组织责任与治理机制，把一次成功复制到下一个用例。真正值得规模化的，不是又上线一个 Agent，而是又验证并积累一套能重复交付业务结果的组织能力。]]></description>
            <content:encoded><![CDATA[<div id="notion-article" class="mx-auto overflow-hidden "><main class="notion light-mode notion-page notion-block-3a8c0110d331808190c5e8e54a9d8d5c"><div class="notion-viewport"></div><div class="notion-collection-page-properties"></div><div class="notion-row notion-block-819c0110d33183308642012ec8a50242"><div class="notion-column notion-block-ce5c0110d331824798048128c5fe6c11" style="width:calc((100% - (2 * min(32px, 4vw))) * 0.25)"><div class="notion-blank notion-block-b01c0110d33183ed84e2810761bfe0a1"> </div></div><div class="notion-spacer"></div><div class="notion-column notion-block-8ecc0110d3318389a5cf0180496801ef" style="width:calc((100% - (2 * min(32px, 4vw))) * 0.5416666666666665)"><div class="notion-text notion-block-609c0110d3318380a06481dd7bf76b32"><b><a class="notion-link" href="https://www.breezedeus.com/" target="_blank" rel="noopener noreferrer">Home</a></b><b> | </b><b><a class="notion-link" href="https://github.com/breezedeus" target="_blank" rel="noopener noreferrer">GitHub</a></b><b> | </b><b><a class="notion-link" href="https://twitter.com/breezedeus" target="_blank" rel="noopener noreferrer">Twitter</a></b><b> | </b><b><a class="notion-link" href="https://www.youtube.com/@breezedeus" target="_blank" rel="noopener noreferrer">Youtube</a></b><b>  |  </b><b><a class="notion-link" href="https://space.bilibili.com/509307267" target="_blank" rel="noopener noreferrer">Bilibili</a></b></div></div><div class="notion-spacer"></div><div class="notion-column notion-block-0c9c0110d3318258ba9a01905e02284a" style="width:calc((100% - (2 * min(32px, 4vw))) * 0.2083333333333335)"><div class="notion-blank notion-block-c6cc0110d3318202a2d581e3eaa8e6f7"> </div></div><div class="notion-spacer"></div></div><div class="notion-row notion-block-15fc0110d3318223a577017938a1bf58"><div class="notion-column notion-block-898c0110d331827787c50177affb85ba" style="width:calc((100% - (1 * min(32px, 4vw))) * 0.5)"><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-3a9c0110d331805dbab1e4ee1ce6d223"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3A022b5fb2-cec9-4b09-b927-bfe5f08c35fb%3Aimage.png?table=block&amp;id=3a9c0110-d331-805d-bab1-e4ee1ce6d223&amp;t=3a9c0110-d331-805d-bab1-e4ee1ce6d223" alt="notion image" loading="lazy" decoding="async"/></div></figure></div><div class="notion-spacer"></div><div class="notion-column notion-block-a15c0110d331821d82b5010c2c0cc0ec" style="width:calc((100% - (1 * min(32px, 4vw))) * 0.5)"><div class="notion-text notion-block-745c0110d33182d3ab0081be4a8fa214"><b>目录：</b></div><div class="notion-table-of-contents notion-gray notion-block-7e0c0110d331832eabb3015c6df1110f"><a href="#3a8c0110d3318082871ce4edd3f691b0" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:0">引子：为什么 AI 演示越来越多，能稳定运行的系统却不多</span></a><a href="#3a8c0110d33180d3bc30e1a85f608fd3" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:0">一、先判断自己在哪里：把 AI 成熟度画成一张矩阵</span></a><a href="#3a8c0110d33180b2b90de39e4772a516" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:0">二、从第一个业务问题开始</span></a><a href="#3a8c0110d3318029860af3af33b51c70" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:24px">一个贯穿示例：客服工单分流</span></a><a href="#3a8c0110d3318084bacfdf377adfc71a" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:0">三、规模化的核心：让每次交付都留下可复用资产</span></a><a href="#3a8c0110d331803b9b9ef506ec92d31e" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:0">四、把信任变成可以检查的系统证据</span></a><a href="#3a8c0110d33180bea017da6f2ea015b0" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:0">五、技术可以快速复制，组织的工作方式不能一键安装</span></a><a href="#3a8c0110d33180299621d8be1515dccc" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:0">六、一条可执行的三阶段路线</span></a><a href="#3a8c0110d33180eeae18e2aabe11f14e" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:24px">第一阶段：选定一个问题，定义“成功”和“不能失败”</span></a><a href="#3a8c0110d3318009a194e760d7daf003" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:24px">第二阶段：把试点当成生产系统的早期版本</span></a><a href="#3a8c0110d331808ead29c1caa1280b5c" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:24px">第三阶段：复制经过验证的交付模式</span></a><a href="#3a8c0110d3318061ac72e37538b9aa87" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:0">结语：不要问“我们上线了多少 AI”，要问“我们学会了什么”</span></a><a href="#9bbc0110d33183509787813ec031fda8" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:0">AI Agents 知识星球</span></a><a href="#f25c0110d331820b86aa010c9ec15562" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:0">参考文献</span></a></div><div class="notion-blank notion-block-585c0110d3318330a3900147edd1e530"> </div></div><div class="notion-spacer"></div></div><blockquote class="notion-quote notion-block-3a8c0110d331804eaf8fe59a54e15957"><div>真正值得规模化的不是某个 Agent，而是一套能够重复交付业务结果的组织能力</div></blockquote><h3 class="notion-h notion-h2 notion-h-indent-0 notion-block-3a8c0110d3318082871ce4edd3f691b0" data-id="3a8c0110d3318082871ce4edd3f691b0"><span><div id="3a8c0110d3318082871ce4edd3f691b0" class="notion-header-anchor"></div><a class="notion-hash-link" href="#3a8c0110d3318082871ce4edd3f691b0" title="引子：为什么 AI 演示越来越多，能稳定运行的系统却不多"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>引子：为什么 AI 演示越来越多，能稳定运行的系统却不多</b></span></span></h3><div class="notion-text notion-block-3a8c0110d33180958b6edee7b3c2aae4">很多企业已经不缺 AI 想法。</div><div class="notion-text notion-block-3a8c0110d33180948e4fcdf1b4fa7c54">客服希望自动分流和回复，销售希望生成商机洞察，法务希望加快合同审查，IT 希望让 Agent 处理服务台工单。做出一个可演示的原型通常也不再困难。真正困难的部分发生在演示之后：谁为结果负责？系统应该访问哪些数据？错误率达到什么水平才能上线？成本是否会随着调用量失控？一旦 Agent 能够调用工具，谁来管理它的身份、权限与行动记录？</div><div class="notion-text notion-block-3a8c0110d33180d0938bc6006859d817">这些问题解释了为什么“做出一个 AI 应用”和“把 AI 变成企业能力”之间隔着很长一段路。</div><div class="notion-text notion-block-3a8c0110d33180139393d5b3843103fc">微软在《The AI Strategy Roadmap》中把后一种变化称为 Frontier Transformation：AI 不再停留在零散的效率工具，而是进入关键业务流程，与人的判断、组织的规则和现有系统共同工作。报告将这套转型拆成<b>五个相互依赖的驱动因素：业务战略、技术与数据、AI 交付经验、组织与文化、治理与安全</b>。</div><div class="notion-text notion-block-3a8c0110d3318000a824c605e32b2308">这份报告的依据包括 70 位企业 IT 与业务决策者的深度访谈，以及微软自身和客户项目中的经验。访谈覆盖 AI 应用进展较快、推进谨慎和相对滞后的组织，时间集中在 2026 年 2 月 23 日至 3 月 13 日。它适合用来识别反复出现的组织模式，但由于样本是定性访谈且研究由微软赞助，不应把其中的经验直接当成全行业的因果定律。</div><div class="notion-text notion-block-3a8c0110d3318015bb94e81ad78c9989">如果把报告的 66 页压缩成一句话，最值得保留的判断是：</div><blockquote class="notion-quote notion-block-3a8c0110d33180ccae12e5054343e0f8"><div><b>企业 AI 规模化的真正单位，不是“又上线了一个用例”，而是“又验证并沉淀了一套可复用的交付模式”。</b></div></blockquote><div class="notion-text notion-block-3a8c0110d331804e9f2dd7ad9cde702a">一个成功用例若只留下了一段代码，它仍然是孤岛；如果它同时留下业务指标、数据契约、评测方法、权限边界、监控告警、人工接管规则和复盘记录，下一个团队才有可能更快、更稳地复制成功。</div><h3 class="notion-h notion-h2 notion-h-indent-0 notion-block-3a8c0110d33180d3bc30e1a85f608fd3" data-id="3a8c0110d33180d3bc30e1a85f608fd3"><span><div id="3a8c0110d33180d3bc30e1a85f608fd3" class="notion-header-anchor"></div><a class="notion-hash-link" href="#3a8c0110d33180d3bc30e1a85f608fd3" title="一、先判断自己在哪里：把 AI 成熟度画成一张矩阵"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>一、先判断自己在哪里：把 AI 成熟度画成一张矩阵</b></span></span></h3><div class="notion-text notion-block-3a8c0110d331808cbd11e6f5e8c3f2a0">报告把企业 AI 准备度分为五个阶段：<b>探索、规划、实施、规模化和价值实现</b>。</div><table class="notion-simple-table notion-block-3a8c0110d33180d69916c463f8e069ef"><tbody><tr class="notion-simple-table-row notion-simple-table-header-row notion-block-3a8c0110d331801c9437db5f0da4e0ca"><td class="" style="width:87px"><div class="notion-simple-table-cell">阶段</div></td><td class="" style="width:283px"><div class="notion-simple-table-cell">组织的典型状态</div></td><td class="" style="width:295px"><div class="notion-simple-table-cell">下一步真正要解决的问题</div></td></tr><tr class="notion-simple-table-row notion-block-3a8c0110d33180dc886ef1a3f8e8ffa1"><td class="" style="width:87px"><div class="notion-simple-table-cell">探索</div></td><td class="" style="width:283px"><div class="notion-simple-table-cell">各团队零散试用，价值主要靠案例讲述</div></td><td class="" style="width:295px"><div class="notion-simple-table-cell">选定一个业务问题，停止无边界试验</div></td></tr><tr class="notion-simple-table-row notion-block-3a8c0110d33180d48355debf642b05a4"><td class="" style="width:87px"><div class="notion-simple-table-cell">规划</div></td><td class="" style="width:283px"><div class="notion-simple-table-cell">开始排用例优先级，建立初步指标与护栏</div></td><td class="" style="width:295px"><div class="notion-simple-table-cell">让业务、技术、数据和风险团队共同负责</div></td></tr><tr class="notion-simple-table-row notion-block-3a8c0110d33180028d8df478e2fbee86"><td class="" style="width:87px"><div class="notion-simple-table-cell">实施</div></td><td class="" style="width:283px"><div class="notion-simple-table-cell">少量用例进入真实流程，开始积累运行数据</div></td><td class="" style="width:295px"><div class="notion-simple-table-cell">证明可靠性、安全性、采用率和业务价值</div></td></tr><tr class="notion-simple-table-row notion-block-3a8c0110d331802baee3ebd3a38ffa94"><td class="" style="width:87px"><div class="notion-simple-table-cell">规模化</div></td><td class="" style="width:283px"><div class="notion-simple-table-cell">共用平台、资产、生命周期管理和培训体系逐渐形成</div></td><td class="" style="width:295px"><div class="notion-simple-table-cell">把单次成功变成可重复交付能力</div></td></tr><tr class="notion-simple-table-row notion-block-3a8c0110d33180588ae1e36d005d6e75"><td class="" style="width:87px"><div class="notion-simple-table-cell">价值实现</div></td><td class="" style="width:283px"><div class="notion-simple-table-cell">AI 成为日常业务能力，价值持续测量和改进</div></td><td class="" style="width:295px"><div class="notion-simple-table-cell">让组织从每次运行中继续学习，而不是停在“已上线”</div></td></tr></tbody></table><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-3a8c0110d3318069b18cfab89385e42d"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3A16c5b213-e21a-453f-90dd-4d946fd26997%3A01-%E4%BA%94%E7%BB%B4%E6%88%90%E7%86%9F%E5%BA%A6%E7%9F%A9%E9%98%B5.svg?table=block&amp;id=3a8c0110-d331-8069-b18c-fab89385e42d&amp;t=3a8c0110-d331-8069-b18c-fab89385e42d" alt="notion image" loading="lazy" decoding="async"/></div></figure><blockquote class="notion-quote notion-block-3a8c0110d33180fbb1cacc46e2480411"><div>五维成熟度矩阵：组织不一定在所有维度处于同一阶段，应优先修复最先截断业务闭环的短板。</div></blockquote><div class="notion-text notion-block-3a8c0110d33180b9bf5fc5dd6d1f395c">这五级看似是一条阶梯，实际更像一张矩阵。同一家企业可能已经有成熟的数据平台，却仍然没有清晰的用例组合；某个业务部门可能在规模化 Agent，另一个部门还在学习基本使用方法；安全团队可能建立了严格审查，却没有足够的可观测性来判断系统上线后的真实行为。</div><div class="notion-blank notion-block-3a8c0110d3318035bef6cb8f38185850"> </div><div class="notion-text notion-block-3a8c0110d331804aa891e76cc52db94c">因此，成熟度评估不应只问“我们属于第几级”，而要沿着五个维度分别提问：</div><ul class="notion-list notion-list-disc notion-block-3a8c0110d33180d58aefc8a9c4564ee1"><li>业务：每个用例是否对应明确的业务问题和基线指标？</li></ul><ul class="notion-list notion-list-disc notion-block-3a8c0110d331804ea2ccfb6d8975e3f6"><li>数据与技术：系统能否稳定取得可信数据，并以可预测的成本运行？</li></ul><ul class="notion-list notion-list-disc notion-block-3a8c0110d33180c59ffcd14a5b7d75d9"><li>交付：团队是否能持续评测、部署、监控和改进 AI 系统？</li></ul><ul class="notion-list notion-list-disc notion-block-3a8c0110d33180e28b82de68909a3b7e"><li>组织：员工是否知道为什么使用、如何使用，以及何时必须依靠人的判断？</li></ul><ul class="notion-list notion-list-disc notion-block-3a8c0110d331803fab30cd1219fcadbf"><li>治理：从审批、上线到变更、事故和退役，责任是否清楚、过程是否可审计？</li></ul><div class="notion-text notion-block-3a8c0110d3318023b5b5e6473ecac9cc">短板往往不是平均分最低的那一项，而是最先截断业务闭环的那一项。</div><h3 class="notion-h notion-h2 notion-h-indent-0 notion-block-3a8c0110d33180b2b90de39e4772a516" data-id="3a8c0110d33180b2b90de39e4772a516"><span><div id="3a8c0110d33180b2b90de39e4772a516" class="notion-header-anchor"></div><a class="notion-hash-link" href="#3a8c0110d33180b2b90de39e4772a516" title="二、从第一个业务问题开始"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>二、从第一个业务问题开始</b></span></span></h3><div class="notion-text notion-block-3a8c0110d331804cbdf1dc8ce92c1625">报告反复强调“从小处开始”，但“小”很容易被误解成便宜、简单或不重要。更准确的含义是：<b>边界足够清楚，结果可以观测，风险可以控制，团队能够在一次交付中完成学习闭环。</b></div><div class="notion-text notion-block-3a8c0110d3318053bb82f313d8add429">一个适合作为起点的用例，通常应同时满足几项条件：</div><table class="notion-simple-table notion-block-3a8c0110d33180c39e87ef455c90c620"><tbody><tr class="notion-simple-table-row notion-simple-table-header-row notion-block-3a8c0110d331807f8165e3cfaff79e79"><td class="" style="width:96px"><div class="notion-simple-table-cell">判断维度</div></td><td class="" style="width:303px"><div class="notion-simple-table-cell">需要回答的问题</div></td><td class="" style="width:290px"><div class="notion-simple-table-cell">可留下的证据</div></td></tr><tr class="notion-simple-table-row notion-block-3a8c0110d33180b4a8e4cf11541317eb"><td class="" style="width:96px"><div class="notion-simple-table-cell">业务价值</div></td><td class="" style="width:303px"><div class="notion-simple-table-cell">它解决的是哪一个具体摩擦、成本或风险？</div></td><td class="" style="width:290px"><div class="notion-simple-table-cell">当前基线、目标指标、受影响流程</div></td></tr><tr class="notion-simple-table-row notion-block-3a8c0110d33180ae844bf30d1dbeb5e6"><td class="" style="width:96px"><div class="notion-simple-table-cell">用户体验</div></td><td class="" style="width:303px"><div class="notion-simple-table-cell">谁会使用或受到影响？他们为什么愿意改变原有做法？</div></td><td class="" style="width:290px"><div class="notion-simple-table-cell">采用率、完成率、人工接管率、反馈</div></td></tr><tr class="notion-simple-table-row notion-block-3a8c0110d33180d2a8f4e4a46a548f39"><td class="" style="width:96px"><div class="notion-simple-table-cell">技术与数据</div></td><td class="" style="width:303px"><div class="notion-simple-table-cell">所需数据是否可得、含义一致、质量可控？</div></td><td class="" style="width:290px"><div class="notion-simple-table-cell">数据清单、接口依赖、质量报告</div></td></tr><tr class="notion-simple-table-row notion-block-3a8c0110d331805c8404e42e7093c5b5"><td class="" style="width:96px"><div class="notion-simple-table-cell">风险</div></td><td class="" style="width:303px"><div class="notion-simple-table-cell">错误会造成什么后果？是否可以发现、阻断和恢复？</div></td><td class="" style="width:290px"><div class="notion-simple-table-cell">风险分级、权限边界、升级与回退方案</div></td></tr><tr class="notion-simple-table-row notion-block-3a8c0110d33180838846f2e92cfbe1fe"><td class="" style="width:96px"><div class="notion-simple-table-cell">扩展性</div></td><td class="" style="width:303px"><div class="notion-simple-table-cell">成功后能否复用到相邻流程，而不必推倒重来？</div></td><td class="" style="width:290px"><div class="notion-simple-table-cell">可复用组件、评测集、模板与文档</div></td></tr></tbody></table><div class="notion-text notion-block-3a8c0110d33180b680faf48bd175404e">这比“哪个部门最想用 AI”更接近正确的优先级判断。</div><div class="notion-text notion-block-3a8c0110d331802a8a7ff0f56335f471">例如，客服助手的首要指标未必是“生成了多少条回复”，而可能是首次响应时间、转人工比例、问题解决时长和错误升级率；合同审查工具也不应只计算节省了多少小时，还要观察漏检、误报、审查覆盖率以及法务最终采纳情况。报告列举客服、销售、人力、法务和 IT 场景的意义，就在于把 Agent 的动作与业务结果放进同一张表。</div><div class="notion-text notion-block-3a8c0110d33180bc9814df5bce4e30ba">先选一个窄用例，还有一个更重要的作用：把那些在会议中看不见的问题提前暴露出来。数据字段可能含义不一致，权限审批可能没有负责人，模型输出可能无法被现有系统接收，用户可能根本不信任结果。试点除了验证“AI 能做什么”，还要用较低成本找出企业为了让它稳定工作所缺的条件。</div><div class="notion-text notion-block-3a8c0110d331807d8889fa93db9199d0">所以，好的第一个用例应该像一辆探路车。</div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-3a8c0110d3318029860af3af33b51c70" data-id="3a8c0110d3318029860af3af33b51c70"><span><div id="3a8c0110d3318029860af3af33b51c70" class="notion-header-anchor"></div><a class="notion-hash-link" href="#3a8c0110d3318029860af3af33b51c70" title="一个贯穿示例：客服工单分流"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>一个贯穿示例：客服工单分流</b></span></span></h4><div class="notion-text notion-block-3a8c0110d33180708504f178f8fdb2a5">假设一家企业先把范围限定为“将已登录客户的售后工单分到正确队列”，不让 AI 直接退款或回复客户。上线前，团队记录当前的错分率、平均转派次数和首次分派耗时，再从脱敏的历史工单中构建评测集。验收规则也一并写清：涉及退款、账户安全或低置信度的工单，必须转交人工。</div><div class="notion-text notion-block-3a8c0110d3318081956bdff605dd8889">受控试运行中，业务团队判断分类结果是否可用，工程团队监控延迟与成本，数据团队检查字段质量，安全团队审查访问权限和日志。只有预设阈值达标后，系统才逐步放量。项目结束时，团队留下分类标签、数据契约、评测集、权限模板、监控规则和人工接管流程。下一个“客户邮件分流”用例便可复用其中一部分，而不必从头建设。</div><h3 class="notion-h notion-h2 notion-h-indent-0 notion-block-3a8c0110d3318084bacfdf377adfc71a" data-id="3a8c0110d3318084bacfdf377adfc71a"><span><div id="3a8c0110d3318084bacfdf377adfc71a" class="notion-header-anchor"></div><a class="notion-hash-link" href="#3a8c0110d3318084bacfdf377adfc71a" title="三、规模化的核心：让每次交付都留下可复用资产"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>三、规模化的核心：让每次交付都留下可复用资产</b></span></span></h3><div class="notion-text notion-block-3a8c0110d33180438778e957137820e2">试点进入生产后，企业很容易掉进第二个陷阱：每个团队重新选模型、接数据、写提示词、做安全评审、搭监控。项目数量增加了，交付速度却没有变快，风险还在重复出现。</div><div class="notion-text notion-block-3a8c0110d331808f9d46dbedac32e66a">报告把数据准备视为关键路径。企业首先要知道有哪些数据、谁能访问、哪些字段缺失、不同系统如何定义“客户”“订单”“区域”等核心实体，以及当多个来源互相矛盾时谁是可信版本。没有这些约定，模型拿到的数据越多，未必越聪明，也可能只是更有把握地输出不一致的答案。</div><div class="notion-text notion-block-3a8c0110d33180de8023f6657cb25e73">数据之外，还需要一层共享基础设施，但建设顺序很重要。报告并不主张在第一个用例之前就完成一座庞大的“AI 中台”，而是建议先通过有限用例验证可靠性，再逐步沉淀共用能力：</div><ul class="notion-list notion-list-disc notion-block-3a8c0110d33180459488c276c471cc0f"><li>统一的身份、权限与数据访问模式；</li></ul><ul class="notion-list notion-list-disc notion-block-3a8c0110d33180bc9e5ccbfad286ab8a"><li>模型、工具和业务系统的连接规范；</li></ul><ul class="notion-list notion-list-disc notion-block-3a8c0110d331805aa292ff8d64f76315"><li>版本管理、评测、监控、成本与生命周期管理；</li></ul><ul class="notion-list notion-list-disc notion-block-3a8c0110d33180dc95b6ce60d28f8667"><li>可复用的提示词、组件、参考架构和治理模板；</li></ul><ul class="notion-list notion-list-disc notion-block-3a8c0110d3318011a009c5ddae83947c"><li>故障时的降级、隔离、回退和人工接管路径。</li></ul><div class="notion-text notion-block-3a8c0110d33180e69a05fd5e826dbbf1">这也改变了“买、扩展还是自研”的判断。标准化、没有差异化价值的能力可以优先购买；已有平台能够安全扩展的部分，不必从零重建；只有真正构成业务差异、且组织有能力长期运营的部分，才值得承担全栈自研的成本。4</div><div class="notion-text notion-block-3a8c0110d33180b59d47d6ec6bbea0e8">据此，本文建议每个投产用例至少沉淀七类资产：</div><ol start="1" class="notion-list notion-list-numbered notion-block-3a8c0110d3318028b47ef543626af836" style="list-style-type:decimal"><li>业务目标与指标基线；</li></ol><ol start="2" class="notion-list notion-list-numbered notion-block-3a8c0110d331802b9135d6df40ee7ec9" style="list-style-type:decimal"><li>数据来源、定义、质量标准与访问规则；</li></ol><ol start="3" class="notion-list notion-list-numbered notion-block-3a8c0110d3318070836ccc697b6b28e3" style="list-style-type:decimal"><li>代表真实任务的评测集和验收阈值；</li></ol><ol start="4" class="notion-list notion-list-numbered notion-block-3a8c0110d33180368958e99564cb67b6" style="list-style-type:decimal"><li>模型、提示词、工具与流程的版本记录；</li></ol><ol start="5" class="notion-list notion-list-numbered notion-block-3a8c0110d331804e82d3e6a78ed1a27b" style="list-style-type:decimal"><li>安全护栏、异常升级和人工接管机制；</li></ol><ol start="6" class="notion-list notion-list-numbered notion-block-3a8c0110d3318057b34ec56fb1e1d6f3" style="list-style-type:decimal"><li>延迟、可靠性、采用率、风险和成本等运行数据；</li></ol><ol start="7" class="notion-list notion-list-numbered notion-block-3a8c0110d33180f581b6d97636d85cc9" style="list-style-type:decimal"><li>复盘结论，以及哪些部分可以被下一个用例复用。</li></ol><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-3a8c0110d33180c793d5fcb4eed39566"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3A71cfa92e-4a6a-4099-9142-cb3f04cbf723%3A02-%E5%8F%AF%E5%A4%8D%E7%94%A8%E4%BA%A4%E4%BB%98%E6%A8%A1%E5%BC%8F.png?table=block&amp;id=3a8c0110-d331-80c7-93d5-fcb4eed39566&amp;t=3a8c0110-d331-80c7-93d5-fcb4eed39566" alt="notion image" loading="lazy" decoding="async"/></div></figure><blockquote class="notion-quote notion-block-3a8c0110d331800e8268c6ac6b37c35f"><div>可复用交付模式：代码只是资产之一。每次交付还要留下指标、数据、评测、治理与复盘，才能让后续用例更快、更稳。</div></blockquote><div class="notion-text notion-block-3a8c0110d33180e193e1ee610e1db4a2">这套做法接近报告所说的 <b>GenAIOps 和 Agentic DevOps：管理对象从代码扩展到模型、数据、提示词、Agent 逻辑、评测和集成关系</b>。5 当这些资产进入版本化的公共知识库，企业得到的就不只是一个应用，而是一条越来越成熟的“AI 交付流水线”。</div><h3 class="notion-h notion-h2 notion-h-indent-0 notion-block-3a8c0110d331803b9b9ef506ec92d31e" data-id="3a8c0110d331803b9b9ef506ec92d31e"><span><div id="3a8c0110d331803b9b9ef506ec92d31e" class="notion-header-anchor"></div><a class="notion-hash-link" href="#3a8c0110d331803b9b9ef506ec92d31e" title="四、把信任变成可以检查的系统证据"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>四、把信任变成可以检查的系统证据</b></span></span></h3><div class="notion-text notion-block-3a8c0110d33180a38bfec1a641e39c9f">企业谈 AI 采用时，常把“信任”理解成用户愿不愿意尝试。实际上，信任至少有三层：</div><ul class="notion-list notion-list-disc notion-block-3a8c0110d33180c49376d3421c36da92"><li><b>结果可信：</b> 系统在什么任务上表现可靠，误差和边界是否被测量？</li></ul><ul class="notion-list notion-list-disc notion-block-3a8c0110d3318025bccccbab297f7d2f"><li><b>过程可控：</b> 它访问了什么数据、调用了什么工具、采取了什么行动，能否观察和阻断？</li></ul><ul class="notion-list notion-list-disc notion-block-3a8c0110d3318081956ce9b92e7fbb20"><li><b>责任可追：</b> 谁批准上线，谁监控运行，谁有权修改，发生事故时谁接管？</li></ul><div class="notion-text notion-block-3a8c0110d33180938f27caf301b0b8d8">这三层都不能靠培训或宣传替代。</div><div class="notion-text notion-block-3a8c0110d3318058a096d84c0325782e">尤其当 Agent 从“生成建议”走向“代表企业行动”后，治理对象已经不只是模型输出。Agent 可能拥有独立身份、跨系统权限、持续记忆和工具调用能力，也可能遭遇提示注入、敏感数据泄露、越权行动或不可控扩散。报告建议为 Agent 建立身份与最小权限、统一资产清单、上线前安全评测、持续监控、完整审计和从批准到退役的生命周期管理。</div><div class="notion-text notion-block-3a8c0110d33180eb811de15402b3d05f">这与 NIST AI 风险管理框架的思路一致。NIST 把风险管理组织为 Govern、Map、Measure、Manage 四类活动，并明确要求在 AI 系统的整个生命周期持续开展，而不是上线前做一次检查就结束。其生成式 AI 专项框架进一步提醒组织，要根据具体场景、风险承受能力和法律要求调整措施。</div><div class="notion-text notion-block-3a8c0110d3318052b24df75841154f0f">“人在回路”也需要具体化。它不应只是流程图上一个表示谨慎的方框，而要明确：</div><ul class="notion-list notion-list-disc notion-block-3a8c0110d331807dbb11d6aac484100a"><li>哪些决定必须由人批准；</li></ul><ul class="notion-list notion-list-disc notion-block-3a8c0110d331805392e2f709047d6108"><li>人能看见哪些依据和运行记录；</li></ul><ul class="notion-list notion-list-disc notion-block-3a8c0110d331805ea627e6db5e62a413"><li>系统不确定到什么程度时必须升级；</li></ul><ul class="notion-list notion-list-disc notion-block-3a8c0110d33180b18cbfd52784d26cb8"><li>审核人是否有时间、能力和激励真正检查；</li></ul><ul class="notion-list notion-list-disc notion-block-3a8c0110d33180859643c36c060d9ccc"><li>当调用量扩大十倍时，人工审核是否仍能承受。</li></ul><div class="notion-text notion-block-3a8c0110d331805fb97ee36c30f369ee">如果这些问题没有答案，“人会把关”只是把系统风险转移给一个没有准备好的岗位。</div><h3 class="notion-h notion-h2 notion-h-indent-0 notion-block-3a8c0110d33180bea017da6f2ea015b0" data-id="3a8c0110d33180bea017da6f2ea015b0"><span><div id="3a8c0110d33180bea017da6f2ea015b0" class="notion-header-anchor"></div><a class="notion-hash-link" href="#3a8c0110d33180bea017da6f2ea015b0" title="五、技术可以快速复制，组织的工作方式不能一键安装"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>五、技术可以快速复制，组织的工作方式不能一键安装</b></span></span></h3><div class="notion-text notion-block-3a8c0110d331803bbed9f80984d5e456">《The AI Strategy Roadmap》把组织与文化列为五个核心驱动因素之一，这部分并非可有可无的软性补充。微软 2026 Work Trend Index 对 10 个市场的 2 万名在工作中使用 AI 的知识工作者进行了调查。其分析显示，在受访者自报的 AI 影响中，组织环境因素——包括文化、管理者支持和人才机制——相对重要性为 67%，个人心态和行为因素为 32%。研究明确说明这是统计关联，不是因果效应；但它仍提示企业，员工会不会使用 AI，并不只取决于个人是否上过培训。</div><div class="notion-text notion-block-3a8c0110d331804f9e81d5076ce9a093">真正影响采用的，是周围的系统是否允许新工作方式发生：管理者是否亲自示范，绩效指标是否仍然奖励旧流程，员工是否可以安全试验，出现错误时能否得到支持，团队有没有时间把经验写成标准。</div><div class="notion-text notion-block-3a8c0110d33180978bf1d9f2d5b142be">这也是 AI 卓越中心（Center of Excellence，CoE）最容易被设计错的地方。一个成熟的 CoE 不应包办所有 AI 项目，也不应成为新的审批瓶颈。它更适合承担四类工作：</div><ul class="notion-list notion-list-disc notion-block-3a8c0110d33180599720e66fc311c99e"><li>统一优先级、原则、标准和责任边界；</li></ul><ul class="notion-list notion-list-disc notion-block-3a8c0110d331803881aaddcf386f95ef"><li>提供共享平台、模板、评测与治理能力；</li></ul><ul class="notion-list notion-list-disc notion-block-3a8c0110d33180439137faeecc946215"><li>连接业务、技术、数据、安全、法务与合规团队；</li></ul><ul class="notion-list notion-list-disc notion-block-3a8c0110d33180daa568f8160c481936"><li>收集项目经验，让局部成功转化为组织资产。</li></ul><div class="notion-text notion-block-3a8c0110d33180c393a3eec630da2c1e">微软在内部实践中也经历了这次调整：其 AI CoE 最初主要提供咨询，随后发现重复建设、标准不一和治理不均，于是转向协调优先级、护栏、交付路线与采用方式。与此同时，IT 的角色从逐个把关，转向维护可信数据源、连接器、身份权限、Agent 生命周期和共享运行平台。</div><div class="notion-text notion-block-3a8c0110d3318024b0dbf1c6a66cdb4e">培训也需要从“一次全员课程”转向按角色建设能力。业务负责人需要学会定义问题和指标，开发团队需要掌握评测与运行管理，安全和法务需要理解 Agent 的数据流与行动边界，一线员工则需要知道如何判断结果、何时升级以及怎样反馈。AI champion 或内部实践社区可以加快经验传播，但不能替代正式责任人。</div><div class="notion-text notion-block-3a8c0110d3318037850bdb5d26211648">当新的工作方式进入指标、权限、流程和日常管理时，文化变化才算真正发生。</div><h3 class="notion-h notion-h2 notion-h-indent-0 notion-block-3a8c0110d33180299621d8be1515dccc" data-id="3a8c0110d33180299621d8be1515dccc"><span><div id="3a8c0110d33180299621d8be1515dccc" class="notion-header-anchor"></div><a class="notion-hash-link" href="#3a8c0110d33180299621d8be1515dccc" title="六、一条可执行的三阶段路线"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>六、一条可执行的三阶段路线</b></span></span></h3><div class="notion-text notion-block-3a8c0110d331806ea04dcc3db2788eeb">本文将五类能力和五级成熟度整理为一条三阶段行动路线。这里不设固定工期，每个阶段对应一个必须闭合的管理问题。</div><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-3a8c0110d33180dbb0f8e2b33530e14d"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3A6d8e97e1-cf1c-45a5-bebe-52181ac38120%3A03-%E4%B8%89%E9%98%B6%E6%AE%B5%E8%A1%8C%E5%8A%A8%E8%B7%AF%E7%BA%BF.png?table=block&amp;id=3a8c0110-d331-80db-b0f8-e2b33530e14d&amp;t=3a8c0110-d331-80db-b0f8-e2b33530e14d" alt="notion image" loading="lazy" decoding="async"/></div></figure><blockquote class="notion-quote notion-block-3a8c0110d331802a9317f0d1c0ab3a30"><div>三阶段行动路线：每个阶段都有证据门槛。没有证明价值、边界与可控性，就不急于扩大范围。</div></blockquote><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-3a8c0110d33180eeae18e2aabe11f14e" data-id="3a8c0110d33180eeae18e2aabe11f14e"><span><div id="3a8c0110d33180eeae18e2aabe11f14e" class="notion-header-anchor"></div><a class="notion-hash-link" href="#3a8c0110d33180eeae18e2aabe11f14e" title="第一阶段：选定一个问题，定义“成功”和“不能失败”"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>第一阶段：选定一个问题，定义“成功”和“不能失败”</b></span></span></h4><div class="notion-text notion-block-3a8c0110d331809a8b53f6c44def6b2d">选择一个边界清晰、可测量、风险可控的真实流程。记录现状基线，明确业务指标、系统指标和风险指标；组建包含业务、产品、工程、数据、安全与合规的最小跨职能团队；列出数据来源、系统依赖、权限、人工接管和停止条件。</div><div class="notion-text notion-block-3a8c0110d331805d976bcdc979920d7b">这一阶段需要同时交付原型和一个可以被检验的业务假设。</div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-3a8c0110d3318009a194e760d7daf003" data-id="3a8c0110d3318009a194e760d7daf003"><span><div id="3a8c0110d3318009a194e760d7daf003" class="notion-header-anchor"></div><a class="notion-hash-link" href="#3a8c0110d3318009a194e760d7daf003" title="第二阶段：把试点当成生产系统的早期版本"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>第二阶段：把试点当成生产系统的早期版本</b></span></span></h4><div class="notion-text notion-block-3a8c0110d33180edb63af352c57ac36f">从第一天就加入日志、评测、用户反馈、成本和性能监控。先让可信的内部用户在受控环境中使用，收集失败案例，修正数据、流程和护栏。只有当业务价值、可靠性、采用率和风险都达到预设阈值，才扩大范围。</div><div class="notion-text notion-block-3a8c0110d331809abbe7f945e2b5e05f">这一阶段最重要的成果是证据：系统在哪些条件下有效，在哪些条件下必须交给人。</div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-3a8c0110d331808ead29c1caa1280b5c" data-id="3a8c0110d331808ead29c1caa1280b5c"><span><div id="3a8c0110d331808ead29c1caa1280b5c" class="notion-header-anchor"></div><a class="notion-hash-link" href="#3a8c0110d331808ead29c1caa1280b5c" title="第三阶段：复制经过验证的交付模式"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>第三阶段：复制经过验证的交付模式</b></span></span></h4><div class="notion-text notion-block-3a8c0110d33180a7bb79fb57252f6958">把经过验证的数据契约、集成方式、评测集、权限模型、监控规则和复盘结论放入公共资产库。用统一框架管理用例组合，定期继续、加码、调整或停止项目。共性能力进入共享平台，CoE 负责加速复用和维护边界，培训则跟随岗位与流程变化持续更新。</div><div class="notion-text notion-block-3a8c0110d33180848393d23ccd3a6527">到这一步，企业才真正开始获得复利：第二个用例不再重复第一个用例走过的全部弯路，第三个用例又在前两个用例的资产上继续改进。</div><h3 class="notion-h notion-h2 notion-h-indent-0 notion-block-3a8c0110d3318061ac72e37538b9aa87" data-id="3a8c0110d3318061ac72e37538b9aa87"><span><div id="3a8c0110d3318061ac72e37538b9aa87" class="notion-header-anchor"></div><a class="notion-hash-link" href="#3a8c0110d3318061ac72e37538b9aa87" title="结语：不要问“我们上线了多少 AI”，要问“我们学会了什么”"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>结语：不要问“我们上线了多少 AI”，要问“我们学会了什么”</b></span></span></h3><div class="notion-text notion-block-3a8c0110d33180f8b6eff72ece87de2f">AI 转型最容易被看见的是模型、Agent 和演示，最难被看见的却是决定它们能否长期工作的那套系统：业务优先级、可信数据、交付纪律、组织责任与持续治理。</div><div class="notion-text notion-block-3a8c0110d33180e3b355cf2adab99a03">企业当然需要开始行动，但“尽快开始”不等于“尽快铺开”。更稳健的顺序是：先用一个真实问题建立证据，再把证据变成标准，把标准变成平台和日常工作方式。</div><div class="notion-text notion-block-3a8c0110d331802a8729df2d2bd125ea">下一次评审 AI 项目时，与其只问准确率多高、用了什么模型、什么时候上线，不如再加四个问题：</div><ol start="1" class="notion-list notion-list-numbered notion-block-3a8c0110d3318061b38bd6878e222e45" style="list-style-type:decimal"><li>它要改变哪一个业务结果？</li></ol><ol start="2" class="notion-list notion-list-numbered notion-block-3a8c0110d3318031ab3ef73b2b622532" style="list-style-type:decimal"><li>我们凭什么相信它在真实流程里有效？</li></ol><ol start="3" class="notion-list notion-list-numbered notion-block-3a8c0110d33180e3b8a3d51376cde9b6" style="list-style-type:decimal"><li>出错时谁能看见、阻断并负责？</li></ol><ol start="4" class="notion-list notion-list-numbered notion-block-3a8c0110d331805fb438db522309bf8d" style="list-style-type:decimal"><li>这次交付会为下一个用例留下什么？</li></ol><div class="notion-text notion-block-3a8c0110d33180e780d3de64268bc575">能持续回答这四个问题的组织，才是在建设 AI 能力，而不只是积累 AI 项目。</div><div class="notion-blank notion-block-3a8c0110d33180119e92edd483db90df"> </div><div class="notion-text notion-block-e4ac0110d33182e782cc815f03596116">&lt;ins/&gt;</div><h3 class="notion-h notion-h2 notion-h-indent-0 notion-block-9bbc0110d33183509787813ec031fda8" data-id="9bbc0110d33183509787813ec031fda8"><span><div id="9bbc0110d33183509787813ec031fda8" class="notion-header-anchor"></div><a class="notion-hash-link" href="#9bbc0110d33183509787813ec031fda8" title="AI Agents 知识星球"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">AI Agents 知识星球</span></span></h3><div class="notion-text notion-block-290c0110d33182448cd801594b61939f">GUI Agents 技术发展迅猛，想紧跟 GUI/AI agents 技术前沿？我们的知识星球会<b>介绍 Agents 相关的最新项目和工具，并以视频方式解读最新论文</b>，为你开启技术新视野，快来加入吧！</div><div class="notion-sync-block notion-block-260c0110d3318122956bc21e46f27afe"><div class="notion-row notion-block-c9c046ed82664131ae54bf494960163c"><div class="notion-column notion-block-9bfca92ce87b4a2a902c7c1a729bdef6" style="width:calc((100% - (1 * min(32px, 4vw))) * 0.5)"><div class="notion-text notion-block-82a381c6c9884ac19e41aa9d99da6a76">加入知识星球，每周获取会员专享视频👇</div><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-260c0110d331810b9744c1a7d8ae37ce"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3Ad1adc9e1-7b6a-453a-a9f3-2e2e826a3b09%3Aimage.png?table=block&amp;id=260c0110-d331-810b-9744-c1a7d8ae37ce&amp;t=260c0110-d331-810b-9744-c1a7d8ae37ce" alt="notion image" loading="lazy" decoding="async"/></div></figure><div class="notion-blank notion-block-da4f816748d54d2fbe76f12d542a6fb1"> </div></div><div class="notion-spacer"></div><div class="notion-column notion-block-3c596795a25f4528adea89c89458d903" style="width:calc((100% - (1 * min(32px, 4vw))) * 0.5)"><div class="notion-text notion-block-a3ae1b26bc1a4c07855cf3305d202f0b">扫码加微信小助手为好友，备注「agent」，小助手会定期邀请入群👇</div><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-260c0110d33181c792dac1caa43a8fe7"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/https%3A%2F%2Fprod-files-secure.s3.us-west-2.amazonaws.com%2F9341931a-53f0-48e1-b026-0f1ad17b457c%2Feed2e715-74df-4361-bd15-bc084f0d791f%2Fimage.png?table=block&amp;id=260c0110-d331-81c7-92da-c1caa43a8fe7&amp;t=260c0110-d331-81c7-92da-c1caa43a8fe7&amp;width=337.741455078125&amp;cache=v2" alt="notion image" loading="lazy" decoding="async"/></div></figure></div><div class="notion-spacer"></div></div></div><div class="notion-sync-block notion-block-151c0110d33180b3ba16fe7b239b5be6"><div class="notion-text notion-block-446d571c1ef64379a26332ffa4bf728b"><b>当前星球包含的专享视频包括：</b></div><ul class="notion-list notion-list-disc notion-block-e279ee05d7d84f14867c4426e1c40dbb"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1fcSEBMEzr" target="_blank" rel="noopener noreferrer">AI-Agents 中的上下文工程（Context-Engineering）</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-ba3388c448dc4898b72965d6c8b0f98d"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV13wuozDExH" target="_blank" rel="noopener noreferrer">GUI Agents 最新技术综述（2025）</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-3fb739bf89304e2eab663f887c9d6266"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1EeTvzaEBw" target="_blank" rel="noopener noreferrer">GUI Agent 最新技术：MONDAY—从视频自动构建 GUI Agents 轨迹数据</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-b049f409ac8843daad060dac3491d7cb"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1MVG1zsEB7" target="_blank" rel="noopener noreferrer">GUI Agent 最新技术：InfiGUI-R1—从反应式执行向推理式决策的进阶之路</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-37b926f98a28482b93a183a226f56d3f"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1bmdzYzEty" target="_blank" rel="noopener noreferrer">GUI Agent 最新技术：自动驾驶与具身智能技术能带来哪些启示？</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-f54e2c5bc7e648b2aba39ab1985c65c6"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1uyRhY2EFi" target="_blank" rel="noopener noreferrer">GUI Agent 最新技术：ATLaS—同时提升训练效率和模型泛化性</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-0021ce23ee594382abfbedf06ee3582b"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1gm96YrEQY" target="_blank" rel="noopener noreferrer">GUI Agent 技术分享：DigiQ/VEM—使用 RL 提升模型的泛化能力</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-4f3f5fc916124dfb95912767379db9b9"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1pPFceFE42" target="_blank" rel="noopener noreferrer">UI Agent 技术分享： UI-TARS—利用长期记忆和反思调整迭代优化模型</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-989f4fc28f3243e5b2545363fc5bfae0"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1itwkerEyu" target="_blank" rel="noopener noreferrer">AI Agent 技术分享：Insight-V—探索 VLM 的长链条视觉推理能力</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-279ade68f2e74691befa0fd63d4bd627"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1hZcGe1ELm" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：PC-Agent—提升模型认知能力以便更好完成复杂任务</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-6da2c8d0d77148f988157bc8bca8fb05"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1aKrTY7EWB" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：OS-Genesis—自动合成高质量且多样化的训练数据</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-9e3d811d175f473080c7cccf21ae5e8b"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1u26hY5Eyw" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：PAE-通过自动探索新任务不断扩展模型能力</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-3d22b1de3c97465ea2ae3ca46f7f3322"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1dgCNYXEfa" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：Iris-通过自动构造的数据提升模型效果</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-fc8987322bf84ac883f1723c8fd47fe7"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV17VqfYfEjk" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：Falcon-UI—利用无监督数据预训练 UI Agent 模型</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-0bfba06238534895ad33829d495e0672"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1erqxYhEBc" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：Aguvis-来自 HKU &amp; Salesforce 的大一统训练数据和训练框架</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-16f47cc74840469885af43454f46a8d0"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1U86FY9E1G" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：ShowUI-当前最好的 UI Agents 开源模型，还适用中文 APP？</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-0c0eb8f030cd4a2fa702a8c8adabd98a"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1pjBtYnE6C" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：使用世界模型提升 UI Agents 效果？</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-64ec5513bf7445a38cb55d71224e3705"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV14eU7YWEEs" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：来自华为诺亚方舟实验室的 LiMAC</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-20f715d38a624d65acb65337d3f00620"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1c1mpYtEqG" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：来自 LG AI Research 的 Auto-Intent</a></b></span></li></ul><div class="notion-blank notion-block-1fe7ae2650754f9db74d20ee936a5a23"> </div></div><div class="notion-text notion-block-f5fc0110d33182cbaec501379693113b">&lt;ins/&gt;</div><h3 class="notion-h notion-h2 notion-h-indent-0 notion-block-f25c0110d331820b86aa010c9ec15562" data-id="f25c0110d331820b86aa010c9ec15562"><span><div id="f25c0110d331820b86aa010c9ec15562" class="notion-header-anchor"></div><a class="notion-hash-link" href="#f25c0110d331820b86aa010c9ec15562" title="参考文献"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>参考文献</b></span></span></h3><div class="notion-text notion-block-3a8c0110d33180b6a065dd5422d23b2d">[<b>1</b>]    Microsoft, <em><a class="notion-link" href="https://www.microsoft.com/en-us/microsoft-cloud/blog/2026/07/21/the-ai-strategy-roadmap-five-drivers-of-successful-ai-transformation/" target="_blank" rel="noopener noreferrer">The AI Strategy Roadmap: Five drivers of successful AI transformation</a></em>，2026 年 7 月 21 日；<em><a class="notion-link" href="https://marketingassets.microsoft.com/gdc/gdc9wYvCw/original" target="_blank" rel="noopener noreferrer">The AI Strategy Roadmap: How organizations are achieving Frontier Transformation</a></em>，2026，尤其见第 2—8 页；<a class="notion-link" href="https://info.microsoft.com/ww-landing-the-ai-strategy-roadmap.html?lcid=EN-US" target="_blank" rel="noopener noreferrer">路线图介绍页</a>。</div><div class="notion-text notion-block-3a8c0110d33180b2b122e86c1647401c">[<b>2</b>]    同上，第 3、66 页。研究包含 70 次深度访谈，每次 30—45 分钟；访谈由 Emerald Research Group 代表微软开展，属于定性研究。</div><div class="notion-text notion-block-3a8c0110d3318000b0e9dcd840d77009">[<b>3</b>]    同上，第 9—19 页。报告将首个用例的重点放在明确业务问题、可测量结果、可控风险和逐步扩展。</div><div class="notion-text notion-block-3a8c0110d33180cabe83cad1573908c2">[<b>4</b>]    同上，第 20—29 页。相关章节讨论数据成熟度、统一语义、共享平台、成本与韧性，以及买入、扩展和自研之间的选择。</div><div class="notion-text notion-block-3a8c0110d3318041a907e98627ee4bfa">[<b>5</b>]    同上，第 30—37 页。相关章节讨论跨职能团队、受控试验、可复用资产、GenAIOps、Agentic DevOps 与多维指标。</div><div class="notion-text notion-block-3a8c0110d331802fa8f3e72042b0b794">[<b>6</b>]    同上，第 47—57 页。相关章节讨论 Agent 身份与权限、数据过度共享、提示注入、持续监控、上线前评测和生命周期治理。</div><div class="notion-text notion-block-3a8c0110d3318049b10bd72f95a5f1f5">[<b>7</b>]    NIST, <em><a class="notion-link" href="https://www.nist.gov/publications/artificial-intelligence-risk-management-framework-generative-artificial-intelligence" target="_blank" rel="noopener noreferrer">Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile</a></em>, 2024；以及 <a class="notion-link" href="https://www.nist.gov/itl/ai-risk-management-framework/nist-ai-rmf-playbook" target="_blank" rel="noopener noreferrer">NIST AI RMF Playbook</a>。AI RMF 1.0 正在修订，应用时应检查最新版本。</div><div class="notion-text notion-block-3a8c0110d3318055b7cbdfab7a219020">[<b>8</b>]    Microsoft, <em><a class="notion-link" href="https://www.microsoft.com/en-us/worklab/work-trend-index/agents-human-agency-and-the-opportunity-for-every-organization" target="_blank" rel="noopener noreferrer">2026 Work Trend Index Annual Report</a></em>, 2026。调查覆盖 10 个市场的 2 万名在工作中使用 AI 的人；67% 与 32% 来自模型中特征重要性的归类，结果基于自报数据，只表示关联。</div><div class="notion-text notion-block-3a8c0110d331804b8f14e2bad7c6ed7b">[<b>9</b>]    Microsoft, <em>The AI Strategy Roadmap</em>，第 58—62 页。“微软自身实践”属于厂商自述案例，本文未将其结果外推为所有企业都能复现的效果。</div></main></div>]]></content:encoded>
        </item>
        <item>
            <title><![CDATA[AI Agent 中的上下文工程 (Context Engineering)]]></title>
            <link>https://www.breezedeus.com/article/ai-agent-context-engineering</link>
            <guid>https://www.breezedeus.com/article/ai-agent-context-engineering</guid>
            <pubDate>Fri, 28 Nov 2025 00:00:00 GMT</pubDate>
            <description><![CDATA[本文聚焦 AI Agents 上下文工程技术，揭秘了从静态提示词工程到动态上下文工程的进化逻辑，还拆解了 Manus 应对上下文腐烂的核心技术与简化至上的实践原则。]]></description>
            <content:encoded><![CDATA[<div id="notion-article" class="mx-auto overflow-hidden "><main class="notion light-mode notion-page notion-block-294c0110d331803599aee03f067a7a40"><div class="notion-viewport"></div><div class="notion-collection-page-properties"></div><div class="notion-row notion-block-2bcc0110d33180848b93e82b8c8c170f"><div class="notion-column notion-block-2bcc0110d33180fd8805cef6b1448765" style="width:calc((100% - (2 * min(32px, 4vw))) * 0.25)"><div class="notion-blank notion-block-2bcc0110d33180098208c303669cc94f"> </div></div><div class="notion-spacer"></div><div class="notion-column notion-block-2bcc0110d33180759e31f306e0b5b306" style="width:calc((100% - (2 * min(32px, 4vw))) * 0.5416666666666665)"><div class="notion-text notion-block-2bcc0110d331807a817cd24ede845c3d"><b><a class="notion-link" href="https://www.breezedeus.com/" target="_blank" rel="noopener noreferrer">Home</a></b><b> | </b><b><a class="notion-link" href="https://github.com/breezedeus" target="_blank" rel="noopener noreferrer">GitHub</a></b><b> | </b><b><a class="notion-link" href="https://twitter.com/breezedeus" target="_blank" rel="noopener noreferrer">Twitter</a></b><b> | </b><b><a class="notion-link" href="https://www.youtube.com/@breezedeus" target="_blank" rel="noopener noreferrer">Youtube</a></b><b>  |  </b><b><a class="notion-link" href="https://space.bilibili.com/509307267" target="_blank" rel="noopener noreferrer">Bilibili</a></b></div></div><div class="notion-spacer"></div><div class="notion-column notion-block-2bcc0110d3318080910bd7182e80eea4" style="width:calc((100% - (2 * min(32px, 4vw))) * 0.2083333333333335)"><div class="notion-blank notion-block-2bcc0110d33180dba525ce7451881f9b"> </div></div><div class="notion-spacer"></div></div><div class="notion-row notion-block-294c0110d33181c28753c2742fe24218"><div class="notion-column notion-block-294c0110d331817687dffe5e384a3b02" style="width:calc((100% - (1 * min(32px, 4vw))) * 0.5)"><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-2b9c0110d3318003b485e0266468c564"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3Ac1f6898a-1d08-4c9c-84ed-72b4ff8acc33%3AAI_Agents%E4%B8%8A%E4%B8%8B%E6%96%87%E5%B7%A5%E7%A8%8B%E6%8F%92%E5%9B%BE_small.png?table=block&amp;id=2b9c0110-d331-8003-b485-e0266468c564&amp;t=2b9c0110-d331-8003-b485-e0266468c564" alt="notion image" loading="lazy" decoding="async"/></div></figure></div><div class="notion-spacer"></div><div class="notion-column notion-block-294c0110d33181f9bb8cf98dee9e41ba" style="width:calc((100% - (1 * min(32px, 4vw))) * 0.5)"><div class="notion-text notion-block-294c0110d33181b2995eef1f51805c4c"><b>目录：</b></div><div class="notion-table-of-contents notion-gray notion-block-294c0110d3318160961ef6e76102d375"><a href="#2b3c0110d331801193baf026ad3ce908" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:0">背景介绍</span></a><a href="#2b3c0110d331800e851bf147fbd51568" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:24px">Context Engineering：跨越认知鸿沟的熵减工程</span></a><a href="#2b3c0110d33180c083f8dff7641bce0b" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:24px">Context Engineering 为什么有必要</span></a><a href="#2b3c0110d3318075b330c8fad911cfe5" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:24px">Prompt Engineering</span></a><a href="#2b3c0110d3318096816bde298ef6cb25" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:24px">从 Prompt Engineering 到 Context Engineering：从静态到动态的进化</span></a><a href="#294c0110d33180938dd8d266fcc392d1" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:0">上下文工程的核心原则与实践</span></a><a href="#294c0110d33180cd9331c25b2cf92331" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:24px">1. 上下文缩减：压缩与摘要的艺术</span></a><a href="#294c0110d3318048a33cc80d1fb33cc9" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:24px">2. 上下文检索：文件系统工具的回归</span></a><a href="#294c0110d33180128512de9da5da5adb" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:24px">3. 上下文隔离与多智能体设计</span></a><a href="#294c0110d3318013bc03c17bd0fe7e04" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:24px">4. 上下文卸载与分层行动空间</span></a><a href="#294c0110d33180cb9c55d617d958f7a0" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:24px">5. More: 长期记忆、规划与模型适应性</span></a><a href="#294c0110d33180cba03bdb038dee6496" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:24px">6. 安全与评估</span></a><a href="#294c0110d331805fbf4fc4fdd2670286" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:0">结论：简化胜于过度工程</span></a><a href="#2b9c0110d331805e9a9dd050c06183bd" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:0">AI Agents 知识星球</span></a><a href="#294c0110d33181edbeb2e167c3cc37ed" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:0">参考文献</span></a></div><div class="notion-blank notion-block-294c0110d33181a3af36c273de0c60b7"> </div></div><div class="notion-spacer"></div></div><h3 class="notion-h notion-h2 notion-h-indent-0 notion-block-2b3c0110d331801193baf026ad3ce908" data-id="2b3c0110d331801193baf026ad3ce908"><span><div id="2b3c0110d331801193baf026ad3ce908" class="notion-header-anchor"></div><a class="notion-hash-link" href="#2b3c0110d331801193baf026ad3ce908" title="背景介绍"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">背景介绍</span></span></h3><div class="notion-text notion-block-294c0110d331804cac67e82f67920376"><b>AI 智能体（AI Agents）</b>的迅速发展带来了管理其处理海量信息的新挑战。其中最关键的一项是<b>上下文工程（Context Engineering）</b>，这是一门专注于优化智能体系统中大型语言模型（LLM）信息流的技术。本文综合了 LangChain 的 Lance 和 Manus 联合创始人兼首席科学家 Peak 在一场网络研讨会上的关键见解，旨在全面解析上下文管理的高级技术，特别是 Manus 的创新方法。</div><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-2b4c0110d331802189c8e89bd85d65a9"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3Ad01435a3-77b7-4658-b4a1-2424757ce6f3%3Aimage.png?table=block&amp;id=2b4c0110-d331-8021-89c8-e89bd85d65a9&amp;t=2b4c0110-d331-8021-89c8-e89bd85d65a9" alt="Context Engineering：其他系统与大模型之间的沟通桥梁" loading="lazy" decoding="async"/><figcaption class="notion-asset-caption"><b>Context Engineering</b>：其他系统与大模型之间的沟通桥梁</figcaption></div></figure><div class="notion-blank notion-block-2b9c0110d33180a7853ec447caa43129"> </div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-2b3c0110d331800e851bf147fbd51568" data-id="2b3c0110d331800e851bf147fbd51568"><span><div id="2b3c0110d331800e851bf147fbd51568" class="notion-header-anchor"></div><a class="notion-hash-link" href="#2b3c0110d331800e851bf147fbd51568" title="Context Engineering：跨越认知鸿沟的熵减工程"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>Context Engineering：跨越认知鸿沟的熵减工程</b></span></span></h4><div class="notion-text notion-block-2b9c0110d33180c2b15bcded22eabb7d"><span class="notion-blue"><b><a class="notion-link" href="https://arxiv.org/abs/2510.26493" target="_blank" rel="noopener noreferrer">Context Engineering 2.0: The Context of Context Engineering</a></b></span> 这篇论文把 Context Engineering 这个概念放在更大的背景下看待，很有意思。</div><div class="notion-text notion-block-2b3c0110d3318067898ec5c064a763b0">人类智能与机器智能的发展轨迹持续存在 <b>&quot;Intelligence Gap&quot;（智能鸿沟）</b>。这条鸿沟的本质，是<b>信息熵的不对称</b>。人类在交流时拥有天然的&quot;熵减能力&quot;——我们能够通过共享的文化背景、情感线索、情境感知来主动补全对话中的缺失信息，将高熵的、模糊的意图转化为低熵的、清晰的理解。而机器，至少在目前，熵减这种能力还不够好。</div><div class="notion-text notion-block-2b3c0110d3318079801df5fe23c2543e"><b>Context Engineering 正是为了弥补这一熵减能力差距而存在的系统工程。</b> 当我们与AI交互时，如果只是抛出一个简单的问题，AI面对的是一个高熵状态：缺乏背景、没有记忆、不了解你的意图偏好。Context Engineering 的核心工作，就是<b>主动为机器进行熵减预处理</b>——通过构建知识库、维护记忆系统、部署RAG检索、集成外部工具，我们将原本高熵的、碎片化的信息转化为结构化的、低熵的上下文表示，让机器能够&quot;理解&quot;。</div><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-2b3c0110d33180ceb1d0f47e8da74f7a"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3A3fa77413-f3c7-4e90-acda-dd67d116aa53%3Aimage.png?table=block&amp;id=2b3c0110-d331-80ce-b1d0-f47e8da74f7a&amp;t=2b3c0110-d331-80ce-b1d0-f47e8da74f7a" alt="notion image" loading="lazy" decoding="async"/></div></figure><div class="notion-text notion-block-2b3c0110d33180e29d98ebe4d46e1dd8">上图展示了 <b>Context Engineering </b>从1.0到4.0的演进路径，揭示了一个核心规律：<b>随着AI智能水平的提升，其上下文处理能力不断增强，人机交互成本持续降低。</b></div><ul class="notion-list notion-list-disc notion-block-2b3c0110d33180c8af3fed99dc288837"><li><b>Context 1.0 - Context as Translation（上下文作为翻译）| Era 1.0: Primitive Computation (1990s-2020)</b></li><ul class="notion-list notion-list-disc notion-block-2b3c0110d33180c8af3fed99dc288837"><div class="notion-text notion-block-2b3c0110d3318066b6c6eb8e5885cbbc">在这个阶段，机器仅能处理结构化输入和简单的环境线索，缺乏对意义和意图的深层理解。AI表现为&quot;被动执行者&quot;（Passive Executor），人机交互依赖于刚性的、预定义的格式——菜单选择、简单传感器数据等。虽然超越了二进制命令层面，但所有上下文仍必须由人类显式准备并&quot;翻译&quot;成机器可直接处理的格式。此时人机交互成本最高，人类需要投入大量精力来适应机器有限的理解能力。</div></ul></ul><ul class="notion-list notion-list-disc notion-block-2b3c0110d331803d8c61dcc4fe135cdf"><li><b>Context 2.0 - Context as Instruction（上下文作为指令）| Era 2.0: Agent-Centric Intelligence (2020-Present)</b></li><ul class="notion-list notion-list-disc notion-block-2b3c0110d331803d8c61dcc4fe135cdf"><div class="notion-text notion-block-2b3c0110d33180359f86db9640e22105">2020年GPT-3的发布标志着 context engineering 的转折点。机器展现出中等智能水平，能够理解自然语言输入并推断部分隐含意图，成为&quot;主动代理&quot;（Initiative Agent）。上下文不再局限于显式定义的信号，可以包含模糊性和不完整信息。AI通过先进的语言理解和情境学习（in-context learning）主动推理上下文缺口，提供更自适应的交互。人类可以用对话方式表达需求，系统能解释大部分潜在含义，人机协作变得切实可行。</div></ul></ul><ul class="notion-list notion-list-disc notion-block-2b3c0110d331804dbe54f455fbb63047"><li><b>Context 3.0 - Context as Scenario（上下文作为场景）| Era 3.0: Human-Level Intelligence (Future)</b></li><ul class="notion-list notion-list-disc notion-block-2b3c0110d331804dbe54f455fbb63047"><div class="notion-text notion-block-2b3c0110d3318087b2b2fc383437705a">随着预期的突破，智能系统将接近人类水平的推理和理解能力，AI进化为&quot;可靠协作者&quot;（Reliable Collaborator）。Context engineering 超越当前模式，使AI能够像人类一样感知上下文并吸收高熵信息。可解释上下文的范围显著扩展，包括社交线索、情绪状态和更丰富的环境动态。通过知识库、记忆系统和RAG检索，AI能够在复杂场景中持续协作，实现真正自然的人机协同，AI将作为知识丰富且高效的伙伴存在。<b>我们目前正处于从Era 2.0向Era 3.0的过渡阶段。</b></div></ul></ul><ul class="notion-list notion-list-disc notion-block-2b3c0110d3318012b05cceec70cd1989"><li><b>Context 4.0 - Context as World（上下文作为世界）| Era 4.0: Superhuman Intelligence (Speculative)</b></li><ul class="notion-list notion-list-disc notion-block-2b3c0110d3318012b05cceec70cd1989"><div class="notion-text notion-block-2b3c0110d331806fa31ef4ed2691c209">当智能系统超越人类能力，它们将拥有&quot;上帝视角&quot;，比人类自己更深刻地理解人类意图，成为&quot;深思熟虑的大师&quot;（Considerate Master）。传统的主客体关系发生反转：机器不再被动适应人类定义的上下文，而是主动为人类构建新的上下文，发现隐藏需求，引导人类思维。这一转变的迹象已经出现——在围棋领域，职业棋手正在向AI学习超人类的新策略。此时，机器成为洞察和灵感的来源，从根本上重新定义了人机协作的本质。</div></ul></ul><div class="notion-text notion-block-2b3c0110d331805393c3ce7c887cc9d8">这一演进过程的本质，是AI逐步接管人类原本需要承担的&quot;上下文熵减工作&quot;。随着 Context Engineering 能力的提升，人类可以用更自然、更高熵的方式表达意图，而将复杂的信息结构化、情境理解和知识整合工作交给AI系统来完成。这正是 Context Engineering 作为系统工程的价值所在：<b>不是让人类学会如何更好地与机器对话，而是让机器学会如何更好地理解人类——最终，在Era 4.0，机器甚至能比人类更好地理解人类自己。</b></div><div class="notion-blank notion-block-2b3c0110d33180c38083d335f63fb9d2"> </div><div class="notion-text notion-block-2b3c0110d33180329521d953945e7169">从1963年的 Sketchpad 到1999年的 Ubiquitous Computing，再到今天的 Langchain、Claude Code、Cursor 等工具，Context Engineering 一直在努力缩小智能鸿沟。下图中的紫色区域标注了 &quot;Human = Machine&quot; 的交汇点，那将是 Context Engineering 的终极目标：当我们成功将人类的高熵意图系统化地转化为机器可理解的低熵表示时，人机协作的效率将达到前所未有的高度。这不仅是技术的进化，更是一场<b>持续的熵减革命</b>。</div><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-2b3c0110d331805ea9f6c56bb2abb0df"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3Aa028ed36-e236-440b-8cc5-55f5676221cc%3Aimage.png?table=block&amp;id=2b3c0110-d331-805e-a9f6-c56bb2abb0df&amp;t=2b3c0110-d331-805e-a9f6-c56bb2abb0df" alt="notion image" loading="lazy" decoding="async"/></div></figure><div class="notion-blank notion-block-2b3c0110d33180f1a787e025d1e675f5"> </div><div class="notion-text notion-block-294c0110d3318089a9e8c8af88cc0d2c">在模型微调和后训练日益普及的今天，Context Engineering 是应用和模型之间最清晰、最实用的边界。Manus 认为，初创公司应避免过早陷入模型专门化的陷阱，因为这会将产品的创新速度与模型的迭代速度捆绑在一起。即使是使用强大的基础模型进行微调，也可能因为 AI 领域快速的技术颠覆而变得危险。例如，MCP（Manus Code Playground）的推出彻底改变了 Manus 的设计，从一个紧凑的静态行为空间转变为一个几乎无限扩展的开放域环境，这种变化对于已经专门训练过的模型来说是极难适应的。因此，坚定地依赖通用模型和上下文工程，是保持产品灵活性和未来适应性的关键策略。</div><div class="notion-text notion-block-2b4c0110d3318059af9ecbb621e59723">&lt;ins/&gt;</div><div class="notion-blank notion-block-2b9c0110d331804ca7cdcee314abba67"> </div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-2b3c0110d33180c083f8dff7641bce0b" data-id="2b3c0110d33180c083f8dff7641bce0b"><span><div id="2b3c0110d33180c083f8dff7641bce0b" class="notion-header-anchor"></div><a class="notion-hash-link" href="#2b3c0110d33180c083f8dff7641bce0b" title="Context Engineering 为什么有必要"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>Context Engineering 为什么有必要</b></span></span></h4><div class="notion-text notion-block-2b9c0110d33180b5bcd4fc9bd65e0563">接下来回到 AI Agents 架构中的上下文工程理解视角。为什么从 2025 年3月份开始，上下文工程越来越受到大家的重视？</div><div class="notion-text notion-block-2b3c0110d33180079b8dcbd5e9f5e332">AI 智能体通过自主与工具交互并积累观察结果，交互轮次变长后会导致<b>“上下文腐烂（Context Rot）”</b>现象。每次工具调用都会生成一个观察结果并附加到聊天历史中，导致消息数量不受限制地爆炸式增长。这种不断增长的上下文长度会降低 LLM 的性能，形成一个<b>悖论：智能体需要大量的上下文，但更长的上下文会损害其效率和准确性。</b></div><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-2b2c0110d33180f3a7d2de30f85ce008"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3A8cbb3b28-6630-41d0-afba-f1b96dac52c1%3Aimage.png?table=block&amp;id=2b2c0110-d331-80f3-a7d2-de30f85ce008&amp;t=2b2c0110-d331-80f3-a7d2-de30f85ce008" alt="AI 智能体能做的事情越来越复杂，交互轮次越来越多。" loading="lazy" decoding="async"/><figcaption class="notion-asset-caption">AI 智能体能做的事情越来越复杂，交互轮次越来越多。</figcaption></div></figure><div class="notion-blank notion-block-2b9c0110d33180d2a4f3e0dbd159846c"> </div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-2b3c0110d3318075b330c8fad911cfe5" data-id="2b3c0110d3318075b330c8fad911cfe5"><span><div id="2b3c0110d3318075b330c8fad911cfe5" class="notion-header-anchor"></div><a class="notion-hash-link" href="#2b3c0110d3318075b330c8fad911cfe5" title="Prompt Engineering"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>Prompt Engineering</b></span></span></h4><div class="notion-text notion-block-2b3c0110d331807f82d3c8bb96543a92"><b>Prompt Engineering</b> 是我们与AI交互的起点——通过精心设计静态的提示词结构（角色、任务、格式、约束、示例、输入），让AI理解我们的需求并给出准确答案。这种方法简单直接，但每次对话都是独立的<b>&quot;单次任务&quot;</b>，AI没有记忆，也无法访问外部知识。</div><div class="notion-text notion-block-2b3c0110d33180ab9f9ef06196333eca"><b>常见的 Prompt 结构：</b></div><ol start="1" class="notion-list notion-list-numbered notion-block-2b3c0110d33180fea122ef286e6dd951" style="list-style-type:decimal"><li><b>角色定义</b> - 设定身份</li></ol><ol start="2" class="notion-list notion-list-numbered notion-block-2b3c0110d3318080a5e2e621968c6363" style="list-style-type:decimal"><li><b>任务描述</b>（整合了背景信息）- 说明要做什么</li></ol><ol start="3" class="notion-list notion-list-numbered notion-block-2b3c0110d3318077bb8ef653453d4fd9" style="list-style-type:decimal"><li><b>输出格式</b> - 规定输出形式</li></ol><ol start="4" class="notion-list notion-list-numbered notion-block-2b3c0110d331808c8b7bcea3ac5994be" style="list-style-type:decimal"><li><b>约束条件</b> - 硬性限制</li></ol><ol start="5" class="notion-list notion-list-numbered notion-block-2b3c0110d3318093af9bce265e3c765e" style="list-style-type:decimal"><li><b>示例</b> - 参考模板</li></ol><ol start="6" class="notion-list notion-list-numbered notion-block-2b3c0110d3318087aaddedfa673b0ab7" style="list-style-type:decimal"><li><b>输入数据</b> - 实际内容</li></ol><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-2b3c0110d33180b4a767e6dd30a9a5d2"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3A7c80a20a-db22-42eb-843a-c9c4086326c2%3Aimage.png?table=block&amp;id=2b3c0110-d331-80b4-a767-e6dd30a9a5d2&amp;t=2b3c0110-d331-80b4-a767-e6dd30a9a5d2" alt="notion image" loading="lazy" decoding="async"/></div></figure><div class="notion-blank notion-block-2b3c0110d331803e980deca7eba97d31"> </div><div class="notion-text notion-block-2b3c0110d3318035be23d5dfd9df5b4e"><b>一个示例：</b></div><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-2b3c0110d331809485d5e36e3c408873"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3A14e9b0a9-fc4e-4f88-894b-6d332066a21c%3Aimage.png?table=block&amp;id=2b3c0110-d331-8094-85d5-e36e3c408873&amp;t=2b3c0110-d331-8094-85d5-e36e3c408873" alt="notion image" loading="lazy" decoding="async"/></div></figure><div class="notion-blank notion-block-2b3c0110d33180348acfecc38c74fa75"> </div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-2b3c0110d3318096816bde298ef6cb25" data-id="2b3c0110d3318096816bde298ef6cb25"><span><div id="2b3c0110d3318096816bde298ef6cb25" class="notion-header-anchor"></div><a class="notion-hash-link" href="#2b3c0110d3318096816bde298ef6cb25" title="从 Prompt Engineering 到 Context Engineering：从静态到动态的进化"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>从 Prompt Engineering 到 Context Engineering：从静态到动态的进化</b></span></span></h4><div class="notion-text notion-block-2b3c0110d3318004a3f4ca6782db4a9c"><b>Context Engineering</b> 可以理解为 <b>Dynamic Prompting 的系统化升级</b>。它的核心思想是：不再手动编写固定的提示词，而是根据对话情境、历史记忆、知识库内容，<b>动态组装</b>最适合当前任务的上下文。当用户提出问题时，系统会自动从知识库检索相关信息（RAG）、调取历史对话记忆、整合外部工具的数据，然后将这些动态获取的上下文与用户的问题结合，形成一个&quot;信息丰富、情境完整&quot;的增强提示词。</div><div class="notion-text notion-block-2b3c0110d33180cd9a33d8eff24c50ea">这不仅仅是提示词的动态化，更是整个交互架构的升级：</div><ul class="notion-list notion-list-disc notion-block-2b3c0110d3318035b8e5de6c0d5d80c7"><li><b>知识库</b>提供领域专业知识和事实依据</li></ul><ul class="notion-list notion-list-disc notion-block-2b3c0110d33180bda59ecb90752d148f"><li><b>记忆系统</b>维护对话历史和用户偏好</li></ul><ul class="notion-list notion-list-disc notion-block-2b3c0110d33180eea737f9dee213f5f3"><li><b>RAG检索</b>按需获取最相关的上下文片段</li></ul><ul class="notion-list notion-list-disc notion-block-2b3c0110d3318058ad0bc2384dbf2c9c"><li><b>工具集成</b>连接数据库、API等外部资源</li></ul><ul class="notion-list notion-list-disc notion-block-2b3c0110d33180bdb656c65d2f9f6ce3"><li><b>系统级设计</b>确保一致性和可扩展性</li></ul><div class="notion-text notion-block-2b3c0110d33180589909c5165f6fc130">简单说，Prompt Engineering 是&quot;手工制作每一个提示词&quot;，而 Context Engineering 是&quot;搭建一个能自动生成最优提示词的智能系统&quot;。这就是从手动到自动化、从静态到动态、从单次任务到系统工程的进化。</div><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-2b3c0110d331805a978fd6c904b87b93"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3A8f4197db-55e4-455d-9d8a-34f144db649c%3Aimage.png?table=block&amp;id=2b3c0110-d331-805a-978f-d6c904b87b93&amp;t=2b3c0110-d331-805a-978f-d6c904b87b93" alt="notion image" loading="lazy" decoding="async"/></div></figure><div class="notion-blank notion-block-2b3c0110d33180338f91f846b410e83b"> </div><h3 class="notion-h notion-h2 notion-h-indent-0 notion-block-294c0110d33180938dd8d266fcc392d1" data-id="294c0110d33180938dd8d266fcc392d1"><span><div id="294c0110d33180938dd8d266fcc392d1" class="notion-header-anchor"></div><a class="notion-hash-link" href="#294c0110d33180938dd8d266fcc392d1" title="上下文工程的核心原则与实践"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>上下文工程的核心原则与实践</b></span></span></h3><div class="notion-text notion-block-2b3c0110d33180a3b501e0df9d9328de"><b>上下文腐烂（Context Rot）</b>是指在长上下文场景中，当上下文窗口超过某个&quot;腐烂阈值&quot;（Pre-rot threshold）后，AI模型对远端信息的理解和利用能力急剧下降的现象。如图所示，在0-128K token范围内（绿色区域），模型能够有效处理上下文信息；当进入128K-200K范围（橙色区域）时，性能开始衰减，这就是&quot;腐烂阈值&quot;；而超过200K之后的大部分上下文（白色区域）则几乎被模型&quot;忽略&quot;，无法有效利用。</div><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-2b3c0110d331809e80dde88741fd6fe9"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3Ae2081435-ab81-45d8-ab35-8696d7f9e063%3Aimage.png?table=block&amp;id=2b3c0110-d331-809e-80dd-e88741fd6fe9&amp;t=2b3c0110-d331-809e-80dd-e88741fd6fe9" alt="notion image" loading="lazy" decoding="async"/></div></figure><div class="notion-text notion-block-2b3c0110d33180509a1ed2fdcb4e5841">这一现象揭示了上下文过程面临的核心挑战：即使模型声称支持百万级token的上下文窗口，实际可用的有效上下文往往远小于这个数字。因此，上下文过程不仅要构建丰富的知识环境，还必须通过智能检索（RAG）、上下文压缩、记忆管理等技术，确保关键信息始终处于模型的&quot;有效感知区域&quot;内，避免重要上下文在长对话中&quot;腐烂&quot;而失效。</div><div class="notion-blank notion-block-2b4c0110d331800c8a4cdade2ea9b327"> </div><div class="notion-text notion-block-2b3c0110d331806cab25c17592d086bf">面对上下文腐烂的挑战，Context Engineering 形成了几大核心原则：<b>上下文优化</b> —— 通过缩减与检索技术，提取最相关信息而非盲目堆砌；<b>上下文隔离</b> —— 借助多智能体设计，为不同任务建立独立上下文空间，避免信息混杂；<b>上下文分层</b> —— 通过卸载与分层行动空间，将系统知识、历史记忆、当前任务按生命周期分层管理。这些原则通过四大核心技术得以落地实践。</div><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-2b4c0110d33180e0aa5cfc16e4f85d31"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3A3f79f5e1-18e4-4661-888d-e5138948a207%3Aimage.png?table=block&amp;id=2b4c0110-d331-80e0-aa5c-fc16e4f85d31&amp;t=2b4c0110-d331-80e0-aa5c-fc16e4f85d31" alt="notion image" loading="lazy" decoding="async"/></div></figure><div class="notion-blank notion-block-2b4c0110d33180fb9871cdfc2b076a0c"> </div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-294c0110d33180cd9331c25b2cf92331" data-id="294c0110d33180cd9331c25b2cf92331"><span><div id="294c0110d33180cd9331c25b2cf92331" class="notion-header-anchor"></div><a class="notion-hash-link" href="#294c0110d33180cd9331c25b2cf92331" title="1. 上下文缩减：压缩与摘要的艺术"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>1. 上下文缩减：压缩与摘要的艺术</b></span></span></h4><div class="notion-text notion-block-294c0110d3318023ba24e4a892be41d4"><b>上下文缩减（Context Reduction）</b> 旨在压缩或总结信息。Manus 将其细分为两种形式：</div><ul class="notion-list notion-list-disc notion-block-294c0110d331809f9dedfc912ff0b258"><li><b>压缩（Compaction）</b>：一个可逆的过程，将可以从外部状态（如文件系统）重建的信息（例如，用文件路径代替完整文件内容）从上下文中剥离。这样，没有任何信息真正丢失，只是被外部化了。这种可逆性至关重要，因为智能体可能在后续步骤中需要依赖早期的精确行为。<span class="notion-red">Manus 的工具调用和工具结果都存在</span><span class="notion-red"><b>完整</b></span><span class="notion-red">和</span><span class="notion-red"><b>紧凑</b></span><span class="notion-red">两种格式</span>，紧凑版本会剥离可从文件系统或外部状态重建的信息，例如，一个文件写入操作在执行后，其内容字段可以被安全移除，只保留文件路径。当智能体需要时，可以通过路径再次检索。</li><ul class="notion-list notion-list-disc notion-block-294c0110d331809f9dedfc912ff0b258"><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-2b3c0110d33180dca7a6e0abc096f345"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3A81484135-49f7-43ec-a6fd-0f511d72ef1b%3Aimage.png?table=block&amp;id=2b3c0110-d331-80dc-a7a6-e0abc096f345&amp;t=2b3c0110-d331-80dc-a7a6-e0abc096f345" alt="notion image" loading="lazy" decoding="async"/></div></figure></ul></ul><ul class="notion-list notion-list-disc notion-block-294c0110d3318041a84ae77fc5f644a0"><li><b>摘要（Summarization）</b>：一个不可逆的过程，用于浓缩信息。Manus 对此非常谨慎，通常在摘要前会将关键上下文部分卸载到文件中，并始终保留最后几次工具调用的完整细节以保持连贯性。</li><ul class="notion-list notion-list-disc notion-block-294c0110d3318041a84ae77fc5f644a0"><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-2b3c0110d3318074b233c7e9e3546a4f"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3Ab2e54bc5-2fef-4dc3-b1b7-888d0444b6c8%3Aimage.png?table=block&amp;id=2b3c0110-d331-8074-b233-c7e9e3546a4f&amp;t=2b3c0110-d331-8074-b233-c7e9e3546a4f" alt="notion image" loading="lazy" decoding="async"/></div></figure><div class="notion-text notion-block-294c0110d33180bbb436d7105c5fcb99">为了使摘要过程更可靠，Manus <b>避免使用自由形式的提示，而是采用结构化模式 (Schema)</b>。通过定义一个包含特定字段（如“修改的文件”、“用户目标”、“上次停止的位置”）的表单让 AI 填写，可以确保输出的稳定性和一致性。这种方法强制 AI 概括特定信息，而非随意生成，从而提高摘要的质量和可控性。</div></ul></ul><div class="notion-text notion-block-294c0110d33180b6acfbf7e1eca5c406">Manus 通过跟踪上下文长度阈值来管理这两种方法。当上下文接近“腐烂前”阈值（通常为 128k-200k Token）时，首先触发压缩。只有当压缩的收益变得微乎其微时，才会转向摘要。在压缩时，Manus 可能会选择压缩最旧的 50% 工具调用，同时保留较新的调用记录的完整细节，<span class="notion-red"><span class="notion-default_background">以确保模型仍有新鲜的少样本示例来学习如何正确使用工具</span></span>。<b>在进行摘要时，Manus 总是使用完整版本的数据，</b>并保留最后几次工具调用和结果的完整细节，以帮助模型平滑地继续工作，避免风格和语气上的突然变化。</div><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-2b3c0110d3318034a25afaa439d1c70f"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3A58eb2ff8-e3df-4f9b-8608-ce99cea79f89%3Aimage.png?table=block&amp;id=2b3c0110-d331-8034-a25a-faa439d1c70f&amp;t=2b3c0110-d331-8034-a25a-faa439d1c70f" alt="notion image" loading="lazy" decoding="async"/></div></figure><div class="notion-text notion-block-2b4c0110d331807cbc28f15b855bbc16">&lt;ins/&gt;</div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-294c0110d3318048a33cc80d1fb33cc9" data-id="294c0110d3318048a33cc80d1fb33cc9"><span><div id="294c0110d3318048a33cc80d1fb33cc9" class="notion-header-anchor"></div><a class="notion-hash-link" href="#294c0110d3318048a33cc80d1fb33cc9" title="2. 上下文检索：文件系统工具的回归"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>2. 上下文检索：文件系统工具的回归</b></span></span></h4><div class="notion-text notion-block-294c0110d33180dc80bdfc7e4ea38924"><b>上下文检索（Context Retrieval）</b> 侧重于高效地获取相关信息。与依赖索引和语义搜索的系统不同，Manus 在其瞬时沙盒会话中优先使用更简单的基于文件的搜索工具，如 <code class="notion-inline-code">glob</code> 和 <code class="notion-inline-code">grep</code>。Peak 解释说，由于会话的瞬时性，动态构建索引是不切实际的，因为每次会话都是一个全新的环境，没有时间去动态构建索引。因此，依赖于对<b>基于行的文本格式</b>（如纯文本而非 Markdown）进行操作的成熟命令行工具，是更高效的选择。Manus 倾向于使用纯文本，因为 Markdown 有时会导致模型输出过多的项目符号，且基于行的格式更利于 <code class="notion-inline-code">grep</code> 和按行范围读取。</div><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-2b4c0110d331800bb90fc09fe8c220ae"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3A9027721e-dc87-40fa-a47c-1ef4c111b868%3Aimage.png?table=block&amp;id=2b4c0110-d331-800b-b90f-c09fe8c220ae&amp;t=2b4c0110-d331-800b-b90f-c09fe8c220ae" alt="notion image" loading="lazy" decoding="async"/></div></figure><div class="notion-text notion-block-2b4c0110d33180e1a220c946e08febde">然而，对于需要长期记忆或访问大型企业知识库的场景，外部向量索引仍然是必要的。</div><div class="notion-text notion-block-2b4c0110d3318089a766e1d4861f60a1">对于简单的搜索，Manus 会直接将完整的搜索结果附加到上下文中，并依赖压缩机制来管理。但对于需要整合多个查询结果的复杂搜索，Manus 会启动一个子智能体（即“智能体即工具”），由该子智能体负责处理、整合信息，并以主智能体预定义的固定输出模式返回结果。</div><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-2b4c0110d33180b5834cca6d9bebc7a6"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3A05186c87-25f2-4e52-9762-72dde98e762c%3Aimage.png?table=block&amp;id=2b4c0110-d331-80b5-834c-ca6d9bebc7a6&amp;t=2b4c0110-d331-80b5-834c-ca6d9bebc7a6" alt="notion image" loading="lazy" decoding="async"/></div></figure><div class="notion-blank notion-block-2b4c0110d3318090b296e48ebebd5e5e"> </div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-294c0110d33180128512de9da5da5adb" data-id="294c0110d33180128512de9da5da5adb"><span><div id="294c0110d33180128512de9da5da5adb" class="notion-header-anchor"></div><a class="notion-hash-link" href="#294c0110d33180128512de9da5da5adb" title="3. 上下文隔离与多智能体设计"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>3. 上下文隔离与多智能体设计</b></span></span></h4><div class="notion-text notion-block-294c0110d331806aa8bfeb73d34926e6"><b>上下文隔离（Context Isolation）</b> 通过多智能体架构实现。Manus 借鉴了 Go 语言的并发哲学，提出了两种不同的隔离模式：</div><ul class="notion-list notion-list-disc notion-block-294c0110d331809eba84f45b029cc6f3"><li><b>通信模式（Communication Mode）</b>：适用于简单的、指令清晰的任务。主智能体向子智能体发送指令，子智能体的上下文仅限于该指令。这种模式适用于主智能体只关心最终输出，不关心中间过程的任务。</li><ul class="notion-list notion-list-disc notion-block-294c0110d331809eba84f45b029cc6f3"><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-2b3c0110d33180cf9171d387fa81d59e"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3A4034d5a9-39b0-4dc3-b130-c265b35d18b2%3Aimage.png?table=block&amp;id=2b3c0110-d331-80cf-9171-d387fa81d59e&amp;t=2b3c0110-d331-80cf-9171-d387fa81d59e" alt="notion image" loading="lazy" decoding="async"/></div></figure></ul></ul><ul class="notion-list notion-list-disc notion-block-294c0110d3318046819ef8b67e49e169"><li><b>共享上下文模式（Shared Context Mode）</b>：适用于复杂的、依赖历史的任务。子智能体可以访问完整的先前上下文，包括所有的工具使用历史。这种模式在需要完整历史记录的场景下避免了信息检索的延迟和成本，但代价是每次子智能体调用都需要预填充更大的输入，且由于系统提示和行为空间不同，无法重用 KV 缓存。</li><ul class="notion-list notion-list-disc notion-block-294c0110d3318046819ef8b67e49e169"><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-2b3c0110d3318023b7afde9aa1d4be25"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3Ab10df115-be70-474b-8104-0ff10019f726%3Aimage.png?table=block&amp;id=2b3c0110-d331-8023-b7af-de9aa1d4be25&amp;t=2b3c0110-d331-8023-b7af-de9aa1d4be25" alt="notion image" loading="lazy" decoding="async"/></div></figure></ul></ul><div class="notion-text notion-block-294c0110d33180f39f9ace84a6babf14">Manus 的多智能体系统设计避免了基于角色（如设计师、程序员）的划分，认为这种拟人化类比效率低下。相反，系统由少数几个专业智能体组成：一个庞大的<b>通用执行器</b>、一个<b>规划器</b>和一个<b>知识管理器</b>。<b>知识管理器智能体的作用是回顾用户和智能体之间的对话，并判断哪些内容应该被存入长期记忆。</b>大多数子任务通过“<b>智能体即工具</b>”的范式实现，即一个子智能体被封装成一个工具供主智能体调用。在这种模式下，主智能体通过定义输出模式来确保从子智能体获得结构化、可靠的结果，而<b>子智能体则使用一个特殊的</b><span class="notion-red"><b>“提交结果”工具</b></span><b>，通过约束解码来强制执行该模式</b>。这种设计在 Manus 的“Wide Research”（内部称作“智能体版 MapReduce”）功能中得到了应用，通过共享同一个沙盒，文件系统在主子智能体之间共享，信息传递仅需传递不同的文件路径。<b>这种“智能体即工具”的设计使得主智能体向子智能体传递信息变得容易，更重要的是，通过定义输出模式和子智能体的“提交结果”工具，确保了从子智能体获得的输出是结构化且可靠。</b>这种模式解决了多智能体通信中的信息同步难题，尤其适用于复杂任务，它利用共享沙盒和文件系统，通过传递文件路径实现主子智能体间的信息共享。</div><div class="notion-text notion-block-2b4c0110d3318050b7cbd72836c9c671">&lt;ins/&gt;</div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-294c0110d3318013bc03c17bd0fe7e04" data-id="294c0110d3318013bc03c17bd0fe7e04"><span><div id="294c0110d3318013bc03c17bd0fe7e04" class="notion-header-anchor"></div><a class="notion-hash-link" href="#294c0110d3318013bc03c17bd0fe7e04" title="4. 上下文卸载与分层行动空间"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>4. 上下文卸载与分层行动空间</b></span></span></h4><div class="notion-text notion-block-2b4c0110d331808f8a4cdaaf4c9e8cde"><b>上下文卸载（Context Offloading）</b> 的核心思想是：并非所有信息都需要保留在智能体的消息历史中，而是可以将其存储到上下文窗口之外，在需要时再检索回来。另外，随着系统变得越来越复杂，特别是如果集成了 MCP，工具本身会占用大量上下文。上下文中工具过多会导致混乱，出现<b>“上下文混淆”(Context Confusion)</b>，模型可能会调用错误的工具，甚至是不存在的工具。</div><div class="notion-text notion-block-2b4c0110d3318009bd2fdb146f45fc7a">卸载最流行的实践是利用文件系统——将工具输出、搜索结果等消耗大量 Token 的完整内容转储到文件中，只向智能体返回必要的摘要信息，这样既保持了信息的可访问性，又避免了上下文窗口的持续占用。</div><div class="notion-text notion-block-2b4c0110d3318013bc59c117cfa5a01c">Manus 正在试验新颖的<b>分层行动空间（Layered Action Space）</b>方法处理工具过多的情况<b>。</b>在分层行动空间设计中，上下文卸载不仅体现在工作内容的外部存储，更延伸到对工具本身的<b>分层管理</b>：通过将大量命令行工具和 API 能力卸载到第2层和第3层，保持核心函数调用层（第1层）的简洁和稳定，从而避免因工具过多导致的&quot;上下文混淆&quot;问题。</div><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-2b4c0110d331801fb0b3e625fbc43f52"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3A8b774c0f-45bc-43a6-a201-99e9d68d27b9%3Aimage.png?table=block&amp;id=2b4c0110-d331-801f-b0b3-e625fbc43f52&amp;t=2b4c0110-d331-801f-b0b3-e625fbc43f52" alt="notion image" loading="lazy" decoding="async"/></div></figure><div class="notion-text notion-block-294c0110d33180e4bc91f4bdd47903c4"><b>分层行动空间（Layered Action Space）具体思路：</b></div><ul class="notion-list notion-list-disc notion-block-294c0110d33180aeb731f62b7fb79327"><li><b>第 1 层：原子函数调用（Atomic Function Calls）</b>：Manus 仅使用一小组（10-20个）固定的原子函数，如读写文件、执行 shell 命令、在互联网和文件中搜索，以及一些浏览器操作。这些函数因约束解码而模式安全，且数量有限，避免了缓存失效和混淆。Manus 刻意避免使用与现有模型训练中工具名称相同的命名，以防止模型混淆不同工具的参数和预期行为。如果自定义函数与现有模型训练中学习到的工具具有相同的名称，可能会导致模型混淆参数和预期行为，从而影响其性能。</li></ul><ul class="notion-list notion-list-disc notion-block-294c0110d3318018a276cd583be6a705"><li><b>第 2 层：沙盒实用工具（Sandbox Utilities）</b>：在完整的 VM 沙盒中，Manus 可以执行预装的命令行工具。LLM 通过系统提示得知这些工具的存在，并被鼓励使用 <code class="notion-inline-code">-help</code> 标志来查询用法。例如，Manus 会被告知在 <code class="notion-inline-code">/usr/bin</code> 目录下有许多命令行工具。对于最常用的工具，其名称会以紧凑格式注入到系统提示中。这极大地扩展了智能体的能力，而无需修改其核心函数调用空间。这些工具的好处在于，它们可以直接处理大输出（例如写入文件或分页返回结果），并可利用 Linux 工具（如 <code class="notion-inline-code">grep</code>、<code class="notion-inline-code">cat</code>、<code class="notion-inline-code">less</code>）进行即时处理。</li></ul><ul class="notion-list notion-list-disc notion-block-294c0110d3318005aa41f4449fe1b13a"><li><b>第 3 层：软件包和 API（Packages and APIs）</b>：此层允许<b>编写并执行 Python 脚本</b>来调用预授权的 API 或自定义软件包。这对于内存密集型计算（如分析大量股票数据）是理想的，因为计算过程在 Python 运行时内存中完成，只有最终的摘要结果返回给模型。Manus 预装了大量的 API 密钥，用户无需单独购买和配置。这种方式虽然不具备模式安全性，但代码的高度可组合性允许在单一步骤中链接多个操作，例如在一个 Python 脚本中完成获取城市名称、城市 ID 和天气等多个任务。</li></ul><div class="notion-blank notion-block-2b4c0110d3318041b165f3eea976d223"> </div><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-2b3c0110d331807b8a98d6fee811c8ec"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3Abf418096-743f-41b5-9f2d-b034f4a2efe2%3Aimage.png?table=block&amp;id=2b3c0110-d331-807b-8a98-d6fee811c8ec&amp;t=2b3c0110-d331-807b-8a98-d6fee811c8ec" alt="notion image" loading="lazy" decoding="async"/></div></figure><div class="notion-blank notion-block-2b4c0110d33180648783c79db5e958a0"> </div><div class="notion-text notion-block-294c0110d331806d9ae6f60dd9595949">从模型的角度来看，所有三个层的操作最终都通过少数几个核心的原子函数（如 <code class="notion-inline-code">shell</code> 和 <code class="notion-inline-code">file</code>）来执行，从而为 LLM 维护了一个简单、缓存友好且正交的接口。这种<b>混合模式</b>，即结合了直接的工具调用和沙盒中的代码执行，平衡了约束解码的安全性与代码执行的灵活性。Peak 认为，只要是可以在编译器或解释器运行时内部处理的事情，都应该用代码来做；否则，就使用沙盒工具或函数调用。</div><div class="notion-text notion-block-2b4c0110d331809ba73acca9cfab6656">&lt;ins/&gt;</div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-294c0110d33180cb9c55d617d958f7a0" data-id="294c0110d33180cb9c55d617d958f7a0"><span><div id="294c0110d33180cb9c55d617d958f7a0" class="notion-header-anchor"></div><a class="notion-hash-link" href="#294c0110d33180cb9c55d617d958f7a0" title="5. More: 长期记忆、规划与模型适应性"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>5. More: 长期记忆、规划与模型适应性</b></span></span></h4><ul class="notion-list notion-list-disc notion-block-294c0110d33180448c88e4b7d5c4a558"><li><b>长期记忆</b>：Manus 采用一种显式的“知识”概念，需要用户确认才能将信息（如偏好设置）存入长期记忆。例如，用户可以告诉 Manus 每次都以 Excel 格式交付结果，系统会弹窗询问是否接受此项作为长期知识。<b>这种“知识”系统类似于一种显式记忆，用户可以主动选择接受或拒绝 Manus 从对话中学习到的偏好。</b>同时，系统也在探索利用集体用户反馈进行无参数的在线学习，以实现自我改进，例如通过识别用户对字体问题的共同修正来提升数据可视化能力。<b>这种无参数的学习方式，旨在利用用户对智能体行为的纠正（如数据可视化中的字体问题），实现智能体的自我改进，而非依赖传统的参数化训练。</b></li></ul><ul class="notion-list notion-list-disc notion-block-294c0110d331800d91f6feaec852400e"><li><b>规划</b>：Manus 已经从最初使用 <code class="notion-inline-code">todo.md</code> 文件（被证明 Token 效率低下，浪费了大量交互轮次和 Token）演变为使用一个独立的、结构化的<b>规划器智能体</b>。还有一个独立的智能体<b>作为“外部审查员”，能够从不同视角审视计划，甚至可以利用不同模型（如 Claude Haiku）的独特见解，从而显著节省 Token 并提高规划质量。</b>它通过“智能体即工具”的范式实现，作为一个独立的工具供主智能体调用，不再像早期那样通过频繁更新 <code class="notion-inline-code">todo.md</code> 文件来浪费 Token。</li></ul><ul class="notion-list notion-list-disc notion-block-294c0110d331807f8223d69184053e81"><li><b>适应模型演进</b>：为了应对 LLM 的快速迭代，Manus 采取了一种独特的评估策略：固定其智能体架构，然后在不同的模型（从弱到强）之间进行切换。如果一个架构从较弱的模型切换到较强的模型后能获得巨大提升，那么在某种程度上，该架构就更具未来适应性。<b>Manus 通常每隔一两个月就会进行一次这样的架构审视，并经常在内部使用开源模型或提前试用专有模型，以便为下一个版本的模型发布做好准备。</b></li></ul><ul class="notion-list notion-list-disc notion-block-294c0110d33180e483a3f14e2cf98f2e"><li><b>模型选择与成本</b>：Manus 目前没有使用开源模型，主要是因为在 Manus 的规模下，分布式 KV 缓存的实现难度和成本。与前沿 LLM 提供商合作，利用其强大的基础设施，有时反而比自建开源方案更经济。Manus 不仅使用 Anthropic 模型（认为其最适合智能体任务），也关注 Gemini 和 OpenAI 的进展，并进行任务级别的路由，根据子任务的特性选择最合适的模型（例如，<b>Claude 擅长编码，Gemini 擅长多模态，OpenAI 擅长复杂数学和推理</b>）。<b>Manus 会利用模型提供商的输入缓存（Input Caching）功能，以优化 KV 缓存管理。</b></li></ul><div class="notion-blank notion-block-2b4c0110d33180949a88c6264ae3566e"> </div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-294c0110d33180cba03bdb038dee6496" data-id="294c0110d33180cba03bdb038dee6496"><span><div id="294c0110d33180cba03bdb038dee6496" class="notion-header-anchor"></div><a class="notion-hash-link" href="#294c0110d33180cba03bdb038dee6496" title="6. 安全与评估"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>6. 安全与评估</b></span></span></h4><ul class="notion-list notion-list-disc notion-block-294c0110d3318092b321cd2646d7496f"><li><b>安全与防护</b>：Manus 在沙盒环境中投入大量精力进行防护，例如阻止信息泄露（如 Token）到沙盒之外，并对出站流量进行检查。<b>Peak 强调，如果用户被提示注入，系统会对出站流量进行检查，确保敏感信息如 Token 不会离开沙盒。</b>对于浏览器内的敏感操作（如登录持久化）或沙盒内的敏感操作，Manus 会要求用户手动确认或接管，因为网页内容本身可能存在提示注入的风险。Manus 与模型提供商紧密合作，共同增强防护措施。<b>Peak 承认，设计一个完美无缺的解决方案非常困难，这是一个循序渐进的过程，目前 Manus 倾向于让用户在敏感操作时接管，并期待模型本身的防护能力增强。</b></li></ul><ul class="notion-list notion-list-disc notion-block-294c0110d33180e6bda5cfaee0e310a1"><li><b>评估策略</b>：Manus 采用多维度的评估方法。首先是<b>用户评分</b>（1-5星），这是衡量实际用户体验的黄金标准。其次是<b>自动化测试</b>，包括内部创建的、带有可验证结果的数据集，以及侧重于执行性或交易性任务的定制基准。最后，也是最重要的是<b>真人评估</b>，通过实习生评估网站生成、数据可视化等涉及品味和美观的任务，因为这些难以通过奖励模型进行自动化评估。</li></ul><ul class="notion-list notion-list-disc notion-block-294c0110d33180788579d270992d77db"><li><b>强化学习与工具调用智能体</b>：Peak 认为，对于支持 MCP 这种非固定行为空间的智能体，难以设计有效的奖励函数进行强化学习。他指出，如果行为空间不固定，就很难设计好的奖励函数，生成的部署和反馈也会不平衡，这实际上是在重复构建基础模型提供商已经完成的工作。因此，<b>Manus 倾向于无参数的在线学习方式，例如利用集体用户反馈进行自我改进</b>，而不是投入大量资源进行强化学习，因为模型公司已经在基础模型层面做了类似的工作。</li></ul><h3 class="notion-h notion-h2 notion-h-indent-0 notion-block-294c0110d331805fbf4fc4fdd2670286" data-id="294c0110d331805fbf4fc4fdd2670286"><span><div id="294c0110d331805fbf4fc4fdd2670286" class="notion-header-anchor"></div><a class="notion-hash-link" href="#294c0110d331805fbf4fc4fdd2670286" title="结论：简化胜于过度工程"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>结论：简化胜于过度工程</b></span></span></h3><div class="notion-text notion-block-294c0110d331803286dde2399d69057c">尽管上下文工程的技术多种多样，但 Manus 最大的进步往往来自于<b>简化</b>——移除不必要的复杂性，并给予底层 LLM 更多的信任。<b>上下文工程的真正艺术在于，在多个可能相互冲突的目标（如性能、成本、延迟、可逆性）之间找到微妙的平衡，并始终追求更简单、更稳定、更智能的智能体架构。</b>他总结道：“少做加法，多做理解 (build less and understand more)。”</div><div class="notion-text notion-block-294c0110d33181269a64d1dd37631139">&lt;ins/&gt;</div><div class="notion-blank notion-block-2b9c0110d331805fa0e0fbd7236dbb3a"> </div><h3 class="notion-h notion-h2 notion-h-indent-0 notion-block-2b9c0110d331805e9a9dd050c06183bd" data-id="2b9c0110d331805e9a9dd050c06183bd"><span><div id="2b9c0110d331805e9a9dd050c06183bd" class="notion-header-anchor"></div><a class="notion-hash-link" href="#2b9c0110d331805e9a9dd050c06183bd" title="AI Agents 知识星球"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">AI Agents 知识星球</span></span></h3><div class="notion-text notion-block-2b9c0110d3318098932ed8e303f5d108">GUI Agents 技术发展迅猛，想紧跟 GUI/AI agents 技术前沿？我们的知识星球会<b>介绍 Agents 相关的最新项目和工具，并以视频方式解读最新论文</b>，为你开启技术新视野，快来加入吧！</div><div class="notion-sync-block notion-block-260c0110d3318122956bc21e46f27afe"><div class="notion-row notion-block-c9c046ed82664131ae54bf494960163c"><div class="notion-column notion-block-9bfca92ce87b4a2a902c7c1a729bdef6" style="width:calc((100% - (1 * min(32px, 4vw))) * 0.5)"><div class="notion-text notion-block-82a381c6c9884ac19e41aa9d99da6a76">加入知识星球，每周获取会员专享视频👇</div><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-260c0110d331810b9744c1a7d8ae37ce"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3Ad1adc9e1-7b6a-453a-a9f3-2e2e826a3b09%3Aimage.png?table=block&amp;id=260c0110-d331-810b-9744-c1a7d8ae37ce&amp;t=260c0110-d331-810b-9744-c1a7d8ae37ce" alt="notion image" loading="lazy" decoding="async"/></div></figure><div class="notion-blank notion-block-da4f816748d54d2fbe76f12d542a6fb1"> </div></div><div class="notion-spacer"></div><div class="notion-column notion-block-3c596795a25f4528adea89c89458d903" style="width:calc((100% - (1 * min(32px, 4vw))) * 0.5)"><div class="notion-text notion-block-a3ae1b26bc1a4c07855cf3305d202f0b">扫码加微信小助手为好友，备注「agent」，小助手会定期邀请入群👇</div><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-260c0110d33181c792dac1caa43a8fe7"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/https%3A%2F%2Fprod-files-secure.s3.us-west-2.amazonaws.com%2F9341931a-53f0-48e1-b026-0f1ad17b457c%2Feed2e715-74df-4361-bd15-bc084f0d791f%2Fimage.png?table=block&amp;id=260c0110-d331-81c7-92da-c1caa43a8fe7&amp;t=260c0110-d331-81c7-92da-c1caa43a8fe7&amp;width=337.741455078125&amp;cache=v2" alt="notion image" loading="lazy" decoding="async"/></div></figure></div><div class="notion-spacer"></div></div></div><div class="notion-sync-block notion-block-151c0110d33180b3ba16fe7b239b5be6"><div class="notion-text notion-block-446d571c1ef64379a26332ffa4bf728b"><b>当前星球包含的专享视频包括：</b></div><ul class="notion-list notion-list-disc notion-block-e279ee05d7d84f14867c4426e1c40dbb"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1fcSEBMEzr" target="_blank" rel="noopener noreferrer">AI-Agents 中的上下文工程（Context-Engineering）</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-ba3388c448dc4898b72965d6c8b0f98d"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV13wuozDExH" target="_blank" rel="noopener noreferrer">GUI Agents 最新技术综述（2025）</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-3fb739bf89304e2eab663f887c9d6266"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1EeTvzaEBw" target="_blank" rel="noopener noreferrer">GUI Agent 最新技术：MONDAY—从视频自动构建 GUI Agents 轨迹数据</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-b049f409ac8843daad060dac3491d7cb"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1MVG1zsEB7" target="_blank" rel="noopener noreferrer">GUI Agent 最新技术：InfiGUI-R1—从反应式执行向推理式决策的进阶之路</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-37b926f98a28482b93a183a226f56d3f"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1bmdzYzEty" target="_blank" rel="noopener noreferrer">GUI Agent 最新技术：自动驾驶与具身智能技术能带来哪些启示？</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-f54e2c5bc7e648b2aba39ab1985c65c6"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1uyRhY2EFi" target="_blank" rel="noopener noreferrer">GUI Agent 最新技术：ATLaS—同时提升训练效率和模型泛化性</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-0021ce23ee594382abfbedf06ee3582b"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1gm96YrEQY" target="_blank" rel="noopener noreferrer">GUI Agent 技术分享：DigiQ/VEM—使用 RL 提升模型的泛化能力</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-4f3f5fc916124dfb95912767379db9b9"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1pPFceFE42" target="_blank" rel="noopener noreferrer">UI Agent 技术分享： UI-TARS—利用长期记忆和反思调整迭代优化模型</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-989f4fc28f3243e5b2545363fc5bfae0"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1itwkerEyu" target="_blank" rel="noopener noreferrer">AI Agent 技术分享：Insight-V—探索 VLM 的长链条视觉推理能力</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-279ade68f2e74691befa0fd63d4bd627"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1hZcGe1ELm" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：PC-Agent—提升模型认知能力以便更好完成复杂任务</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-6da2c8d0d77148f988157bc8bca8fb05"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1aKrTY7EWB" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：OS-Genesis—自动合成高质量且多样化的训练数据</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-9e3d811d175f473080c7cccf21ae5e8b"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1u26hY5Eyw" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：PAE-通过自动探索新任务不断扩展模型能力</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-3d22b1de3c97465ea2ae3ca46f7f3322"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1dgCNYXEfa" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：Iris-通过自动构造的数据提升模型效果</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-fc8987322bf84ac883f1723c8fd47fe7"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV17VqfYfEjk" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：Falcon-UI—利用无监督数据预训练 UI Agent 模型</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-0bfba06238534895ad33829d495e0672"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1erqxYhEBc" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：Aguvis-来自 HKU &amp; Salesforce 的大一统训练数据和训练框架</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-16f47cc74840469885af43454f46a8d0"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1U86FY9E1G" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：ShowUI-当前最好的 UI Agents 开源模型，还适用中文 APP？</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-0c0eb8f030cd4a2fa702a8c8adabd98a"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1pjBtYnE6C" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：使用世界模型提升 UI Agents 效果？</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-64ec5513bf7445a38cb55d71224e3705"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV14eU7YWEEs" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：来自华为诺亚方舟实验室的 LiMAC</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-20f715d38a624d65acb65337d3f00620"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1c1mpYtEqG" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：来自 LG AI Research 的 Auto-Intent</a></b></span></li></ul><div class="notion-blank notion-block-1fe7ae2650754f9db74d20ee936a5a23"> </div></div><div class="notion-text notion-block-2b9c0110d3318040b2d9c88f6c81b9dc">&lt;ins/&gt;</div><div class="notion-blank notion-block-2b9c0110d33180ad97cddb43f1f6d270"> </div><h3 class="notion-h notion-h2 notion-h-indent-0 notion-block-294c0110d33181edbeb2e167c3cc37ed" data-id="294c0110d33181edbeb2e167c3cc37ed"><span><div id="294c0110d33181edbeb2e167c3cc37ed" class="notion-header-anchor"></div><a class="notion-hash-link" href="#294c0110d33181edbeb2e167c3cc37ed" title="参考文献"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>参考文献</b></span></span></h3><ol start="1" class="notion-list notion-list-numbered notion-block-294c0110d331806e82eff4c4695fbd79" style="list-style-type:decimal"><li><a class="notion-link" href="https://www.youtube.com/watch?v=6_BcCthVvb8" target="_blank" rel="noopener noreferrer">Context Engineering for AI Agents with LangChain and Manus - YouTube</a></li><ol class="notion-list notion-list-numbered notion-block-294c0110d331806e82eff4c4695fbd79" style="list-style-type:lower-alpha"><ul class="notion-list notion-list-disc notion-block-294c0110d3318102964cdfb4c31cb52b"><li>转录文字稿：<a class="notion-link" href="https://www.bestblogs.dev/video/087a1f3" target="_blank" rel="noopener noreferrer">LangChain 和 Manus 的 AI 智能体上下文工程实践 | BestBlogs.dev</a></li></ul><ul class="notion-list notion-list-disc notion-block-294c0110d33180808448c6c35d59d7e5"><li>英文 PPTs：<a class="notion-link" href="https://docs.google.com/presentation/d/16aaXLu40GugY-kOpqDU4e-S0hD1FmHcNyF0rRRnb1OU/edit?slide=id.p#slide=id.p" target="_blank" rel="noopener noreferrer">Context Engineering Meetup - Google Slides</a>，<a class="notion-link" href="https://drive.google.com/file/d/1QGJ-BrdiTGslS71sYH4OJoidsry3Ps9g/view" target="_blank" rel="noopener noreferrer">Manus Context Engineering LangChain Webinar.pdf - Google Drive</a></li></ul></ol></ol><ol start="2" class="notion-list notion-list-numbered notion-block-2b2c0110d33180f18d36cea3d4285c87" style="list-style-type:decimal"><li><a class="notion-link" href="https://www.notion.so/Context-Engineering-for-Agents-2a1808527b17803ba221c2ced7eef508" target="_blank" rel="noopener noreferrer">Context Engineering for Agents</a></li></ol><ol start="3" class="notion-list notion-list-numbered notion-block-2b3c0110d3318017868dfec4bc66df01" style="list-style-type:decimal"><li><a class="notion-link" href="https://arxiv.org/abs/2510.26493" target="_blank" rel="noopener noreferrer">[2510.26493] Context Engineering 2.0: The Context of Context Engineering</a></li></ol><div class="notion-blank notion-block-294c0110d3318115b138d71f9278875a"> </div></main></div>]]></content:encoded>
        </item>
        <item>
            <title><![CDATA[GUI Agents（智能体）最新论文]]></title>
            <link>https://www.breezedeus.com/article/awesome-ui-agents</link>
            <guid>https://www.breezedeus.com/article/awesome-ui-agents</guid>
            <pubDate>Sat, 09 Nov 2024 00:00:00 GMT</pubDate>
            <description><![CDATA[近期 Claude 发布了 Compute Use，智谱发布了 Phone Use 的 AutoGLM，它们都是利用 UI Agents 技术让智能体模拟人操作电脑和手机完成指定任务。本文列出 UI Agents 相关的最新论文和资料，并持续更新中…]]></description>
            <content:encoded><![CDATA[<div id="notion-article" class="mx-auto overflow-hidden "><main class="notion light-mode notion-page notion-block-139c0110d3318079a832f109869738f6"><div class="notion-viewport"></div><div class="notion-collection-page-properties"></div><div class="notion-row notion-block-139c0110d33181fd9a9fdeb9f798a344"><div class="notion-column notion-block-139c0110d331818d9adfd4dede7d3c5e" style="width:calc((100% - (2 * min(32px, 4vw))) * 0.25)"><div class="notion-blank notion-block-139c0110d33181068668de0d19d19e2c"> </div></div><div class="notion-spacer"></div><div class="notion-column notion-block-139c0110d3318121bc45e429c567c838" style="width:calc((100% - (2 * min(32px, 4vw))) * 0.5416666666666667)"><div class="notion-text notion-block-139c0110d33181609369f06546dbb7b6"><b><a class="notion-link" href="https://www.breezedeus.com/" target="_blank" rel="noopener noreferrer">Home</a></b><b> | </b><b><a class="notion-link" href="https://github.com/breezedeus" target="_blank" rel="noopener noreferrer">GitHub</a></b><b> | </b><b><a class="notion-link" href="https://twitter.com/breezedeus" target="_blank" rel="noopener noreferrer">Twitter</a></b><b> | </b><b><a class="notion-link" href="https://www.youtube.com/@breezedeus" target="_blank" rel="noopener noreferrer">Youtube</a></b><b>  |  </b><b><a class="notion-link" href="https://space.bilibili.com/509307267" target="_blank" rel="noopener noreferrer">Bilibili</a></b></div></div><div class="notion-spacer"></div><div class="notion-column notion-block-139c0110d331816880fbeb7e99e6dcc1" style="width:calc((100% - (2 * min(32px, 4vw))) * 0.2083333333333335)"><div class="notion-blank notion-block-139c0110d3318180a7e7f7fb4c366231"> </div></div><div class="notion-spacer"></div></div><div class="notion-row notion-block-139c0110d3318167aa02e044a71eed92"><div class="notion-column notion-block-139c0110d331813ca223e69b1ef0f334" style="width:calc((100% - (1 * min(32px, 4vw))) * 0.5)"><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-139c0110d331813a8e76fb171db60410"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:384px;max-width:100%;flex-direction:column"><img style="object-fit:cover" src="https://www.notion.so/image/https%3A%2F%2Fprod-files-secure.s3.us-west-2.amazonaws.com%2F9341931a-53f0-48e1-b026-0f1ad17b457c%2Fdb46f0ea-9d28-4b46-bdf6-bb477e96bd5c%2Fimage.png?table=block&amp;id=139c0110-d331-813a-8e76-fb171db60410&amp;t=139c0110-d331-813a-8e76-fb171db60410&amp;width=384&amp;cache=v2" alt="notion image" loading="lazy" decoding="async"/></div></figure></div><div class="notion-spacer"></div><div class="notion-column notion-block-139c0110d331812ca9ded6139e7f5634" style="width:calc((100% - (1 * min(32px, 4vw))) * 0.5)"><div class="notion-text notion-block-139c0110d33181199aa1db35ca0e554c"><b>目录：</b></div><div class="notion-table-of-contents notion-gray notion-block-139c0110d331814bb087f605b0e4b7a6"><a href="#139c0110d331813b9692f9056a7960fd" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:0">UI Agents 知识星球</span></a><a href="#139c0110d331802aa42ddd658b6e405a" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:0">UI Agents 综述资料【Update 2025.03.22】</span></a><a href="#139c0110d33180db9fcdfb72773858e4" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:0">UI Agents 论文列表【Update 2025.03.22】</span></a><a href="#151c0110d33180388fe1feb3f5c8721e" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:24px">Policy Models</span></a><a href="#151c0110d3318044b605dbd983cb9c2c" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:48px">Training-based Models</span></a><a href="#151c0110d33180988f5bcd9a57f7e13f" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:48px">Training-free Models</span></a><a href="#151c0110d33180bf818bd4f09dbb6a1d" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:24px">Enhanced Knowledges</span></a><a href="#151c0110d33180cc8dbcdc2eb0427a7b" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:24px">Data Synthesis</span></a><a href="#139c0110d331804687a9e6aa54725c37" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:24px">Datasets / Benchmarks</span></a><a href="#151c0110d3318074bc5bdac6be5ace96" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:24px">Tools / Environments</span></a><a href="#165c0110d33180c385d3cd8b1f7c8a8d" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:24px">Others</span></a><a href="#139c0110d331805895a9d1467418e470" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:0">UI Agents 其他汇总信息</span></a></div></div><div class="notion-spacer"></div></div><div class="notion-blank notion-block-139c0110d33180f0928ee79b2b8de1a9"> </div><h2 class="notion-h notion-h1 notion-h-indent-0 notion-block-139c0110d331813b9692f9056a7960fd" data-id="139c0110d331813b9692f9056a7960fd"><span><div id="139c0110d331813b9692f9056a7960fd" class="notion-header-anchor"></div><a class="notion-hash-link" href="#139c0110d331813b9692f9056a7960fd" title="UI Agents 知识星球"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">UI Agents 知识星球</span></span></h2><div class="notion-text notion-block-139c0110d33181c5a8e2c61fff2b12ba">UI Agents 技术发展迅猛，想紧跟 UI agents 技术前沿？我们的知识星球每周以视频方式<b>解读最新论文</b>，为你开启技术新视野，快来加入吧！</div><div class="notion-sync-block notion-block-152c0110d33181f090d9e4997c8eca1f"><div class="notion-row notion-block-152c0110d33181c08dc6d7b8428cdfc2"><div class="notion-column notion-block-152c0110d3318133876cd29e6b65c0c0" style="width:calc((100% - (1 * min(32px, 4vw))) * 0.5)"><div class="notion-text notion-block-152c0110d33181198aaee36db2ec5d05">加入知识星球，每周获取会员专享视频👇</div><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-1abc0110d33180bfa5cdc4bad8debfbc"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3A5f7a73f8-7130-42b3-8aee-ddff88aad100%3Aimage.png?table=block&amp;id=1abc0110-d331-80bf-a5cd-c4bad8debfbc&amp;t=1abc0110-d331-80bf-a5cd-c4bad8debfbc" alt="notion image" loading="lazy" decoding="async"/></div></figure><div class="notion-blank notion-block-152c0110d331814191e7c1bfedb83d9a"> </div></div><div class="notion-spacer"></div><div class="notion-column notion-block-152c0110d33181009259fa3bca4ad6d3" style="width:calc((100% - (1 * min(32px, 4vw))) * 0.5)"><div class="notion-text notion-block-152c0110d33181be9604d9b7609c8db2">扫码加微信小助手为好友，备注「agent」，小助手会定期邀请入群👇</div><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-154c0110d33180528fd6e63e8ad53371"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/https%3A%2F%2Fprod-files-secure.s3.us-west-2.amazonaws.com%2F9341931a-53f0-48e1-b026-0f1ad17b457c%2Feed2e715-74df-4361-bd15-bc084f0d791f%2Fimage.png?table=block&amp;id=154c0110-d331-8052-8fd6-e63e8ad53371&amp;t=154c0110-d331-8052-8fd6-e63e8ad53371&amp;width=331.9952087402344&amp;cache=v2" alt="notion image" loading="lazy" decoding="async"/></div></figure></div><div class="notion-spacer"></div></div></div><div class="notion-sync-block notion-block-151c0110d33180b3ba16fe7b239b5be6"><div class="notion-text notion-block-446d571c1ef64379a26332ffa4bf728b"><b>当前星球包含的专享视频包括：</b></div><ul class="notion-list notion-list-disc notion-block-e279ee05d7d84f14867c4426e1c40dbb"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1fcSEBMEzr" target="_blank" rel="noopener noreferrer">AI-Agents 中的上下文工程（Context-Engineering）</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-ba3388c448dc4898b72965d6c8b0f98d"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV13wuozDExH" target="_blank" rel="noopener noreferrer">GUI Agents 最新技术综述（2025）</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-3fb739bf89304e2eab663f887c9d6266"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1EeTvzaEBw" target="_blank" rel="noopener noreferrer">GUI Agent 最新技术：MONDAY—从视频自动构建 GUI Agents 轨迹数据</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-b049f409ac8843daad060dac3491d7cb"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1MVG1zsEB7" target="_blank" rel="noopener noreferrer">GUI Agent 最新技术：InfiGUI-R1—从反应式执行向推理式决策的进阶之路</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-37b926f98a28482b93a183a226f56d3f"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1bmdzYzEty" target="_blank" rel="noopener noreferrer">GUI Agent 最新技术：自动驾驶与具身智能技术能带来哪些启示？</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-f54e2c5bc7e648b2aba39ab1985c65c6"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1uyRhY2EFi" target="_blank" rel="noopener noreferrer">GUI Agent 最新技术：ATLaS—同时提升训练效率和模型泛化性</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-0021ce23ee594382abfbedf06ee3582b"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1gm96YrEQY" target="_blank" rel="noopener noreferrer">GUI Agent 技术分享：DigiQ/VEM—使用 RL 提升模型的泛化能力</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-4f3f5fc916124dfb95912767379db9b9"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1pPFceFE42" target="_blank" rel="noopener noreferrer">UI Agent 技术分享： UI-TARS—利用长期记忆和反思调整迭代优化模型</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-989f4fc28f3243e5b2545363fc5bfae0"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1itwkerEyu" target="_blank" rel="noopener noreferrer">AI Agent 技术分享：Insight-V—探索 VLM 的长链条视觉推理能力</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-279ade68f2e74691befa0fd63d4bd627"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1hZcGe1ELm" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：PC-Agent—提升模型认知能力以便更好完成复杂任务</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-6da2c8d0d77148f988157bc8bca8fb05"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1aKrTY7EWB" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：OS-Genesis—自动合成高质量且多样化的训练数据</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-9e3d811d175f473080c7cccf21ae5e8b"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1u26hY5Eyw" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：PAE-通过自动探索新任务不断扩展模型能力</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-3d22b1de3c97465ea2ae3ca46f7f3322"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1dgCNYXEfa" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：Iris-通过自动构造的数据提升模型效果</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-fc8987322bf84ac883f1723c8fd47fe7"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV17VqfYfEjk" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：Falcon-UI—利用无监督数据预训练 UI Agent 模型</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-0bfba06238534895ad33829d495e0672"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1erqxYhEBc" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：Aguvis-来自 HKU &amp; Salesforce 的大一统训练数据和训练框架</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-16f47cc74840469885af43454f46a8d0"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1U86FY9E1G" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：ShowUI-当前最好的 UI Agents 开源模型，还适用中文 APP？</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-0c0eb8f030cd4a2fa702a8c8adabd98a"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1pjBtYnE6C" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：使用世界模型提升 UI Agents 效果？</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-64ec5513bf7445a38cb55d71224e3705"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV14eU7YWEEs" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：来自华为诺亚方舟实验室的 LiMAC</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-20f715d38a624d65acb65337d3f00620"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1c1mpYtEqG" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：来自 LG AI Research 的 Auto-Intent</a></b></span></li></ul><div class="notion-blank notion-block-1fe7ae2650754f9db74d20ee936a5a23"> </div></div><div class="notion-text notion-block-b4de8fd4a96f4864b62b332c7309f167">&lt;ins/&gt;</div><h2 class="notion-h notion-h1 notion-h-indent-0 notion-block-139c0110d331802aa42ddd658b6e405a" data-id="139c0110d331802aa42ddd658b6e405a"><span><div id="139c0110d331802aa42ddd658b6e405a" class="notion-header-anchor"></div><a class="notion-hash-link" href="#139c0110d331802aa42ddd658b6e405a" title="UI Agents 综述资料【Update 2025.03.22】"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">UI Agents 综述资料【Update 2025.03.22】</span></span></h2><ul class="notion-list notion-list-disc notion-block-139c0110d33180fab917dd28dcc68af8"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.breezedeus.com/article/ui-agent" target="_blank" rel="noopener noreferrer">UI Agents（智能体）技术综述</a></b></span><span class="notion-blue"><b>, </b></span><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1CtDWYzE9b" target="_blank" rel="noopener noreferrer">Bilibili</a></b></span><span class="notion-blue"><b>, </b></span><span class="notion-blue"><b><a class="notion-link" href="https://youtu.be/YAhXGjV25zU" target="_blank" rel="noopener noreferrer">Youtube</a></b></span><span class="notion-blue"><b>, Breezedeus, 2024.11</b></span></li></ul><ul class="notion-list notion-list-disc notion-block-1bec0110d33180dca6dfd98784780483"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2503.11069" target="_blank" rel="noopener noreferrer">[2503.11069] API Agents vs. GUI Agents: Divergence and Convergence</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-19cc0110d3318084be70f8a239e7539a"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2501.16150" target="_blank" rel="noopener noreferrer">[2501.16150] AI Agents for Computer Use: A Review of Instruction-based Computer Control, GUI Automation, and Operator Assistants</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-186c0110d331801c9235c0e4de7a8eca"><li><span class="notion-blue">[2501] </span><span class="notion-blue"><a class="notion-link" href="https://os-agent-survey.github.io/" target="_blank" rel="noopener noreferrer">OS Agents: A Survey on MLLM-based Agents for General Computing Devices Use</a></span><span class="notion-blue">, OPPO</span></li></ul><ul class="notion-list notion-list-disc notion-block-161c0110d331804685dff5ed839ac1fa"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2412.13501" target="_blank" rel="noopener noreferrer">[2412.13501] GUI Agents: A Survey</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-161c0110d3318025a284e7464a0ef4ae"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2412.10047" target="_blank" rel="noopener noreferrer">[2412.10047] Large Action Models: From Inception to Implementation</a></span><span class="notion-blue">, Microsoft</span></li></ul><ul class="notion-list notion-list-disc notion-block-17ac0110d3318069b528cf1264687206"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2411.10943" target="_blank" rel="noopener noreferrer">[2411.10943] Generalist Virtual Agents: A Survey on Autonomous Agents Across Digital Platforms</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-14fc0110d331801fb1d7cf1d14cfb27a"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2411.18279" target="_blank" rel="noopener noreferrer">[2411.18279] Large Language Model-Brained GUI Agents: A Survey</a></span><span class="notion-blue">, Microsoft</span></li></ul><ul class="notion-list notion-list-disc notion-block-151c0110d33180eaa1a6c98ae41e0082"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2411.10323" target="_blank" rel="noopener noreferrer">[2411.10323] The Dawn of GUI Agent: A Preliminary Case Study with Claude 3.5 Computer Use</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-139c0110d33180b9a9efc08680ebddbb"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2411.04890" target="_blank" rel="noopener noreferrer">[2411.04890] GUI Agents with Foundation Models: A Comprehensive Survey</a></span><span class="notion-blue">, Huawei Noah’s Ark Lab</span></li></ul><ul class="notion-list notion-list-disc notion-block-139c0110d331807aa66ec9455628cb40"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2411.02006" target="_blank" rel="noopener noreferrer">[2411.02006] Foundations and Recent Trends in Multimodal Mobile Agents: A Survey</a></span></li></ul><div class="notion-blank notion-block-14fc0110d33180509866cb6676aa0011"> </div><h2 class="notion-h notion-h1 notion-h-indent-0 notion-block-139c0110d33180db9fcdfb72773858e4" data-id="139c0110d33180db9fcdfb72773858e4"><span><div id="139c0110d33180db9fcdfb72773858e4" class="notion-header-anchor"></div><a class="notion-hash-link" href="#139c0110d33180db9fcdfb72773858e4" title="UI Agents 论文列表【Update 2025.03.22】"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">UI Agents 论文列表【Update 2025.03.22】</span></span></h2><div class="notion-callout notion-gray_background_co notion-block-139c0110d33180e5869cdcbe2e1c9bd0"><div class="notion-page-icon-inline notion-page-icon-span"><span class="notion-page-icon" role="img" aria-label="⛔">⛔</span></div><div class="notion-callout-text"><div class="notion-text notion-block-ab237300da674afabed4a83c20a13d5b"><b>知识星球</b>每周会从此列表中选出一到两篇论文通过视频方式讲解。大家对哪些论文感兴趣欢迎加入星球并留言说明。</div></div></div><div class="notion-blank notion-block-151c0110d33180df8949dc358cdca826"> </div><h3 class="notion-h notion-h2 notion-h-indent-1 notion-block-151c0110d33180388fe1feb3f5c8721e" data-id="151c0110d33180388fe1feb3f5c8721e"><span><div id="151c0110d33180388fe1feb3f5c8721e" class="notion-header-anchor"></div><a class="notion-hash-link" href="#151c0110d33180388fe1feb3f5c8721e" title="Policy Models"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">Policy Models</span></span></h3><h4 class="notion-h notion-h3 notion-h-indent-2 notion-block-151c0110d3318044b605dbd983cb9c2c" data-id="151c0110d3318044b605dbd983cb9c2c"><span><div id="151c0110d3318044b605dbd983cb9c2c" class="notion-header-anchor"></div><a class="notion-hash-link" href="#151c0110d3318044b605dbd983cb9c2c" title="Training-based Models"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">Training-based Models</span></span></h4><ul class="notion-list notion-list-disc notion-block-1b3c0110d33180cd9df4f9f01534ff78"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2503.02197" target="_blank" rel="noopener noreferrer">[2503.02197] ATLaS: Agent Tuning via Learning Critical Steps</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-1b3c0110d33180a89afec727a08d0373"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2502.13130" target="_blank" rel="noopener noreferrer">[2502.13130] Magma: A Foundation Model for Multimodal AI Agents</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-19cc0110d3318013802aeeb1be1b5c59"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2502.02955" target="_blank" rel="noopener noreferrer">[2502.02955] ReachAgent: Enhancing Mobile Agent via Page Reaching and Operation</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-186c0110d33180668a31f5f8c514479c"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2501.12326" target="_blank" rel="noopener noreferrer">[2501.12326] UI-TARS: Pioneering Automated GUI Interaction with Native Agents</a></span><span class="notion-blue">, ByteDance</span></li></ul><ul class="notion-list notion-list-disc notion-block-17ac0110d331805db04bfccebc151b3f"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2501.04575" target="_blank" rel="noopener noreferrer">[2501.04575] InfiGUIAgent: A Multimodal Generalist GUI Agent with Native Reasoning and Reflection</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-17ac0110d33180d39bf2c1a935b29898"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2412.17589" target="_blank" rel="noopener noreferrer">[2412.17589] PC Agent: While You Sleep, AI Works -- A Cognitive Journey into Digital World</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-173c0110d33180db8daae2ff6fdcd15d"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2412.16256" target="_blank" rel="noopener noreferrer">[2412.16256] Aria-UI: Visual Grounding for GUI Instructions</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-165c0110d3318092ac6cd6e53a17da8c"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2412.09362" target="_blank" rel="noopener noreferrer">[2412.09362] Falcon-UI: Understanding GUI Before Following User Instructions</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-165c0110d33180279248eae415cd55f5"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2412.04454" target="_blank" rel="noopener noreferrer">[2412.04454] Aguvis: Unified Pure Vision Agents for Autonomous GUI Interaction</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-151c0110d33180da89dedf80baa4df78"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2412.01268" target="_blank" rel="noopener noreferrer">[2412.01268] Ponder &amp; Press: Advancing Visual GUI Agent towards General Computer Control</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-151c0110d33180b9bd67ccd9c4e89acd"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2411.17465" target="_blank" rel="noopener noreferrer">[2411.17465] ShowUI: One Vision-Language-Action Model for GUI Visual Agent</a></span><span class="notion-blue">, </span><span class="notion-blue"><b><a class="notion-link" href="https://github.com/showlab/ShowUI" target="_blank" rel="noopener noreferrer">Github</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-151c0110d3318082b861c6862491f864"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2402.15506" target="_blank" rel="noopener noreferrer">[2402.15506] AgentOhana: Design Unified Data and Training Pipeline for Effective Agent Learning</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-151c0110d33180fca031e7ace5daef2c"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2411.13451" target="_blank" rel="noopener noreferrer">[2411.13451] AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-151c0110d33180a0af62d8a3af5d91c6"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2411.00820" target="_blank" rel="noopener noreferrer">[2411.00820] AutoGLM: Autonomous Foundation Agents for GUIs</a></span><span class="notion-blue">, Zhipu</span></li></ul><ul class="notion-list notion-list-disc notion-block-139c0110d33180f1af9ccf02fcb05160"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2410.19461" target="_blank" rel="noopener noreferrer">[2410.19461] EDGE: Enhanced Grounded GUI Understanding with Enriched Multi-Granularity Synthetic Data</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-139c0110d3318004b8bbc8ece630b335"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2410.22916" target="_blank" rel="noopener noreferrer">[2410.22916] Explainable Behavior Cloning: Teaching Large Language Model Agents through Learning by Demonstration</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-139c0110d33180fe827ffcf0268e1014"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2406.19263" target="_blank" rel="noopener noreferrer">[2406.19263] Read Anywhere Pointed: Layout-aware GUI Screen Reading with Tree-of-Lens Grounding</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-173c0110d33180fbb14bfabea3e06097"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2312.08914" target="_blank" rel="noopener noreferrer">[2312.08914] CogAgent: A Visual Language Model for GUI Agents</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-17ac0110d3318079a5d7da6502c02e0e"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2312.15820" target="_blank" rel="noopener noreferrer">[2312.15820] WebVLN: Vision-and-Language Navigation on Websites</a></span></li></ul><div class="notion-blank notion-block-151c0110d33180e08721c195bd507579"> </div><div class="notion-text notion-block-151c0110d3318070a837f6d24578c9f3"><b>Reinforcement Learning</b></div><ul class="notion-list notion-list-disc notion-block-1b3c0110d331801bb4b9faf011b2c89b"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2502.18906" target="_blank" rel="noopener noreferrer">[2502.18906] VEM: Environment-Free Exploration for Training GUI Agent with Value Environment Model</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-1b3c0110d33180a6bd8ffd1638046b0b"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2502.15760" target="_blank" rel="noopener noreferrer">[2502.15760] Digi-Q: Learning Q-Value Functions for Training Device-Control Agents</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-1b3c0110d3318044ab06ee12e4f06e10"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2502.12130" target="_blank" rel="noopener noreferrer">[2502.12130] Scaling Autonomous Agents via Automatic Reward Modeling And Planning</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-19cc0110d33180fd8b34ee10455c510a"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2502.07949" target="_blank" rel="noopener noreferrer">[2502.07949] VSC-RL: Advancing Autonomous Vision-Language Agents with Variational Subgoal-Conditioned Reinforcement Learning</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-165c0110d33180c9a703d7cde7698371"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2412.10742" target="_blank" rel="noopener noreferrer">[2412.10742] WEPO: Web Element Preference Optimization for LLM-based Web Navigation</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-165c0110d331803dbbf1d7b4c3b156f8"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2412.06313" target="_blank" rel="noopener noreferrer">[2412.06313] Vision-Based Deep Reinforcement Learning of UAV Autonomous Navigation Using Privileged Information</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-151c0110d331804ab071c43fd6bdd99f"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2411.03817" target="_blank" rel="noopener noreferrer">[2411.03817] From Novice to Expert: LLM Agent Policy Optimization via Step-wise Reinforcement Learning</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-151c0110d331807ba1bbc12895ab521f"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2411.02337" target="_blank" rel="noopener noreferrer">[2411.02337] WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning</a></span><span class="notion-blue">, Zhipu</span></li></ul><ul class="notion-list notion-list-disc notion-block-151c0110d3318050b46dd6a5f2210bf0"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2410.24218" target="_blank" rel="noopener noreferrer">[2410.24218] Teaching Embodied Reinforcement Learning Agents: Informativeness and Diversity of Language Use</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-16ac0110d33180dfb807cd6c9139e588"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2406.11896" target="_blank" rel="noopener noreferrer">[2406.11896] DigiRL: Training In-The-Wild Device-Control Agents with Autonomous Reinforcement Learning</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-1b3c0110d33180bf9097de49665d4432"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2406.04151" target="_blank" rel="noopener noreferrer">[2406.04151] AgentGym: Evolving Large Language Model-based Agents across Diverse Environments</a></span></li></ul><div class="notion-blank notion-block-151c0110d331800b93e4e96ce74e654f"> </div><h4 class="notion-h notion-h3 notion-h-indent-2 notion-block-151c0110d33180988f5bcd9a57f7e13f" data-id="151c0110d33180988f5bcd9a57f7e13f"><span><div id="151c0110d33180988f5bcd9a57f7e13f" class="notion-header-anchor"></div><a class="notion-hash-link" href="#151c0110d33180988f5bcd9a57f7e13f" title="Training-free Models"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">Training-free Models</span></span></h4><div class="notion-text notion-block-1b3c0110d331803d96c5f453ac30706d"><b>Multi-Agents Framework</b></div><ul class="notion-list notion-list-disc notion-block-1bec0110d33180fcb01bdae10ea23d62"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2503.09572" target="_blank" rel="noopener noreferrer">[2503.09572] Plan-and-Act: Improving Planning of Agents for Long-Horizon Tasks</a></span><span class="notion-blue"> </span><code class="notion-inline-code">long-horizon</code></li></ul><ul class="notion-list notion-list-disc notion-block-1b3c0110d33180ecb745e65943a86244"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2503.03459" target="_blank" rel="noopener noreferrer">[2503.03459] Unified Mind Model: Reimagining Autonomous Agents in the LLM Era</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-1b3c0110d331801b82c6ffd32af45fa9"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2502.16796" target="_blank" rel="noopener noreferrer">[2502.16796] MobileSteward: Integrating Multiple App-Oriented Agents with Self-Evolution to Automate Cross-App Instructions</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-1b3c0110d33180d584b4ccebfee3feaf"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2502.14282" target="_blank" rel="noopener noreferrer">[2502.14282] PC-Agent: A Hierarchical Multi-Agent Collaboration Framework for Complex Task Automation on PC</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-186c0110d33180008803d32d1e015e4d"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2501.11733" target="_blank" rel="noopener noreferrer">[2501.11733] Mobile-Agent-E: Self-Evolving Mobile Assistant for Complex Tasks</a></span></li></ul><div class="notion-blank notion-block-1b3c0110d33180598be5fb4cec047110"> </div><div class="notion-text notion-block-1b3c0110d33180a2a3a1db38927b17e8"><b>Single-Agent Framework</b></div><ul class="notion-list notion-list-disc notion-block-1bec0110d33180b49363fc9f21c77f94"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2503.15937" target="_blank" rel="noopener noreferrer">[2503.15937] Advancing Mobile GUI Agents: A Verifier-Driven Approach to Practical Deployment</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-1bec0110d33180fb84f1f58363378ffc"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2503.03196" target="_blank" rel="noopener noreferrer">[2503.03196] SpiritSight Agent: Advanced GUI Agent with One Look</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-1bec0110d33180d6b2cecccfad91652a"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2503.03743" target="_blank" rel="noopener noreferrer">[2503.03743] CHOP: Mobile Operating Assistant with Constrained High-frequency Optimized Subtask Planning</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-1bec0110d33180b29cd4f2193acbb368"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2503.13843" target="_blank" rel="noopener noreferrer">[2503.13843] WebNav: An Intelligent Agent for Voice-Controlled Web Navigation</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-1bec0110d33180a5b2a6dce5570a6abb"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2503.10689" target="_blank" rel="noopener noreferrer">[2503.10689] Learning to Contextualize Web Pages for Enhanced Decision Making by LLM Agents</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-1bec0110d33180b989e7ec9dce68a066"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2503.06580" target="_blank" rel="noopener noreferrer">[2503.06580] Agent models: Internalizing Chain-of-Action Generation into Reasoning models</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-1b3c0110d33180ac88effd69830b73c9"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2503.02950" target="_blank" rel="noopener noreferrer">[2503.02950] LiteWebAgent: The Open-Source Suite for VLM-Based Web-Agent Applications</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-1b3c0110d33180c3af4ae6a6c9501a85"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2503.02268" target="_blank" rel="noopener noreferrer">[2503.02268] AppAgentX: Evolving GUI Agents as Proficient Smartphone Users</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-1b3c0110d331807ba4b5ec5ff2128826"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2502.09215" target="_blank" rel="noopener noreferrer">[2502.09215] Architecture for Simulating Behavior Mode Changes in Norm-Aware Autonomous Agents</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-1b3c0110d331807bb3d2e440ea7e49dc"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2502.08226" target="_blank" rel="noopener noreferrer">[2502.08226] TRISHUL: Towards Region Identification and Screen Hierarchy Understanding for Large VLM based GUI Agents</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-19cc0110d33180619f7bca599b9c0f81"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2502.07056" target="_blank" rel="noopener noreferrer">[2502.07056] Autonomous Deep Agent</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-186c0110d331805ca0dde86740e338f2"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2501.12485" target="_blank" rel="noopener noreferrer">[2501.12485] R2D2: Remembering, Reflecting and Dynamic Decision Making for Web Agents</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-173c0110d33180559ff3f4ab11762386"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2412.18116" target="_blank" rel="noopener noreferrer">[2412.18116] AutoDroid-V2: Boosting SLM-based GUI Agents via Code Generation</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-165c0110d331802ea050d28dbe2e29e6"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2412.10840" target="_blank" rel="noopener noreferrer">[2412.10840] Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-165c0110d33180c29c25eae29c67dc0b"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2412.07472" target="_blank" rel="noopener noreferrer">[2412.07472] SmartAgent: Chain-of-User-Thought for Embodied Personalized Agent in Cyber World</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-151c0110d33180d1a2ecf3792ccb1cb2"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2411.15004" target="_blank" rel="noopener noreferrer">[2411.15004] ScribeAgent: Towards Specialized Web Agents Using Production-Scale Workflow Data</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-151c0110d33180929d8ff3da061e51b7"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2411.06559" target="_blank" rel="noopener noreferrer">[2411.06559] Is Your LLM Secretly a World Model of the Internet? Model-Based Planning for Web Agents</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-151c0110d33180c88ce4f5aa6e554add"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2408.06458" target="_blank" rel="noopener noreferrer">[2408.06458] Towards Autonomous Agents: Adaptive-planning, Reasoning, and Acting in Language Models</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-151c0110d331809b9c58d27184f64e8f"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2411.13591" target="_blank" rel="noopener noreferrer">[2411.13591] Improved GUI Grounding via Iterative Narrowing</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-139c0110d3318003a58ef61ddd0e0f74"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2410.19609" target="_blank" rel="noopener noreferrer">[2410.19609] OpenWebVoyager: Building Multimodal Web Agents via Iterative Real-World Exploration, Feedback and Optimization</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-165c0110d3318021a713d943fc11c19e"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2408.00203" target="_blank" rel="noopener noreferrer">[2408.00203] OmniParser for Pure Vision Based GUI Agent</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-165c0110d3318083bb26c0cae6832e80"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2407.03913" target="_blank" rel="noopener noreferrer">[2407.03913] MobileExperts: A Dynamic Tool-Enabled Agent Team in Mobile Devices</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-173c0110d331808cbddbd39ab84f1eb0"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2406.06947" target="_blank" rel="noopener noreferrer">[2406.06947] CAAP: Context-Aware Action Planning Prompting to Solve Computer Tasks with Front-End UI Only</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-165c0110d33180c8b3f0e8948c08d3e5"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2405.15341" target="_blank" rel="noopener noreferrer">[2405.15341] V-Zen: Efficient GUI Understanding and Precise Grounding With A Novel Multimodal LLM</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-139c0110d3318024acf3c5de4ff514a1"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2312.11190" target="_blank" rel="noopener noreferrer">[2312.11190] VisionTasker: Mobile Task Automation Using Vision Based UI Understanding and LLM Task Planning</a></span></li></ul><div class="notion-blank notion-block-151c0110d33180b2a413cc6fdce81d08"> </div><h3 class="notion-h notion-h2 notion-h-indent-1 notion-block-151c0110d33180bf818bd4f09dbb6a1d" data-id="151c0110d33180bf818bd4f09dbb6a1d"><span><div id="151c0110d33180bf818bd4f09dbb6a1d" class="notion-header-anchor"></div><a class="notion-hash-link" href="#151c0110d33180bf818bd4f09dbb6a1d" title="Enhanced Knowledges"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">Enhanced Knowledges</span></span></h3><ul class="notion-list notion-list-disc notion-block-19cc0110d33180c5bac8c101c65701b1"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2501.11425" target="_blank" rel="noopener noreferrer">[2501.11425] Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-151c0110d33180298c0de158ca47b765"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2410.13232" target="_blank" rel="noopener noreferrer">[2410.13232][WMA] Web Agents with World Models: Learning and Leveraging Environment Dynamics in Web Navigation</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-139c0110d331804ea8aaeb23fcc00dce"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2410.23555" target="_blank" rel="noopener noreferrer">[2410.23555] From Context to Action: Analysis of the Impact of State Representation and Context on the Generalization of Multi-Turn Web Navigation Agents</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-139c0110d33180c890afe5a7db33c57c"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2410.22552" target="_blank" rel="noopener noreferrer">[2410.22552] Auto-Intent: Automated Intent Discovery and Self-Exploration for Large Language Model Web Agents</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-186c0110d33180ee86e9c394a1282ac0"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2406.14596" target="_blank" rel="noopener noreferrer">[2406.14596] VLM Agents Generate Their Own Memories: Distilling Experience into Embodied Programs of Thought</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-139c0110d331804abbbcc0d9db266ddf"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2405.16247" target="_blank" rel="noopener noreferrer">[2405.16247] AutoManual: Generating Instruction Manuals by LLM Agents via Interactive Environmental Learning</a></span></li></ul><div class="notion-blank notion-block-165c0110d331806b8453f7d0783d1e57"> </div><h3 class="notion-h notion-h2 notion-h-indent-1 notion-block-151c0110d33180cc8dbcdc2eb0427a7b" data-id="151c0110d33180cc8dbcdc2eb0427a7b"><span><div id="151c0110d33180cc8dbcdc2eb0427a7b" class="notion-header-anchor"></div><a class="notion-hash-link" href="#151c0110d33180cc8dbcdc2eb0427a7b" title="Data Synthesis"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">Data Synthesis</span></span></h3><ul class="notion-list notion-list-disc notion-block-1b3c0110d331804da1fec09758e5af8a"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2502.11357" target="_blank" rel="noopener noreferrer">[2502.11357] Explorer: Scaling Exploration-driven Web Trajectory Synthesis for Multimodal Web Agents</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-19cc0110d33180c1a7d3ce1e2467a892"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2502.07942" target="_blank" rel="noopener noreferrer">[2502.07942] Symbiotic Cooperation for Web Agents: Harnessing Complementary Strengths of Large and Small LLMs</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-19cc0110d331800695dcd323ca4a8b36"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2502.02982" target="_blank" rel="noopener noreferrer">[2502.02982] FedMobileAgent: Training Mobile Agents Using Decentralized Self-Sourced Data from Diverse Users</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-186c0110d3318060a35ffde3a6ae0cc5"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2501.13896" target="_blank" rel="noopener noreferrer">[2501.13896] GUI-Bee: Align GUI Action Grounding to Novel Environments via Autonomous Exploration</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-186c0110d33180fe8cafc58e66c8cc7f"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2501.10893" target="_blank" rel="noopener noreferrer">[2501.10893] Learn-by-interact: A Data-Centric Framework for Self-Adaptive Agents in Realistic Environments</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-173c0110d33180169c72cf7152dc6bee"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2412.19723" target="_blank" rel="noopener noreferrer">[2412.19723] OS-Genesis: Automating GUI Agent Trajectory Construction via Reverse Task Synthesis</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-173c0110d3318095a9f1f9a5f44caa7e"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2412.13194" target="_blank" rel="noopener noreferrer">[2412.13194] Proposer-Agent-Evaluator(PAE): Autonomous Skill Discovery For Foundation Model Internet Agents</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-165c0110d331805995bcce529ad63db6"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2412.10342" target="_blank" rel="noopener noreferrer">[2412.10342] Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-165c0110d3318073bd95c3fb16d1ca17"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2412.09605" target="_blank" rel="noopener noreferrer">[2412.09605] AgentTrek: Agent Trajectory Synthesis via Guiding Replay with Web Tutorials</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-19cc0110d3318067a09df7aaebca3c71"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2410.02907" target="_blank" rel="noopener noreferrer">[2410.02907] NNetNav: Unsupervised Learning of Browser Agents Through Environment Interaction in the Wild</a></span></li></ul><div class="notion-blank notion-block-165c0110d33180339ed6c900ed9dacdf"> </div><h3 class="notion-h notion-h2 notion-h-indent-1 notion-block-139c0110d331804687a9e6aa54725c37" data-id="139c0110d331804687a9e6aa54725c37"><span><div id="139c0110d331804687a9e6aa54725c37" class="notion-header-anchor"></div><a class="notion-hash-link" href="#139c0110d331804687a9e6aa54725c37" title="Datasets / Benchmarks"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">Datasets / Benchmarks</span></span></h3><ul class="notion-list notion-list-disc notion-block-1bec0110d33180779338d23bef4d5ff2"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2503.09780" target="_blank" rel="noopener noreferrer">[2503.09780] AgentDAM: Privacy Leakage Evaluation for Autonomous Web Agents</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-1bec0110d33180f7ab10dde15c63c27f"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2503.04957" target="_blank" rel="noopener noreferrer">[2503.04957] SafeArena: Evaluating the Safety of Autonomous Web Agents</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-1b3c0110d331804c8ac6fe864c37fe6f"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2503.03056" target="_blank" rel="noopener noreferrer">[2503.03056] A2Perf: Real-World Autonomous Agents Benchmark</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-1b3c0110d33180d1a6daee0fb9b44c97"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2503.02403" target="_blank" rel="noopener noreferrer">[2503.02403] AutoEval: A Practical Framework for Autonomous Evaluation of Mobile Agents</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-1b3c0110d3318000be9ef4584223f8a4"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2502.18356" target="_blank" rel="noopener noreferrer">[2502.18356] WebGames: Challenging General-Purpose Web-Browsing AI Agents</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-1b3c0110d3318023ab7ff6a3089d10c8"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2502.15840" target="_blank" rel="noopener noreferrer">[2502.15840] Vending-Bench: A Benchmark for Long-Term Coherence of Autonomous Agents</a></span><span class="notion-blue"> </span><code class="notion-inline-code">long-horizon</code></li></ul><ul class="notion-list notion-list-disc notion-block-1b3c0110d33180409361e8695afb9c97"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2501.02863" target="_blank" rel="noopener noreferrer">[2501.02863] Beyond Pass or Fail: Multi-Dimensional Benchmarking of Foundation Models for Goal-based Mobile UI Navigation</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-1b3c0110d33180378631e3a6cb5f254e"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2403.11905" target="_blank" rel="noopener noreferrer">[2403.11905] Tur[k]ingBench: A Challenge Benchmark for Web Agents</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-1b3c0110d33180b785cdcf50e8288866"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2410.19100" target="_blank" rel="noopener noreferrer">[2410.19100] VideoWebArena: Evaluating Long Context Multimodal Agents with Video Understanding Web Tasks</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-1b3c0110d331800b94cbe875b828427e"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2502.13053" target="_blank" rel="noopener noreferrer">[2502.13053] AEIA-MN: Evaluating the Robustness of Multimodal LLM-Powered Mobile Agents Against Active Environmental Injection Attacks</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-19cc0110d3318090b84dfd2a42d28319"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2502.08047" target="_blank" rel="noopener noreferrer">[2502.08047] WorldGUI: Dynamic Testing for Comprehensive Desktop GUI Automation</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-19cc0110d331808d9d60cc106010b8c6"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2501.16609" target="_blank" rel="noopener noreferrer">[2501.16609] CowPilot: A Framework for Autonomous and Human-Agent Collaborative Web Navigation</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-19cc0110d33180c5bdccf2e65870ce3a"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2410.23252" target="_blank" rel="noopener noreferrer">[2410.23252] Evaluating Cultural and Social Awareness of LLM Web Agents</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-173c0110d33180f287f7ea3667ed59a0"><li><span class="notion-blue"><a class="notion-link" href="https://huggingface.co/blog/Ziyang/screenspot-pro" target="_blank" rel="noopener noreferrer">ScreenSpot-Pro: GUI Grounding for Professional High-Resolution Computer Use</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-173c0110d331801f97b3c3944ce0f0f3"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2501.01149" target="_blank" rel="noopener noreferrer">[2501.01149] A3: Android Agent Arena for Mobile GUI Agents</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-173c0110d33180829a49d00779926c2e"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2412.18426" target="_blank" rel="noopener noreferrer">[2412.18426] GUI Testing Arena: A Unified Benchmark for Advancing Autonomous GUI Testing Agent</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-165c0110d33180ac816df2fdb3636fef"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2410.17520" target="_blank" rel="noopener noreferrer">[2410.17520] MobileSafetyBench: Evaluating Safety of Autonomous Agents in Mobile Device Control</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-165c0110d331805983d0f9303e63affd"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2412.04531" target="_blank" rel="noopener noreferrer">[2412.04531] MageBench: Bridging Large Multimodal Models to Agents</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-165c0110d3318061b749d6c261ec5f68"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2412.05789" target="_blank" rel="noopener noreferrer">[2412.05789] InfiniteWorld: A Unified Scalable Simulation Framework for General Visual-Language Robot Interaction</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-165c0110d3318077b986d053fa4898fd"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2410.06703" target="_blank" rel="noopener noreferrer">[2410.06703] ST-WebAgentBench: A Benchmark for Evaluating Safety and Trustworthiness in Web Agents</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-139c0110d331800f82b8e48de39273ea"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2410.24024" target="_blank" rel="noopener noreferrer">[2410.24024] AndroidLab: Training and Systematic Benchmarking of Android Autonomous Agents</a></span><span class="notion-blue">, Zhipu</span></li></ul><ul class="notion-list notion-list-disc notion-block-139c0110d33180b79009c1f75b7ccbfd"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2410.15164" target="_blank" rel="noopener noreferrer">[2410.15164] SPA-Bench: A Comprehensive Benchmark for SmartPhone Agent Evaluation</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-139c0110d331806e8d3cf5b04ed88be7"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2410.17520" target="_blank" rel="noopener noreferrer">[2410.17520] MobileSafetyBench: Evaluating Safety of Autonomous Agents in Mobile Device Control</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-151c0110d33180d69805deb405e0029b"><li><span class="notion-blue">[</span><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2406.03679" target="_blank" rel="noopener noreferrer">2406.03679][AndroidControl] On the Effects of Data Scale on UI Control Agents</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-165c0110d331806b84d4ed3d6048eca7"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2406.14250" target="_blank" rel="noopener noreferrer">[2406.14250] E-ANT: A Large-Scale Dataset for Efficient Automatic GUI NavigaTion</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-165c0110d33180f884bbe7e3190dd4a2"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2405.14573" target="_blank" rel="noopener noreferrer">[2405.14573] AndroidWorld: A Dynamic Benchmarking Environment for Autonomous Agents</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-19cc0110d33180ec8c5ddbb4b7373ad5"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2209.08199" target="_blank" rel="noopener noreferrer">[2209.08199] ScreenQA: Large-Scale Question-Answer Pairs over Mobile App Screenshots</a></span></li></ul><div class="notion-blank notion-block-165c0110d3318014aecef6764b152737"> </div><h3 class="notion-h notion-h2 notion-h-indent-1 notion-block-151c0110d3318074bc5bdac6be5ace96" data-id="151c0110d3318074bc5bdac6be5ace96"><span><div id="151c0110d3318074bc5bdac6be5ace96" class="notion-header-anchor"></div><a class="notion-hash-link" href="#151c0110d3318074bc5bdac6be5ace96" title="Tools / Environments"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">Tools / Environments</span></span></h3><ul class="notion-list notion-list-disc notion-block-19cc0110d3318034859fe71b930abfb1"><li><span class="notion-blue"><a class="notion-link" href="https://github.com/browser-use/browser-use" target="_blank" rel="noopener noreferrer">browser-use/browser-use: Make websites accessible for AI agents</a></span></li><ul class="notion-list notion-list-disc notion-block-19cc0110d3318034859fe71b930abfb1"><li><span class="notion-blue"><a class="notion-link" href="https://github.com/browser-use/web-ui" target="_blank" rel="noopener noreferrer">browser-use/web-ui: Run AI Agent in your browser.</a></span></li><li><span class="notion-blue"><a class="notion-link" href="https://github.com/browser-use/macOS-use" target="_blank" rel="noopener noreferrer">browser-use/macOS-use: Make Mac apps accessible for AI agents</a></span></li></ul></ul><ul class="notion-list notion-list-disc notion-block-19fc0110d331808ca115d6365204a0fd"><li><span class="notion-blue"><a class="notion-link" href="https://github.com/maitrix-org/llm-reasoners" target="_blank" rel="noopener noreferrer">maitrix-org/llm-reasoners: A library for advanced large language model reasoning</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-19cc0110d33180fda19ac048bc556310"><li><span class="notion-blue"><a class="notion-link" href="https://github.com/web-infra-dev/Midscene" target="_blank" rel="noopener noreferrer">web-infra-dev/midscene: Let AI be your browser operator.</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-19cc0110d3318089b605f8ffe2603e4c"><li><span class="notion-blue"><a class="notion-link" href="https://github.com/microsoft/OmniParser/tree/master/omnitool" target="_blank" rel="noopener noreferrer">OmniParser/omnitool at master · microsoft/OmniParser</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-19cc0110d331805b9a5ffbccc6fbcf14"><li><span class="notion-blue"><a class="notion-link" href="https://github.com/bytedance/UI-TARS-desktop" target="_blank" rel="noopener noreferrer">bytedance/UI-TARS-desktop: A GUI Agent application based on UI-TARS(Vision-Lanuage Model) that allows you to control your computer using natural language.</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-19cc0110d3318070aa07c3c6c21c5932"><li><span class="notion-blue"><a class="notion-link" href="https://github.com/hrithikkoduri/WebRover" target="_blank" rel="noopener noreferrer">hrithikkoduri/WebRover: WebRover is an autonomous AI agent designed to interpret user input and execute actions by interacting with web elements to accomplish tasks or answer questions. It leverages advanced language models and web automation tools to navigate the web, gather information, and provide structured responses based on the user&#x27;s needs.</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-165c0110d33180b3b503c1793c897fe5"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2412.05467" target="_blank" rel="noopener noreferrer">[2412.05467] The BrowserGym Ecosystem for Web Agent Research</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-165c0110d33180ccb29bdfb1610e6d21"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2403.17918" target="_blank" rel="noopener noreferrer">[2403.17918] AgentStudio: A Toolkit for Building General Virtual Agents</a></span></li></ul><div class="notion-blank notion-block-1b3c0110d33180e8bb8af0b575e71ae3"> </div><h3 class="notion-h notion-h2 notion-h-indent-1 notion-block-165c0110d33180c385d3cd8b1f7c8a8d" data-id="165c0110d33180c385d3cd8b1f7c8a8d"><span><div id="165c0110d33180c385d3cd8b1f7c8a8d" class="notion-header-anchor"></div><a class="notion-hash-link" href="#165c0110d33180c385d3cd8b1f7c8a8d" title="Others"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">Others</span></span></h3><ul class="notion-list notion-list-disc notion-block-1bec0110d33180519b84e7184e3b75cf"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2503.09385" target="_blank" rel="noopener noreferrer">[2503.09385] PCLA: A Framework for Testing Autonomous Agents in the CARLA Simulator</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-1bec0110d33180188248e4f3749372d7"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2503.08464" target="_blank" rel="noopener noreferrer">[2503.08464] An Autonomous RL Agent Methodology for Dynamic Web UI Testing in a BDD Framework</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-1b3c0110d33180f2995fee0e89e0c943"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2502.20383" target="_blank" rel="noopener noreferrer">[2502.20383] Why Are Web AI Agents More Vulnerable Than Standalone LLMs? A Security Analysis</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-1b3c0110d33180779cf0f8b6db66978f"><li><span class="notion-blue"><a class="notion-link" href="https://arxiv.org/abs/2502.17903" target="_blank" rel="noopener noreferrer">[2502.17903] Towards Sustainable Web Agents: A Plea for Transparency and Dedicated Metrics for Energy Consumption</a></span></li></ul><div class="notion-blank notion-block-1b3c0110d33180909d86eaac6204fcd1"> </div><div class="notion-blank notion-block-1b3c0110d33180c9ae72c293f205f4f8"> </div><div class="notion-text notion-block-151c0110d33180ec9d8ae3002b03ddff">&lt;ins/&gt;</div><h2 class="notion-h notion-h1 notion-h-indent-0 notion-block-139c0110d331805895a9d1467418e470" data-id="139c0110d331805895a9d1467418e470"><span><div id="139c0110d331805895a9d1467418e470" class="notion-header-anchor"></div><a class="notion-hash-link" href="#139c0110d331805895a9d1467418e470" title="UI Agents 其他汇总信息"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">UI Agents 其他汇总信息</span></span></h2><ul class="notion-list notion-list-disc notion-block-160c0110d33180359efcf92af521f6ca"><li><span class="notion-blue"><a class="notion-link" href="https://github.com/OSU-NLP-Group/GUI-Agents-Paper-List" target="_blank" rel="noopener noreferrer">https://github.com/OSU-NLP-Group/GUI-Agents-Paper-List</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-14fc0110d33180b49b83e9eb9d99cdd6"><li><span class="notion-blue"><a class="notion-link" href="https://github.com/showlab/Awesome-GUI-Agent" target="_blank" rel="noopener noreferrer">https://github.com/showlab/Awesome-GUI-Agent</a></span></li></ul><ul class="notion-list notion-list-disc notion-block-151c0110d3318005ad82cc1e275e63c2"><li><span class="notion-blue"><a class="notion-link" href="https://github.com/opendilab/awesome-ui-agents/" target="_blank" rel="noopener noreferrer">https://github.com/opendilab/awesome-ui-agents</a></span></li></ul><div class="notion-blank notion-block-14fc0110d33180e78917dbc5bbdfda97"> </div><div class="notion-text notion-block-139c0110d331801e9d6dfaad5d6b108f">&lt;ins/&gt;</div><div class="notion-blank notion-block-139c0110d33180489620fbeec7ea9008"> </div></main></div>]]></content:encoded>
        </item>
        <item>
            <title><![CDATA[AI Agent 性能优化：核心策略与实战技巧]]></title>
            <link>https://www.breezedeus.com/article/ai-agent-perf-tips</link>
            <guid>https://www.breezedeus.com/article/ai-agent-perf-tips</guid>
            <pubDate>Mon, 13 Oct 2025 00:00:00 GMT</pubDate>
            <description><![CDATA[本文深度拆解 AI Agent 性能优化的五大核心维度，提供超多可落地的实战技巧，助力打造更智能、鲁棒且高效的 AI Agent！]]></description>
            <content:encoded><![CDATA[<div id="notion-article" class="mx-auto overflow-hidden "><main class="notion light-mode notion-page notion-block-28bc0110d33180a79030fa219c1248a6"><div class="notion-viewport"></div><div class="notion-collection-page-properties"></div><div class="notion-row notion-block-28bc0110d3318136bd56c45895a8ee1d"><div class="notion-column notion-block-28bc0110d33181c3b96acac8c2dcc8b8" style="width:calc((100% - (1 * min(32px, 4vw))) * 0.5)"><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-28bc0110d33180f69cccde51c49363a8"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3Adf07f5f5-920b-47a0-a822-2bb8a9b39d47%3Aimage.png?table=block&amp;id=28bc0110-d331-80f6-9ccc-de51c49363a8&amp;t=28bc0110-d331-80f6-9ccc-de51c49363a8" alt="notion image" loading="lazy" decoding="async"/></div></figure><div class="notion-blank notion-block-28bc0110d33181f5a560fbdf33d006cf"> </div></div><div class="notion-spacer"></div><div class="notion-column notion-block-28bc0110d33181cf933bd507e9cf724e" style="width:calc((100% - (1 * min(32px, 4vw))) * 0.5)"><div class="notion-text notion-block-28bc0110d33181cc99cfdc15c5ea92aa"><b>目录：</b></div><div class="notion-table-of-contents notion-gray notion-block-28bc0110d331819eb92decf0ce97f903"><a href="#28bc0110d33180d39e52c5b8775ff7ea" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:0">1. Prompt 工程：塑造智能体的“思维模式”</span></a><a href="#28bc0110d331803682a6c7ed8ee5ba07" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:24px">1.1 系统 Prompt 优化</span></a><a href="#28bc0110d33180e6bfe0c6763f157cd1" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:24px">1.2 LLM 搜索优于 RAG 搜索</span></a><a href="#28bc0110d331804e9008c29fb7dfa0a3" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:24px">1.3 可控性与行为引导</span></a><a href="#28bc0110d33180e6a1f7f56f0cc46847" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:0">2 上下文工程：精细化管理智能体的“记忆”</span></a><a href="#28bc0110d331806a8371c001b174ef5d" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:24px">2.1 KV-cache 命中率优化</span></a><a href="#28bc0110d331806798bfe8531800ae12" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:24px">2.2 上下文长度管理与外部化记忆</span></a><a href="#28bc0110d33180f6bb9de51d35fbca67" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:24px">2.3 注意力机制操纵</span></a><a href="#28cc0110d33180aebf93cbf5f56d5d41" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:24px">2.4 上下文检索与 Agentic 搜索</span></a><a href="#28dc0110d33180e4916ed2210b55aba2" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:24px">2.5 长周期任务的上下文工程</span></a><a href="#28bc0110d3318001bbf3ca1228802f1c" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:0">3. 工具设计与管理：为智能体打造高效“武器库”</span></a><a href="#28bc0110d33180b5aa81c21716cf3861" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:24px">3.1 工具设计原则</span></a><a href="#28bc0110d3318075b294e98047eb0fc8" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:24px">3.2 动态工具选择与约束</span></a><a href="#28bc0110d33180c2bbe6dc544813d9d0" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:24px">3.3 工具分层</span></a><a href="#290c0110d3318065be3ac2052079e8e8" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:24px">3.4 Agent Skills：构建可组合、可扩展的专业能力</span></a><a href="#28bc0110d33180fead34faf2aede1a43" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:0">4. 控制循环与架构：构建稳定高效的智能体骨架</span></a><a href="#28bc0110d33180af8d7bc234c879ad3e" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:24px">4.1 保持一个主循环</span></a><a href="#28bc0110d33180489991caa7359db918" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:24px">4.2 使用小型模型</span></a><a href="#28bc0110d33180959bfcc73fbbb42785" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:0">5. 评估与适应：持续改进智能体性能</span></a><a href="#28bc0110d3318041b7a5ed6ed0a927d9" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:24px">5.1 原型构建与综合评估</span></a><a href="#28bc0110d331807fb2ebf394de6e06ea" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:24px">5.2 错误恢复与适应</span></a><a href="#28bc0110d3318098bf7fcc88775d7fbc" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:24px">5.3 多样性与泛化</span></a><a href="#28bc0110d33180e08941ecc23b1c6106" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:0">结论</span></a><a href="#28bc0110d3318077912cd1d5f6ed7261" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:0">参考文献</span></a></div><div class="notion-blank notion-block-28bc0110d3318175912fc554c720ce18"> </div></div><div class="notion-spacer"></div></div><div class="notion-text notion-block-28bc0110d331803ba17ae280833f38d4">随着人工智能技术的飞速发展，AI Agent 在处理复杂任务方面的能力日益增强。然而，要充分发挥其潜力，优化是不可或缺的一环。本文将综合分析多篇前沿文章，提炼出 AI Agent 中行之有效的优化手段，涵盖Prompt 工程、上下文工程、工具设计、控制循环与架构以及评估与适应等方面，旨在为构建更高效、更稳定的智能体提供指导。</div><h3 class="notion-h notion-h2 notion-h-indent-0 notion-block-28bc0110d33180d39e52c5b8775ff7ea" data-id="28bc0110d33180d39e52c5b8775ff7ea"><span><div id="28bc0110d33180d39e52c5b8775ff7ea" class="notion-header-anchor"></div><a class="notion-hash-link" href="#28bc0110d33180d39e52c5b8775ff7ea" title="1. Prompt 工程：塑造智能体的“思维模式”"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>1. Prompt 工程：塑造智能体的“思维模式”</b></span></span></h3><div class="notion-text notion-block-28bc0110d331807d97edd3823767264f">Prompt 工程是引导 LLM 行为的关键技术，尤其是在构建复杂 Agent 时。</div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-28bc0110d331803682a6c7ed8ee5ba07" data-id="28bc0110d331803682a6c7ed8ee5ba07"><span><div id="28bc0110d331803682a6c7ed8ee5ba07" class="notion-header-anchor"></div><a class="notion-hash-link" href="#28bc0110d331803682a6c7ed8ee5ba07" title="1.1 系统 Prompt 优化"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>1.1 系统 Prompt 优化</b></span></span></h4><ul class="notion-list notion-list-disc notion-block-28bc0110d33180c0a1e2e4bbfa109186"><li><b>清晰简洁的语言</b>：系统 Prompt 应该非常清晰，使用简单、直接的语言，以“恰当的高度”呈现思想，既要足够具体以有效指导行为，又要足够灵活以提供强大的启发式方法 [4]。</li><ul class="notion-list notion-list-disc notion-block-28bc0110d33180c0a1e2e4bbfa109186"><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-28bc0110d331802f9100c55e127e2d41"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3Aa9095168-f2fc-4a42-a8e1-67b17d9e4cf5%3Aimage.png?table=block&amp;id=28bc0110-d331-802f-9100-c55e127e2d41&amp;t=28bc0110-d331-802f-9100-c55e127e2d41" alt="在光谱的一端，我们看到脆弱的 if-else 硬编码提示，在另一端，我们看到过于笼统或错误地假设共享上下文的提示。" loading="lazy" decoding="async"/><figcaption class="notion-asset-caption"><em>在光谱的一端，我们看到脆弱的 if-else 硬编码提示，在另一端，我们看到过于笼统或错误地假设共享上下文的提示。</em></figcaption></div></figure></ul></ul><ul class="notion-list notion-list-disc notion-block-28bc0110d33180b79a5ce2aa7589787c"><li><b>结构化 Prompt</b>：建议将 Prompt 组织成不同的部分（如 <code class="notion-inline-code">&lt;background_information&gt;</code>、<code class="notion-inline-code">&lt;instructions&gt;</code>、<code class="notion-inline-code">## Tool guidance</code>、<code class="notion-inline-code">## Output description</code> 等），并使用 XML 标签或 Markdown 标题来划分这些部分 [4]。</li><ul class="notion-list notion-list-disc notion-block-28bc0110d33180b79a5ce2aa7589787c"><li><b>尽量用最少的话术列出对模型的所有预期</b>：最佳做法是先用可用的最佳模型测试初版包含所有预期的最少话术的 prompt，以查看其在任务上的表现，然后根据初始测试中发现的失效模式添加清晰的指令和示例来改进性能。</li></ul></ul><ul class="notion-list notion-list-disc notion-block-28bc0110d3318081a07dc5f3132341bf"><li><b>详细的启发式规则和示例</b>：Prompt 中应包含详细的启发式规则、示例和重要提醒，例如使用 <code class="notion-inline-code">&lt;good-example&gt;</code> 和 <code class="notion-inline-code">&lt;bad-example&gt;</code> 来明确区分可取和不可取的行为路径 [3]。</li><ul class="notion-list notion-list-disc notion-block-28bc0110d3318081a07dc5f3132341bf"><li>团队通常会往提示中塞满各种边缘情况，试图阐明 LLM 在特定任务中应遵循的每一种可能规则。不推荐这样做。相反，<b>建议提供一组多样化、规范化的示例，这些示例能够有效地展现代理的预期行为。</b>对于 LLM 来说，示例就是胜“千言万语”的“图片”（the “pictures” worth a thousand words）。</li></ul></ul><ul class="notion-list notion-list-disc notion-block-28bc0110d33180558501d4f34b860288"><li><b>用户上下文和偏好管理</b>：可以使用 <code class="notion-inline-code">claude.md</code> 或类似文件来传递无法从代码库推断的上下文和严格偏好，例如强制 LLM 跳过某些文件夹或使用特定库 [3]。</li></ul><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-28bc0110d33180e6bfe0c6763f157cd1" data-id="28bc0110d33180e6bfe0c6763f157cd1"><span><div id="28bc0110d33180e6bfe0c6763f157cd1" class="notion-header-anchor"></div><a class="notion-hash-link" href="#28bc0110d33180e6bfe0c6763f157cd1" title="1.2 LLM 搜索优于 RAG 搜索"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>1.2 LLM 搜索优于 RAG 搜索</b></span></span></h4><div class="notion-text notion-block-28bc0110d3318079ab22f1f4b70c39de">在某些场景下，直接利用 LLM 的代码理解能力进行搜索可能优于传统的 RAG（Retrieval-Augmented Generation）方法 [3]：</div><ul class="notion-list notion-list-disc notion-block-28bc0110d33180d48243c21ea0cc41f9"><li><b>利用 LLM 理解代码</b>：Claude Code 通过复杂的 <code class="notion-inline-code">ripgrep</code>、<code class="notion-inline-code">jq</code> 和 <code class="notion-inline-code">find</code> 命令搜索代码库，利用 LLM 对代码的深刻理解，使用复杂的正则表达式查找相关代码块，甚至使用小型模型读取整个文件。这种方法避免了 RAG 引入的新的（隐藏的）故障模式 [3]。</li></ul><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-28bc0110d331804e9008c29fb7dfa0a3" data-id="28bc0110d331804e9008c29fb7dfa0a3"><span><div id="28bc0110d331804e9008c29fb7dfa0a3" class="notion-header-anchor"></div><a class="notion-hash-link" href="#28bc0110d331804e9008c29fb7dfa0a3" title="1.3 可控性与行为引导"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>1.3 可控性与行为引导</b></span></span></h4><div class="notion-text notion-block-28bc0110d33180c18f19d2a4e45b04b0">有效引导 AI Agent 的行为，使其符合预期，是 Prompt 工程的重要组成部分 [3]：</div><ul class="notion-list notion-list-disc notion-block-28bc0110d331805d85b6edb993b0e3d2"><li><b>明确的语气和风格控制</b>：在系统 Prompt 中明确定义 Agent 的语气、风格和主动性，并提供具体的指令和示例。这有助于 Agent 在交互中展现出一致且合宜的行为 [3]。</li><ul class="notion-list notion-list-disc notion-block-28bc0110d331805d85b6edb993b0e3d2"><li><b>示例</b>：避免不必要的前言或后语，除非用户明确要求；如果无法提供帮助，不要解释原因或可能导致的后果，以免显得说教；除非用户明确要求，否则避免使用表情符号 [3]。</li></ul></ul><ul class="notion-list notion-list-disc notion-block-28bc0110d331804eb08bf074e7f3e60e"><li><b>强调式指令</b>：使用“IMPORTANT”、“VERY IMPORTANT”、“NEVER”和“ALWAYS”等强调词来引导模型避免特定行为或强制执行关键规则。这在模型尚未完全可控时尤为重要 [3]。</li><ul class="notion-list notion-list-disc notion-block-28bc0110d331804eb08bf074e7f3e60e"><li><b>示例</b>：<code class="notion-inline-code">IMPORTANT: DO NOT ADD ***ANY*** COMMENTS unless asked</code>；<code class="notion-inline-code">VERY IMPORTANT: You MUST avoid using search commands like find and grep. Instead use Grep, Glob, or Task to search.</code> [3]。</li></ul></ul><ul class="notion-list notion-list-disc notion-block-28bc0110d3318065aae6d1c485549f11"><li><b>编写清晰的决策算法</b>：识别 LLM 需要执行的最重要任务，并为其编写清晰的算法。通过角色扮演 LLM 并遍历示例，明确所有决策点，并以流程图的形式进行结构化。这有助于 LLM 遵循指令，避免“一锅粥”式的 Do&#x27;s and Don&#x27;ts 列表，从而减少冲突和提高可维护性 [3]。</li><ul class="notion-list notion-list-disc notion-block-28bc0110d3318065aae6d1c485549f11"><li>Claude Code 的系统 Prompt 中，“Task Management”、“Doing Tasks”和“Tool Usage Policy”等部分清晰地阐述了要遵循的算法，并包含大量启发式规则和各种场景示例 [3]。</li></ul></ul><div class="notion-text notion-block-28bc0110d33180729f97c2366c7845df">&lt;ins/&gt;</div><h3 class="notion-h notion-h2 notion-h-indent-0 notion-block-28bc0110d33180e6a1f7f56f0cc46847" data-id="28bc0110d33180e6a1f7f56f0cc46847"><span><div id="28bc0110d33180e6a1f7f56f0cc46847" class="notion-header-anchor"></div><a class="notion-hash-link" href="#28bc0110d33180e6a1f7f56f0cc46847" title="2 上下文工程：精细化管理智能体的“记忆”"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>2 上下文工程：精细化管理智能体的“记忆”</b></span></span></h3><div class="notion-text notion-block-28bc0110d33180648115c442bc75d7af">上下文是 AI Agent 进行决策和行动的基础，对其进行高效管理是优化的核心。<b>上下文工程</b>超越了传统的 Prompt 工程，它关注在 LLM 推理过程中如何策划和维护最佳的 token 集合，以持续实现预期结果 [4]。</div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-28bc0110d331806a8371c001b174ef5d" data-id="28bc0110d331806a8371c001b174ef5d"><span><div id="28bc0110d331806a8371c001b174ef5d" class="notion-header-anchor"></div><a class="notion-hash-link" href="#28bc0110d331806a8371c001b174ef5d" title="2.1 KV-cache 命中率优化"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>2.1 KV-cache 命中率优化</b></span></span></h4><div class="notion-text notion-block-28bc0110d331806a8b5dc6aa779a6e33">KV-cache（Key-Value Cache）的有效利用对提高 LLM 的运行效率至关重要。优化策略包括：</div><ul class="notion-list notion-list-disc notion-block-28bc0110d33180ff8635e5fed2fa53bd"><li><b>保持 Prompt 前缀稳定</b>：LLM 的自回归特性意味着即使是单个 token 的差异也会使缓存失效。避免在系统 Prompt 开头包含精确到秒的时间戳等易变信息 [1]。</li></ul><ul class="notion-list notion-list-disc notion-block-28bc0110d33180f4b6e3f5228db1e565"><li><b>上下文追加模式</b>：避免修改历史动作或观察结果，确保序列化过程的确定性，以维持缓存的有效性 [1]。</li></ul><ul class="notion-list notion-list-disc notion-block-28bc0110d331800d81a4eed8167456f4"><li><b>明确标记缓存断点</b>：对于不支持自动增量前缀缓存的模型或推理框架，需要手动插入缓存断点，并确保断点包含系统 Prompt 的末尾 [1]。</li></ul><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-28bc0110d33180f4860cc422408eb54d"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3A30bcd67e-2ff6-41e2-a01d-6781dfeca32f%3Aimage.png?table=block&amp;id=28bc0110-d331-80f4-860c-c422408eb54d&amp;t=28bc0110-d331-80f4-860c-c422408eb54d" alt="notion image" loading="lazy" decoding="async"/></div></figure><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-28bc0110d331806798bfe8531800ae12" data-id="28bc0110d331806798bfe8531800ae12"><span><div id="28bc0110d331806798bfe8531800ae12" class="notion-header-anchor"></div><a class="notion-hash-link" href="#28bc0110d331806798bfe8531800ae12" title="2.2 上下文长度管理与外部化记忆"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>2.2 上下文长度管理与外部化记忆</b></span></span></h4><div class="notion-text notion-block-28bc0110d331801a8020ed3591f5dbe6">现代 LLM 拥有巨大的上下文窗口，但过长的上下文仍可能导致性能下降和成本增加。<b>上下文腐烂（Context Rot）</b>现象表明，随着上下文长度的增加，模型回忆信息的能力会降低 [4]。因此，有效的上下文管理至关重要：</div><ul class="notion-list notion-list-disc notion-block-28bc0110d33180eea381de614109b344"><li><b>文件系统作为外部化记忆</b>：将文件系统视为无限大小、持久化的外部记忆，允许模型按需读写文件，将其作为结构化的外部化记忆使用 [1]。</li></ul><ul class="notion-list notion-list-disc notion-block-28bc0110d331806eab9eeb8f5f6e5de5"><li><b>可恢复的压缩策略</b>：在缩短上下文长度时，采用可恢复的压缩策略，例如仅保留网页 URL 而非完整内容，或保留文档路径而非完整文档内容，从而在不永久丢失信息的情况下减少上下文 [1]。</li></ul><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-28bc0110d3318006b5f9c8b29527b646"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3A5cf6fb35-7dcf-4114-bc4c-b5337893c1a5%3Aimage.png?table=block&amp;id=28bc0110-d331-8006-b5f9-c8b29527b646&amp;t=28bc0110-d331-8006-b5f9-c8b29527b646" alt="notion image" loading="lazy" decoding="async"/></div></figure><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-28bc0110d33180f6bb9de51d35fbca67" data-id="28bc0110d33180f6bb9de51d35fbca67"><span><div id="28bc0110d33180f6bb9de51d35fbca67" class="notion-header-anchor"></div><a class="notion-hash-link" href="#28bc0110d33180f6bb9de51d35fbca67" title="2.3 注意力机制操纵"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>2.3 注意力机制操纵</b></span></span></h4><div class="notion-text notion-block-28bc0110d33180eeba18ffd8f1abdf7c">Manus 通过持续重写待办事项列表，把目标复述到上下文末尾。这样能让全局计划处于模型当前关注范围内，避免出现 “中途迷失” 的问题，减少目标不一致的状况。实际上，这是借助自然语言将自身关注点引向任务目标，而无需对架构进行特殊改动。</div><ul class="notion-list notion-list-disc notion-block-28bc0110d331809c9218e69c39c84e62"><li><b>动态重写待办事项列表</b>：通过不断更新和重写待办事项列表（todo list），将全局计划推入模型的近期注意力范围，减少目标偏差 [1, 3]。</li></ul><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-28bc0110d33180c8a91ad9d4919f12dd"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3Acdbaee15-e25d-4423-8203-9f030aee5500%3Aimage.png?table=block&amp;id=28bc0110-d331-80c8-a91a-d9d4919f12dd&amp;t=28bc0110-d331-80c8-a91a-d9d4919f12dd" alt="notion image" loading="lazy" decoding="async"/></div></figure><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-28cc0110d33180aebf93cbf5f56d5d41" data-id="28cc0110d33180aebf93cbf5f56d5d41"><span><div id="28cc0110d33180aebf93cbf5f56d5d41" class="notion-header-anchor"></div><a class="notion-hash-link" href="#28cc0110d33180aebf93cbf5f56d5d41" title="2.4 上下文检索与 Agentic 搜索"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>2.4 上下文检索与 Agentic 搜索</b></span></span></h4><div class="notion-text notion-block-28cc0110d3318035acb5d2bc7565ad94">Agentic 搜索强调 Agent 自主地检索和加载上下文，而非预先处理所有相关数据 [4]：</div><ul class="notion-list notion-list-disc notion-block-28cc0110d3318077a7ece9c80f557fbe"><li><b>“即时”上下文（“just in time”）策略</b>：Agent 维护轻量级标识符（如文件路径、存储的查询、网页链接等），并<b>使用工具在运行时动态加载数据到上下文中</b>。例如，Claude Code 使用此方法对大型数据库进行复杂数据分析，模型可以编写有针对性的查询、存储结果，并利用 Bash 命令（如 <code class="notion-inline-code">head</code> 和 <code class="notion-inline-code">tail</code>）分析大量数据，而无需将完整数据对象加载到上下文中 [4]。</li></ul><ul class="notion-list notion-list-disc notion-block-28cc0110d33180c5b9d1d8e9ffe57318"><li><b>元数据利用</b>：引用（如文件路径）的元数据提供了有效细化行为的机制。文件系统中的文件夹层级、命名约定和时间戳等都提供了重要的信号，帮助 Agent 理解何时以及如何利用信息 [4]。</li></ul><ul class="notion-list notion-list-disc notion-block-28cc0110d331805ea1b7f60ac98733e8"><li><b>渐进式信息披露</b>：<b>允许 Agent 通过探索逐步发现相关上下文。每次交互都会产生上下文，为下一个决策提供信息。</b>Agent 可以逐层构建理解，只在工作记忆中保留必要的信息，并利用笔记策略进行额外持久化 [4]。</li></ul><ul class="notion-list notion-list-disc notion-block-28cc0110d3318039afe6d92a0b14a6ff"><li><b>混合策略</b>：在某些情况下，最有效的 Agent 可能会采用混合策略，<b>预先检索部分数据以提高速度，并根据需要自主探索。</b>例如，Claude Code 预先将 <code class="notion-inline-code">CLAUDE.md</code> 文件直接放入上下文中，同时允许通过 <code class="notion-inline-code">glob</code> 和 <code class="notion-inline-code">grep</code> 等原语即时导航环境和检索文件 [4]。</li></ul><div class="notion-text notion-block-28dc0110d331804db366ee11783817d9">&lt;ins/&gt;</div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-28dc0110d33180e4916ed2210b55aba2" data-id="28dc0110d33180e4916ed2210b55aba2"><span><div id="28dc0110d33180e4916ed2210b55aba2" class="notion-header-anchor"></div><a class="notion-hash-link" href="#28dc0110d33180e4916ed2210b55aba2" title="2.5 长周期任务的上下文工程"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>2.5 长周期任务的上下文工程</b></span></span></h4><div class="notion-text notion-block-28dc0110d331805882f6ce94926ca7ea">对于如大型代码库迁移或综合研究项目等需要跨越数十分钟甚至数小时连续工作的<b>长周期任务 (long-horizon tasks)</b>，Agent 必须在超出模型上下文窗口限制的情况下保持连贯性。仅仅等待更大的上下文窗口可能并非长久之计，因为所有尺寸的上下文窗口都可能受到信息污染和相关性问题的困扰。因此，直接解决这些限制的专门技术至关重要 [4]。</div><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-28dc0110d33180038011f4395a91eefd"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3Ad4af443d-b403-4103-8d87-5637eb25b50a%3Aimage.png?table=block&amp;id=28dc0110-d331-8003-8011-f4395a91eefd&amp;t=28dc0110-d331-8003-8011-f4395a91eefd" alt="与撰写prompt这一离散任务不同，上下文工程是迭代性的，每当决定向模型传递什么内容时，都会进行筛选阶段。" loading="lazy" decoding="async"/><figcaption class="notion-asset-caption"><em>与撰写prompt这一离散任务不同，上下文工程是迭代性的，每当决定向模型传递什么内容时，都会进行筛选阶段。</em></figcaption></div></figure><div class="notion-blank notion-block-28dc0110d3318006b537ed946bbe2e8d"> </div><div class="notion-text notion-block-28dc0110d33180ab9b74db84aa6238e7"><b>2.5.1 上下文压缩 (Compaction)</b></div><div class="notion-text notion-block-28dc0110d33180e58dcee3f88a89739f">上下文压缩是在对话接近上下文窗口限制时，通过对内容进行总结，并用该总结重新启动一个新上下文窗口的做法。这是提高长期连贯性的首要手段。其核心在于以高保真度提炼上下文内容，使 Agent 能够以最小的性能衰减继续执行任务 [4]。</div><ul class="notion-list notion-list-disc notion-block-28dc0110d33180388b9bc6002e0f17ed"><li><b>实现方式</b>：在 Claude Code 中，这一过程通过将消息历史传递给模型以总结和压缩最关键的细节来实现。模型会保留架构决策、未解决的错误和实现细节，同时<b>丢弃冗余的工具输出或消息</b>。随后，Agent 可以带着这个压缩后的上下文以及最近访问的五个文件继续工作，从而在不受上下文窗口限制的情况下保持工作的连续性 [4]。</li></ul><ul class="notion-list notion-list-disc notion-block-28dc0110d331809a9c62ef1b6ce1029b"><li><b>优化的艺术</b>：压缩的难点在于精确选择保留与丢弃的内容。过于激进的压缩可能导致丢失那些重要性在后期才显现的微妙但关键的上下文。因此，在实现压缩系统时，建议在复杂的 Agent 轨迹上仔细调整 Prompt。<b>应从最大化召回率开始，确保压缩 Prompt 捕获到轨迹中的每一条相关信息，然后通过消除多余内容来迭代提高其精确度</b> [4]。</li></ul><ul class="notion-list notion-list-disc notion-block-28dc0110d331800aac0dc19bedc1de4b"><li><b>轻量级压缩</b>：一种最安全、最轻量级的压缩形式是<b>工具结果清理</b>。一旦某个工具在消息历史的深处被调用过，Agent 通常不再需要看到其原始结果。清除这些结果可以有效减少上下文占用 [4]。</li></ul><div class="notion-blank notion-block-28dc0110d331808c99e8ffa7b759db51"> </div><div class="notion-text notion-block-28dc0110d33180eaa50efd839cc03d5c"><b>2.5.2 结构化笔记 (Structured Note-taking)</b></div><div class="notion-text notion-block-28dc0110d3318012a547f64051858709"><b>结构化笔记</b>，或称<b>智能体记忆 (agentic memory)</b>，是一种让 Agent 定期将笔记持久化到上下文窗口之外的内存中的技术。这些笔记可以在后续的某个时间点被重新拉取到上下文中。这种策略以最小的开销提供了持久化记忆 [4]。</div><ul class="notion-list notion-list-disc notion-block-28dc0110d331808ea459c4587d7fceb8"><li><b>简单模式</b>：像 Claude Code <b>创建待办事项列表</b>，或让自定义 Agent 维护一个 <code class="notion-inline-code">NOTES.md</code> 文件一样，这种简单的模式允许 Agent 跟踪复杂任务的进展，保持那些在数十次工具调用中可能丢失的关键上下文和依赖关系 [4]。</li></ul><div class="notion-blank notion-block-28dc0110d331807ea544ded82b182a33"> </div><div class="notion-text notion-block-28dc0110d33180959c19d6d59d74c8df"><b>2.5.3 子智能体架构 (Sub-agent Architectures)</b></div><div class="notion-text notion-block-28dc0110d33180369b69d3ec011b361b"><b>子智能体架构</b>为克服上下文限制提供了另一种途径。它<b>不是让单个 Agent 试图维护整个项目的状态，而是让专门的子智能体在干净的上下文窗口中处理重点任务。主智能体负责协调一个高层计划，而子智能体则执行深入的技术工作或使用工具查找相关信息。</b>每个子智能体可能会进行广泛的探索，使用数万甚至更多的 token，但最终只返回一个浓缩、精炼的工作摘要（通常为1000-2000个 token）[4]。</div><ul class="notion-list notion-list-disc notion-block-28dc0110d33180beabd0cc6622074471"><li><b>关注点分离</b>：这种方法实现了清晰的<b>关注点分离</b>——详细的搜索上下文被隔离在子智能体内部，而主导的 Agent 则专注于综合和分析结果。这种模式在处理复杂研究任务时，相比单 Agent 系统显示出显著的性能提升 [4]。</li></ul><div class="notion-text notion-block-28dc0110d3318094936ff8cc8b8a0293">这三种方法各有侧重：<b>上下文压缩</b>适合需要大量来回对话的任务；<b>结构化笔记</b>在具有明确里程碑的迭代开发中表现出色；而<b>子智能体架构</b>则在并行探索能带来巨大收益的复杂研究和分析中大放异彩 [4]。</div><div class="notion-text notion-block-28bc0110d331800f9edec4a9147956e4">&lt;ins/&gt;</div><h3 class="notion-h notion-h2 notion-h-indent-0 notion-block-28bc0110d3318001bbf3ca1228802f1c" data-id="28bc0110d3318001bbf3ca1228802f1c"><span><div id="28bc0110d3318001bbf3ca1228802f1c" class="notion-header-anchor"></div><a class="notion-hash-link" href="#28bc0110d3318001bbf3ca1228802f1c" title="3. 工具设计与管理：为智能体打造高效“武器库”"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>3. 工具设计与管理：为智能体打造高效“武器库”</b></span></span></h3><div class="notion-text notion-block-28bc0110d33180129995d350301017ef">工具是 AI Agent 与环境交互的关键接口。工具的设计质量直接影响 Agent 的效能 [2]。</div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-28bc0110d33180b5aa81c21716cf3861" data-id="28bc0110d33180b5aa81c21716cf3861"><span><div id="28bc0110d33180b5aa81c21716cf3861" class="notion-header-anchor"></div><a class="notion-hash-link" href="#28bc0110d33180b5aa81c21716cf3861" title="3.1 工具设计原则"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>3.1 工具设计原则</b></span></span></h4><ul class="notion-list notion-list-disc notion-block-28bc0110d3318040afe7d54ebb35ff0a"><li><b>选择合适的工具</b>：审慎决定哪些工具需要实现，哪些可以省略 [2]。</li><ul class="notion-list notion-list-disc notion-block-28bc0110d3318040afe7d54ebb35ff0a"><li>建议针对特定的高价值工作流程，精心打造一些适用的工具，使其与评估任务相匹配，再以此为基础逐步拓展。就通讯录场景而言，可以考虑实现 <code class="notion-inline-code">search_contacts</code> 或 <code class="notion-inline-code">message_contact</code> 工具，而非 <code class="notion-inline-code">list_contacts</code> 工具。</li><li>工具可以<b>整合各类功能</b>，在内部处理多个可能离散的操作（或 API 调用）。例如，工具可以利用相关元数据丰富回复内容，或者通过一次工具调用完成频繁串联的多步骤任务。</li><li>一些示例：</li><ul class="notion-list notion-list-disc notion-block-28bc0110d33180fb8ad0d384977a1bb4"><li>相较于分别实现 <code class="notion-inline-code">list_users</code>、<code class="notion-inline-code">list_events</code> 和 <code class="notion-inline-code">create_event</code> 工具，不妨考虑实现一个 <code class="notion-inline-code">schedule_event</code> 工具，它既能查找可用时间，又能安排活动。</li><li>与其实现 <code class="notion-inline-code">read_logs</code> 工具，不如实现 <code class="notion-inline-code">search_logs</code> 工具，该工具仅返回相关日志行及部分周边上下文。</li><li>不要分别实现 <code class="notion-inline-code">get_customer_by_id</code>、<code class="notion-inline-code">list_transactions</code> 和 <code class="notion-inline-code">list_notes</code> 工具，而是实现一个 <code class="notion-inline-code">get_customer_context</code> 工具，它能一次性整合客户所有近期相关信息。</li></ul><li><b>要确保每个构建的工具都有明确且独特的用途。</b>工具应让智能体像人类在拥有相同底层资源时那样，对任务进行细分并解决，同时减少因中间输出而消耗的上下文。</li><li><b>工具太多或其功能重叠，可能会干扰智能体采用高效策略。</b>因此，认真且有针对性地规划要构建（或不构建）的工具，会带来显著成效。</li></ul></ul><ul class="notion-list notion-list-disc notion-block-28bc0110d33180fea1d5d0120080d99b"><li><b>工具命名空间</b>：为工具定义清晰的功能边界，避免混淆 [2]。</li><ul class="notion-list notion-list-disc notion-block-28bc0110d33180fea1d5d0120080d99b"><li><b>通过设置命名空间（把相关工具归到相同前缀下），有助于在众多工具间明确界限</b>，MCP 客户端有时会默认这么做。比如，按照服务（像 <code class="notion-inline-code">asana_search</code>、<code class="notion-inline-code">jira_search</code>）和资源（例如 <code class="notion-inline-code">asana_projects_search</code>、<code class="notion-inline-code">asana_users_search</code>）对工具进行命名空间划分，能帮助智能体在合适的时机选择合适的工具。</li><li><b>选择基于前缀或后缀的命名空间方式，会对工具使用评估产生不可忽视的影响。</b>而且不同的 LLM 受影响的情况各异，所以建议根据自身评估结果来选择命名方案。</li><li>智能体可能会出现调用工具错误、用错参数调用正确工具、调用工具数量不足，或者错误处理工具回复等问题。实现工具时有针对性地设置它们的名称体现任务的自然区分，这样既能减少加载到智能体上下文中的工具数量和描述信息，还能把智能体计算的工作从上下文转移到工具调用本身，从而降低智能体犯错的整体风险。</li></ul></ul><ul class="notion-list notion-list-disc notion-block-28bc0110d3318017b826c83eea30c817"><li><b>返回有意义的上下文</b>：工具的输出应向 Agent 提供简洁且有意义的上下文信息 [2]。</li><ul class="notion-list notion-list-disc notion-block-28bc0110d3318017b826c83eea30c817"><li><b>在实现工具时，要注意只向智能体返回关键信息。</b>应更注重上下文的相关性，而非追求灵活性，同时避免使用底层技术标识符（比如 <code class="notion-inline-code">uuid</code>、<code class="notion-inline-code">256px_image_url</code>、<code class="notion-inline-code">mime_type</code> 等）。像 <code class="notion-inline-code">name</code>、<code class="notion-inline-code">image_url</code> 和 <code class="notion-inline-code">file_type</code> 这类字段，更有助于直接引导智能体开展后续行动并做出回复。</li><li>相较于晦涩的标识符，<b>智能体处理自然语言命名、术语或标识符时，往往更加得心应手。</b>仅需将随意的字母数字 <code class="notion-inline-code">UUID</code> 转换为语义更清晰、更易解读的表述（甚至只是采用从 0 开始编号的 <code class="notion-inline-code">ID</code> 方案），就能减少幻觉现象，显著提升 Claude 在检索任务中的精准度。</li><li>在某些情形下，若只是为了触发后续工具调用（例如 <code class="notion-inline-code">search_user (name=’jane’)</code> → <code class="notion-inline-code">send_message (id=12345) </code>），智能体可能既需要与自然语言输出交互，也需要与技术标识符输出交互的灵活性。可以在工具中设置一个简单的 <code class="notion-inline-code">response_format</code> 枚举参数，让智能体能够选择工具返回 “<code class="notion-inline-code">concise</code>” 还是 “<code class="notion-inline-code">detailed</code>” 的回复（如下所示）。</li><ul class="notion-list notion-list-disc notion-block-28bc0110d3318093973ff7b89deae099"></ul><li><b>甚至工具的回复结构，如 XML、JSON 或 Markdown 等，都会对评估性能产生影响</b>，不存在一种适用于所有情况的解决方案。最佳回复结构会因任务和智能体的不同而差异巨大。建议根据自身评估情况，选择最合适的回复结构。</li></ul></ul><ul class="notion-list notion-list-disc notion-block-28bc0110d3318024a3e0f566e62b215a"><li><b>优化工具回复的 token 效率</b>：减少工具回复的 token 数量，以降低成本并提高处理速度 [2]。</li></ul><ul class="notion-list notion-list-disc notion-block-28bc0110d33180ef8bf8de82cf519320"><li><b>Prompt Engineering 工具描述和规范</b>：精心设计工具的描述和规范，使其更易于 Agent 理解和使用 [2]。</li><ul class="notion-list notion-list-disc notion-block-28bc0110d33180ef8bf8de82cf519320"><li>编写工具描述和规格时，不妨设想一下如何给团队新成员介绍该工具。思考那些可能默认提及的上下文信息，比如专业的查询格式、特定术语的定义、底层资源间的关系等，并将它们清晰呈现出来。<b>要通过清楚描述（并借助严格的数据模型加以规范）预期的输入与输出，避免出现模糊不清的情况。</b>尤其要注意，<b>输入参数的命名务必清晰准确</b>，比如别用 <code class="notion-inline-code">user</code> 这样的参数名，改用 <code class="notion-inline-code">user_id</code> 会更好。</li><li><b>利用数据集评估效果</b>，能更确切地衡量提示工程带来的效果。<b>哪怕只是对工具描述做些细微调整，都可能大幅提升性能。</b></li></ul></ul><div class="notion-text notion-block-28bc0110d331802e9548f13e58745fb0">&lt;ins/&gt;</div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-28bc0110d3318075b294e98047eb0fc8" data-id="28bc0110d3318075b294e98047eb0fc8"><span><div id="28bc0110d3318075b294e98047eb0fc8" class="notion-header-anchor"></div><a class="notion-hash-link" href="#28bc0110d3318075b294e98047eb0fc8" title="3.2 动态工具选择与约束"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>3.2 动态工具选择与约束</b></span></span></h4><div class="notion-text notion-block-28bc0110d33180f0b0d1d45d2b8bf161"><b>避免在迭代过程中动态添加或移除工具</b>，因为这会影响 KV-cache 并可能导致模型混淆 [1]。更优的策略是：</div><ul class="notion-list notion-list-disc notion-block-28bc0110d33180c19d08ef0c6cc569fc"><li><b>上下文感知的状态机</b>：“状态机” 可理解为 Agent 的 “工具权限开关系统”，它会预先定义不同 “状态”（比如 “浏览网页”“处理文件”“生成报告” 等任务场景），每个状态对应一套 “允许使用的工具列表”。而 “上下文感知” 则是让状态机能实时判断当前处于哪个场景（比如检测到用户需求是 “查天气”，就判定为 “信息检索状态”），进而自动激活对应状态下的工具权限。通过状态机管理工具可用性，例如通过掩码 token logits 来约束动作空间，从而在不修改工具定义的情况下限制 Agent 的选择 [1]。</li></ul><ul class="notion-list notion-list-disc notion-block-28bc0110d331801d976cc20d1cbe44f0"><li><b>一致的动作名称前缀</b>：设计具有一致前缀的动作名称（例如，所有浏览器工具以 <code class="notion-inline-code">browser_</code> 开头），以便于在特定状态下对工具进行分组约束 [1]。</li></ul><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-28bc0110d331807ab7ade6147708b45d"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3Abae7191f-bc2f-4cd0-8e17-b6d19d774afb%3Aimage.png?table=block&amp;id=28bc0110-d331-807a-b7ad-e6147708b45d&amp;t=28bc0110-d331-807a-b7ad-e6147708b45d" alt="notion image" loading="lazy" decoding="async"/></div></figure><div class="notion-text notion-block-28bc0110d33180e9bf2bce6788e96865">在实际应用中，大多数模型供应商和推理框架都支持某种形式的<b>回复预填充（response prefill）</b>功能，借助该功能，无需修改工具定义就能限制动作空间。函数调用一般有三种模式（这里以 NousResearch 的 Hermes 格式为例）：</div><ul class="notion-list notion-list-disc notion-block-28bc0110d33180b5b294e342db440106"><li><b>自动（Auto）</b>：模型可自行决定是否调用函数。具体通过仅预填充回复前缀来实现：<code class="notion-inline-code">&lt;|im_start|&gt;assistant</code></li></ul><ul class="notion-list notion-list-disc notion-block-28bc0110d331805aa872c6f83ffdaf11"><li><b>必需（Required）</b>：模型必须调用函数，但具体调用选择不受约束。通过预填充到工具调用令牌来实现：<code class="notion-inline-code">&lt;|im_start|&gt;assistant&lt;tool_call&gt;</code></li></ul><ul class="notion-list notion-list-disc notion-block-28bc0110d33180d19819d1bf117df042"><li><b>指定（Specified）</b>：模型必须从特定的函数子集中选择调用。通过预填充到函数名开头来实现：<code class="notion-inline-code">&lt;|im_start|&gt;assistant&lt;tool_call&gt;{&quot;name&quot;: “browser_</code></li></ul><div class="notion-text notion-block-28bc0110d33180d59bbada023abf5ee1">基于此，可以通过直接屏蔽 token logits 来限制动作选择。Manus 还特意将动作名称设计成具有统一前缀，例如所有与浏览器相关的工具均以 <code class="notion-inline-code">browser_</code> 开头，命令行工具则以 <code class="notion-inline-code">shell_</code> 开头。这样一来，无需借助有状态的 logits 处理器，就能轻松保证智能体在特定状态下仅从某一组工具中做出选择。</div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-28bc0110d33180c2bbe6dc544813d9d0" data-id="28bc0110d33180c2bbe6dc544813d9d0"><span><div id="28bc0110d33180c2bbe6dc544813d9d0" class="notion-header-anchor"></div><a class="notion-hash-link" href="#28bc0110d33180c2bbe6dc544813d9d0" title="3.3 工具分层"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>3.3 工具分层</b></span></span></h4><div class="notion-text notion-block-28bc0110d331803ea489c758dfe649e1">结合使用不同抽象层次的工具，可以提高 Agent 的灵活性和效率 [3]：</div><ul class="notion-list notion-list-disc notion-block-28bc0110d331809cbb5dd179e26a2b65"><li><b>低、中、高层工具结合</b>：例如，低层工具（Bash、Read、Write）、中层工具（Edit、Grep、Glob）和高层工具（Task、WebFetch）。对于频繁使用的操作，可以封装为单独的工具，同时保留通用命令以处理特殊情况 [3]。</li></ul><ul class="notion-list notion-list-disc notion-block-28bc0110d33180138cd7d92bf94af6c7"><li><b>详细的工具描述</b>：工具描述应包含详细的 Prompt 和大量示例，系统 Prompt 应包含“何时使用工具”或如何在功能重叠的工具之间进行选择的信息 [3]。</li></ul><div class="notion-text notion-block-28bc0110d331808e946ce92c3d3bffed">&lt;ins/&gt;</div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-290c0110d3318065be3ac2052079e8e8" data-id="290c0110d3318065be3ac2052079e8e8"><span><div id="290c0110d3318065be3ac2052079e8e8" class="notion-header-anchor"></div><a class="notion-hash-link" href="#290c0110d3318065be3ac2052079e8e8" title="3.4 Agent Skills：构建可组合、可扩展的专业能力"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>3.4 Agent Skills：构建可组合、可扩展的专业能力</b></span></span></h4><div class="notion-text notion-block-290c0110d331804eb393d659ad6e1974"><b>Agent Skills</b> 是 <b>Anthropic</b> 刚发布的一种通过结构化文件和文件夹来构建专业化 Agent 的新方法，它将指令、脚本和资源组织起来，使 Agent 能够动态发现和加载这些能力，从而在特定任务中表现更优 [5]。</div><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-290c0110d3318085b3f8e26c8902c483"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3A26c18195-a6af-410c-b47f-9a1f847e2878%3Aimage.png?table=block&amp;id=290c0110-d331-8085-b3f8-e26c8902c483&amp;t=290c0110-d331-8085-b3f8-e26c8902c483" alt="一个 Skill 是一个包含 SKILL.md 文件的目录，该文件包含组织好的指令、脚本和资源文件夹，为智能体提供额外的能力。" loading="lazy" decoding="async"/><figcaption class="notion-asset-caption">一个 <b>Skill</b> 是一个包含 SKILL.md 文件的目录，该文件包含组织好的指令、脚本和资源文件夹，为智能体提供额外的能力。</figcaption></div></figure><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-290c0110d3318049a58ee89192847576"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3Ab94eb812-0dbe-417d-86d7-2a1f022bada2%3Aimage.png?table=block&amp;id=290c0110-d331-8049-a58e-e89192847576&amp;t=290c0110-d331-8049-a58e-e89192847576" alt="notion image" loading="lazy" decoding="async"/></div></figure><ul class="notion-list notion-list-disc notion-block-290c0110d331808b82a2f96cb9c31026"><li><b>核心理念</b>：Agent Skills 就像为新员工准备的入职指南，它通过将专业知识打包成可组合的资源，将通用 Agent 转化为满足特定需求的专业 Agent [5]。</li></ul><ul class="notion-list notion-list-disc notion-block-290c0110d33180c5a6e4f47b2b8ec49a"><li><span class="notion-red"><b>渐进式披露（progressive disclosure）</b></span>：一个 Skill 是一个包含 <code class="notion-inline-code">SKILL.md</code> 文件的目录。<code class="notion-inline-code">SKILL.md</code> 必须以 YAML Frontmatter 开头，包含名称和描述等元数据。这些元数据会在 Agent 启动时预加载到系统 Prompt 中，提供第一层级的渐进式披露。如果 Agent 认为该 Skill 与当前任务相关，它会加载完整的 <code class="notion-inline-code">SKILL.md</code> 到上下文中，这是第二层披露。对于更复杂的 Skill，可以捆绑额外的文件（如 <code class="notion-inline-code">reference.md</code> 或 <code class="notion-inline-code">forms.md</code>），Agent 可以根据需要进一步导航和发现这些文件，实现更深层次的渐进式信息披露 [5]。</li><ul class="notion-list notion-list-disc notion-block-290c0110d33180c5a6e4f47b2b8ec49a"><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-290c0110d331807a8c8ec14568016775"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3A84b397b2-9f81-4607-9077-e109957fe2e8%3Aimage.png?table=block&amp;id=290c0110-d331-807a-8c8e-c14568016775&amp;t=290c0110-d331-807a-8c8e-c14568016775" alt="可以将更多上下文（通过附加文件）整合到技能中，然后根据系统提示由 Claude 触发。" loading="lazy" decoding="async"/><figcaption class="notion-asset-caption">可以将更多上下文（通过附加文件）整合到技能中，然后根据系统提示由 Claude 触发。</figcaption></div></figure><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-290c0110d33180188a40cec9e063b5f9"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3A1a47b1f7-4fd0-4678-97e7-92202fc9eeea%3Aimage.png?table=block&amp;id=290c0110-d331-8018-8a40-cec9e063b5f9&amp;t=290c0110-d331-8018-8a40-cec9e063b5f9" alt="notion image" loading="lazy" decoding="async"/></div></figure></ul></ul><ul class="notion-list notion-list-disc notion-block-290c0110d3318002a609f1d99fcb0450"><li><b>代码执行能力</b>：Agent Skills 可以包含代码，供 Agent 根据任务性质作为工具执行。大型语言模型在许多任务中表现出色，但某些操作（如排序列表）更适合传统的代码执行，因为代码能提供更高的效率和确定性。例如，一个 PDF Skill 可以包含一个预先编写的 Python 脚本，用于读取 PDF 并提取所有表单字段，Agent 无需将脚本或 PDF 加载到上下文中即可运行，确保了工作流程的一致性和可重复性 [5]。</li><ul class="notion-list notion-list-disc notion-block-290c0110d3318002a609f1d99fcb0450"><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-290c0110d331802b8d3bf9ec554bcb1b"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3A0006f5d2-f25b-4e76-b5cf-4c79ea8997be%3Aimage.png?table=block&amp;id=290c0110-d331-802b-8d3b-f9ec554bcb1b&amp;t=290c0110-d331-802b-8d3b-f9ec554bcb1b" alt="技能还可以包含代码，Claude 根据任务性质自行决定这些代码是否作为工具被执行。" loading="lazy" decoding="async"/><figcaption class="notion-asset-caption">技能还可以包含代码，Claude 根据任务性质自行决定这些代码是否作为工具被执行。</figcaption></div></figure></ul></ul><ul class="notion-list notion-list-disc notion-block-290c0110d33180df8839f0fc93946dec"><li><b>开发与评估最佳实践</b>：</li><ul class="notion-list notion-list-disc notion-block-290c0110d33180df8839f0fc93946dec"><li><b>从评估开始</b>：通过在代表性任务上运行 Agent，识别其能力差距，然后逐步构建 Skill 来弥补这些不足 [5]。</li><li><b>结构化以适应规模</b>：当 <code class="notion-inline-code">SKILL.md</code> 文件变得难以管理时，将其内容拆分为单独的文件。如果某些上下文是互斥的或很少一起使用，分开存放可以减少 token 使用。<b>代码既可以作为可执行工具，也可以作为文档</b>，需要明确 Agent 是直接运行脚本还是将其作为参考加载到上下文中 [5]。</li><li><b>从 Agent 视角思考</b>：监控 Agent 在实际场景中如何使用 Skill，并根据观察结果进行迭代。特别关注 Skill 的名称和描述，因为 Agent 会根据这些信息决定是否触发该 Skill [5]。</li><li><b>与 Claude 迭代</b>：在与 Claude 共同完成任务时，让其捕获成功的路径和常见的错误，并将其转化为 Skill 中可重用的上下文和代码。如果 Agent 在使用 Skill 时偏离轨道，让其自我反思问题所在，这有助于发现 Agent 真正需要的上下文 [5]。</li></ul></ul><h3 class="notion-h notion-h2 notion-h-indent-0 notion-block-28bc0110d33180fead34faf2aede1a43" data-id="28bc0110d33180fead34faf2aede1a43"><span><div id="28bc0110d33180fead34faf2aede1a43" class="notion-header-anchor"></div><a class="notion-hash-link" href="#28bc0110d33180fead34faf2aede1a43" title="4. 控制循环与架构：构建稳定高效的智能体骨架"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>4. 控制循环与架构：构建稳定高效的智能体骨架</b></span></span></h3><div class="notion-text notion-block-28bc0110d3318035b2e8ee57757aee16">Agent 的控制循环和底层架构设计对其稳定性和效率至关重要。</div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-28bc0110d33180af8d7bc234c879ad3e" data-id="28bc0110d33180af8d7bc234c879ad3e"><span><div id="28bc0110d33180af8d7bc234c879ad3e" class="notion-header-anchor"></div><a class="notion-hash-link" href="#28bc0110d33180af8d7bc234c879ad3e" title="4.1 保持一个主循环"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>4.1 保持一个主循环</b></span></span></h4><ul class="notion-list notion-list-disc notion-block-28bc0110d3318098aea5c6ca16e6944a"><li><b>简化架构以提高可调试性</b>：优先考虑可调试性，而不是复杂的、多智能体的系统。例如，Claude Code 采用一个主线程，通过周期性地使用不同类型的 Prompt 来总结 git 历史、合并消息历史或生成 UX 元素。对于分层任务，它通过生成一个不能再生成子智能体的子智能体来处理，其结果作为“工具回复”添加到主消息历史中 [3]。</li></ul><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-28bc0110d33180489991caa7359db918" data-id="28bc0110d33180489991caa7359db918"><span><div id="28bc0110d33180489991caa7359db918" class="notion-header-anchor"></div><a class="notion-hash-link" href="#28bc0110d33180489991caa7359db918" title="4.2 使用小型模型"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>4.2 使用小型模型</b></span></span></h4><ul class="notion-list notion-list-disc notion-block-28bc0110d33180598597e948043f59c2"><li><b>成本效益与效率</b>：对于读取大文件、解析网页、处理 git 历史和总结长对话等操作，超过 50% 的重要 LLM 调用都使用 <code class="notion-inline-code">claude-3-5-haiku</code> 等小型模型。小型模型成本更低，可以大量使用，从而提高整体效率 [3]。</li></ul><h3 class="notion-h notion-h2 notion-h-indent-0 notion-block-28bc0110d33180959bfcc73fbbb42785" data-id="28bc0110d33180959bfcc73fbbb42785"><span><div id="28bc0110d33180959bfcc73fbbb42785" class="notion-header-anchor"></div><a class="notion-hash-link" href="#28bc0110d33180959bfcc73fbbb42785" title="5. 评估与适应：持续改进智能体性能"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>5. 评估与适应：持续改进智能体性能</b></span></span></h3><div class="notion-text notion-block-28bc0110d33180ba9ce6d0d36ab04960">Agent 的持续改进离不开有效的评估和适应机制。</div><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-28bc0110d3318041b7a5ed6ed0a927d9" data-id="28bc0110d3318041b7a5ed6ed0a927d9"><span><div id="28bc0110d3318041b7a5ed6ed0a927d9" class="notion-header-anchor"></div><a class="notion-hash-link" href="#28bc0110d3318041b7a5ed6ed0a927d9" title="5.1 原型构建与综合评估"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>5.1 原型构建与综合评估</b></span></span></h4><ul class="notion-list notion-list-disc notion-block-28bc0110d3318056bf98d2c73756d7f6"><li><b>快速原型与本地测试</b>：快速构建工具原型并在本地测试，尤其是在使用 Claude Code 编写工具时，提供详细的文档（如 LLM-friendly 的 <code class="notion-inline-code">llms.txt</code> 文件） [2]。</li></ul><ul class="notion-list notion-list-disc notion-block-28bc0110d331807cbc99f0b6fad71669"><li><b>生成评估任务</b>：创建大量基于真实世界用例的评估任务，避免过于简单或肤浅的“沙盒”环境。强评估任务可能需要多次工具调用 [2]。</li></ul><ul class="notion-list notion-list-disc notion-block-28bc0110d33180cbb3c8d0bd45c0cad0"><li><b>系统 Prompt 指导</b>：在评估 Agent 的系统 Prompt 中，指导 Agent 不仅输出结构化的回复块，还要输出推理和反馈块（在工具调用和回复块之前），以触发思维链（CoT）行为 [2]。</li></ul><ul class="notion-list notion-list-disc notion-block-28bc0110d331807b8149d6d9bd52b7aa"><li><b>避免过度指定或过拟合</b>：允许 Agent 有多种解决任务的有效路径，避免过度指定或过拟合策略 [2]。</li></ul><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-28bc0110d331807fb2ebf394de6e06ea" data-id="28bc0110d331807fb2ebf394de6e06ea"><span><div id="28bc0110d331807fb2ebf394de6e06ea" class="notion-header-anchor"></div><a class="notion-hash-link" href="#28bc0110d331807fb2ebf394de6e06ea" title="5.2 错误恢复与适应"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>5.2 错误恢复与适应</b></span></span></h4><div class="notion-text notion-block-28bc0110d33180168f44ca5b98661f9d">智能体难免会犯错，这并非缺陷，而是客观存在的情况。语言模型可能出现幻觉，环境可能返回错误信息，外部工具也可能运行异常，各种意外的边缘情况随时都可能出现。<b>在多步骤任务中，失败并非个别现象，而是任务循环中的常见环节。</b></div><div class="notion-text notion-block-28bc0110d3318003aee6d476c50e7a40">根据经验，改进智能体行为的一个极为有效的方法，实则相当简单：<b>把错误的步骤保留在上下文当中</b>。当模型看到某个动作失败，以及随之产生的观察结果或堆栈跟踪信息时，会不自觉地更新其内部认知。这会使模型在后续决策中，减少选择类似动作的可能性，从而降低重复犯错的概率。实际上，<b>错误恢复能力</b>是衡量智能体是否具备真正智能行为的重要指标之一。</div><ul class="notion-list notion-list-disc notion-block-28bc0110d33180899f27e3ef8f4631a1"><li><b>不隐藏错误</b>：将失败的动作和观察结果（如堆栈跟踪）保留在上下文中，让模型通过观察错误隐式更新其内部信念，从而减少重复犯错的可能性。错误恢复是衡量真正 Agentic 行为的关键指标 [1]。</li></ul><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-28bc0110d33180db990cd0457064e5ae"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3A5fb9c930-3da5-442c-b860-337ae5ad1b78%3Aimage.png?table=block&amp;id=28bc0110-d331-80db-990c-d0457064e5ae&amp;t=28bc0110-d331-80db-990c-d0457064e5ae" alt="notion image" loading="lazy" decoding="async"/></div></figure><h4 class="notion-h notion-h3 notion-h-indent-1 notion-block-28bc0110d3318098bf7fcc88775d7fbc" data-id="28bc0110d3318098bf7fcc88775d7fbc"><span><div id="28bc0110d3318098bf7fcc88775d7fbc" class="notion-header-anchor"></div><a class="notion-hash-link" href="#28bc0110d3318098bf7fcc88775d7fbc" title="5.3 多样性与泛化"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>5.3 多样性与泛化</b></span></span></h4><div class="notion-text notion-block-28bc0110d33180179904e8236e932775">少样本提示是改善大语言模型（LLM）输出的常用方法，但在智能体系统里，它可能会以不易察觉的方式带来负面影响。</div><div class="notion-text notion-block-28bc0110d3318044adfdde78ee96cfc5">语言模型很擅长模仿，会依照上下文中的行为模式进行输出。要是上下文里有大量相似的<b>动作-观察（action-observation）</b>组合，模型就容易遵循这种模式。</div><div class="notion-text notion-block-28bc0110d33180d3b843dc85df47e936">在那些需要重复做决策或行动的任务中，这种情况很可能引发问题。比如说，用 Manus 去批量审阅 20 份简历时，智能体经常会形成一种惯性，只是因为在上下文中看到了类似行为，就重复相似的操作。这就可能导致偏离目标、过度泛化，甚至产生幻觉。</div><div class="notion-text notion-block-28bc0110d331806ca4cfda53880fd12d">要解决这个问题，关键在于增加多样性。Manus 通过在动作和观察中引入少量的结构化变动，像是采用不同的序列化模板、变换措辞，或者在顺序与格式上制造些微干扰。这种适度的随机性能够打破固有模式，调整模型关注的重点。也就是说，别让少样本提示把自己限制住，上下文越单一，智能体就越容易出问题。</div><ul class="notion-list notion-list-disc notion-block-28bc0110d33180aca73cc9f7507127c9"><li><b>避免过度模仿</b>：在 few-shot prompting 中，避免过度模仿导致模型陷入重复模式。通过引入结构化的多样性（如不同的序列化模板、替代措辞、格式噪声）来打破模式，提高模型的泛化能力和鲁棒性 [1]。</li></ul><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-28bc0110d33180bf86f8f459441c842b"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3A7b1ae6f2-c78d-460e-9603-e6ccd9971d50%3Aimage.png?table=block&amp;id=28bc0110-d331-80bf-86f8-f459441c842b&amp;t=28bc0110-d331-80bf-86f8-f459441c842b" alt="notion image" loading="lazy" decoding="async"/></div></figure><div class="notion-blank notion-block-28bc0110d33180d8abdbc2b07ae23c56"> </div><h3 class="notion-h notion-h2 notion-h-indent-0 notion-block-28bc0110d33180e08941ecc23b1c6106" data-id="28bc0110d33180e08941ecc23b1c6106"><span><div id="28bc0110d33180e08941ecc23b1c6106" class="notion-header-anchor"></div><a class="notion-hash-link" href="#28bc0110d33180e08941ecc23b1c6106" title="结论"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>结论</b></span></span></h3><div class="notion-text notion-block-28bc0110d33180ac949fdc90b780c251">AI Agent 的优化是一个多维度、系统性的工程。从巧妙的 Prompt 工程倒精细的上下文管理，从高效的工具设计到稳定的控制循环，再到持续的评估与适应，每一个环节都对 Agent 的最终性能产生深远影响。通过采纳这些优化手段，我们可以构建出更智能、更鲁棒、更具适应性的 AI Agent，从而在现实世界中解决更复杂的挑战。</div><div class="notion-text notion-block-28bc0110d3318065b834faac5cd573c2">&lt;ins/&gt;</div><h3 class="notion-h notion-h2 notion-h-indent-0 notion-block-28bc0110d3318077912cd1d5f6ed7261" data-id="28bc0110d3318077912cd1d5f6ed7261"><span><div id="28bc0110d3318077912cd1d5f6ed7261" class="notion-header-anchor"></div><a class="notion-hash-link" href="#28bc0110d3318077912cd1d5f6ed7261" title="参考文献"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>参考文献</b></span></span></h3><ol start="1" class="notion-list notion-list-numbered notion-block-28bc0110d331808a8915f946c400bd2a" style="list-style-type:decimal"><li><a class="notion-link" href="https://manus.im/blog/Context-Engineering-for-AI-Agents-Lessons-from-Building-Manus" target="_blank" rel="noopener noreferrer">Context Engineering for AI Agents: Lessons from Building Manus</a></li></ol><ol start="2" class="notion-list notion-list-numbered notion-block-28bc0110d33180a58565e5f796757b13" style="list-style-type:decimal"><li><a class="notion-link" href="https://www.anthropic.com/engineering/writing-tools-for-agents" target="_blank" rel="noopener noreferrer">Writing effective tools for AI agents—using AI agents \ Anthropic</a></li></ol><ol start="3" class="notion-list notion-list-numbered notion-block-28bc0110d33180029b13e6ddc6ad39ca" style="list-style-type:decimal"><li><a class="notion-link" href="https://minusx.ai/blog/decoding-claude-code/" target="_blank" rel="noopener noreferrer">Minusx | What makes Claude Code so damn good (and how to recreate that magic in your agent)!?</a></li></ol><ol start="4" class="notion-list notion-list-numbered notion-block-28bc0110d3318058a001cc86ede9a7a6" style="list-style-type:decimal"><li><a class="notion-link" href="https://www.anthropic.com/engineering/effective-context-engineering-for-ai-agents" target="_blank" rel="noopener noreferrer">Effective context engineering for AI agents \ Anthropic</a></li></ol><ol start="5" class="notion-list notion-list-numbered notion-block-290c0110d331806cade5de2baeb343bc" style="list-style-type:decimal"><li><a class="notion-link" href="https://www.anthropic.com/engineering/equipping-agents-for-the-real-world-with-agent-skills" target="_blank" rel="noopener noreferrer">Equipping agents for the real world with Agent Skills \ Anthropic</a></li></ol><div class="notion-blank notion-block-28bc0110d33180388d67d25db3b341a8"> </div></main></div>]]></content:encoded>
        </item>
        <item>
            <title><![CDATA[Mobile-Agent-v3：新的 GUI Agents 开源王者]]></title>
            <link>https://www.breezedeus.com/article/ui-agent-mobile-agent-v3</link>
            <guid>https://www.breezedeus.com/article/ui-agent-mobile-agent-v3</guid>
            <pubDate>Sat, 06 Sep 2025 00:00:00 GMT</pubDate>
            <description><![CDATA[Mobile-Agent-v3 凭借多模态 GUI-Owl 模型、自我进化数据生成和 TRPO 强化学习，在多平台 GUI 自动化上超越主流开源方案，部分场景甚至优于 GPT-4o、Claude 3.7。]]></description>
            <content:encoded><![CDATA[<div id="notion-article" class="mx-auto overflow-hidden "><main class="notion light-mode notion-page notion-block-260c0110d33180b782e9e4f1c643d5c3"><div class="notion-viewport"></div><div class="notion-collection-page-properties"></div><div class="notion-row notion-block-260c0110d33181488bedcac279c3dfe5"><div class="notion-column notion-block-260c0110d331810e9b31e39e6dd9309c" style="width:calc((100% - (2 * min(32px, 4vw))) * 0.25)"><div class="notion-blank notion-block-260c0110d3318176893acbac64230a48"> </div></div><div class="notion-spacer"></div><div class="notion-column notion-block-260c0110d3318146bf0aff6e0b838903" style="width:calc((100% - (2 * min(32px, 4vw))) * 0.5416666666666667)"><div class="notion-text notion-block-260c0110d331815a90a4ff9f6cd7d2f9"><b><a class="notion-link" href="https://www.breezedeus.com/" target="_blank" rel="noopener noreferrer">Home</a></b><b> | </b><b><a class="notion-link" href="https://github.com/breezedeus" target="_blank" rel="noopener noreferrer">GitHub</a></b><b> | </b><b><a class="notion-link" href="https://twitter.com/breezedeus" target="_blank" rel="noopener noreferrer">Twitter</a></b><b> | </b><b><a class="notion-link" href="https://www.youtube.com/@breezedeus" target="_blank" rel="noopener noreferrer">Youtube</a></b><b>  |  </b><b><a class="notion-link" href="https://space.bilibili.com/509307267" target="_blank" rel="noopener noreferrer">Bilibili</a></b></div></div><div class="notion-spacer"></div><div class="notion-column notion-block-260c0110d33181809ac0d5688faabc4a" style="width:calc((100% - (2 * min(32px, 4vw))) * 0.2083333333333335)"><div class="notion-blank notion-block-260c0110d3318141a2bfe8f7013550b1"> </div></div><div class="notion-spacer"></div></div><div class="notion-row notion-block-260c0110d33181eb9645fb45a446f358"><div class="notion-column notion-block-260c0110d33181cdba9eced41a123c33" style="width:calc((100% - (1 * min(32px, 4vw))) * 0.5)"><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-260c0110d331806ea1b9f641061c69f7"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:320px"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3A03710368-c102-4cc1-838f-0b6fe1874fd7%3Aaebfbc97-c659-4251-964e-58dc7e3d85e9.png?table=block&amp;id=260c0110-d331-806e-a1b9-f641061c69f7&amp;t=260c0110-d331-806e-a1b9-f641061c69f7" alt="notion image" loading="lazy" decoding="async"/></div></figure></div><div class="notion-spacer"></div><div class="notion-column notion-block-260c0110d331811e8efdf3d8c69345f8" style="width:calc((100% - (1 * min(32px, 4vw))) * 0.5)"><div class="notion-text notion-block-260c0110d331813f885ed89e2b7a658e"><b>目录：</b></div><div class="notion-table-of-contents notion-gray notion-block-260c0110d33181a9a8b6dccef45a5d93"><a href="#260c0110d33181f69911ef4fa2d965f5" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:0">[2508.15144] Mobile-Agent-v3: Foundamental Agents for GUI Automation, Alibaba</span></a><a href="#260c0110d3318020b517ec0ca4c47f90" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:24px">GUI-Owl：端到端的多模态GUI智能体</span></a><a href="#260c0110d33180bfa903dc3747209220" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:48px">创新一：大规模环境基础设施与自我进化轨迹生产</span></a><a href="#260c0110d3318031be99d22fa244032d" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:48px">创新二：多样化的基础智能体能力构建</span></a><a href="#260c0110d3318010a7c0c5a91a1a22d4" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:48px">创新三：可扩展的环境强化学习与TRPO</span></a><a href="#260c0110d3318028a893c3afa827cfe1" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:24px">Mobile-Agent-v3：协同工作的多智能体框架</span></a><a href="#260c0110d33180a4bad1e1b333132d6c" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:24px">卓越的性能表现</span></a><a href="#260c0110d33180d08bf2f4430e0ce61b" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:48px">1. 端到端模型性能：GUI-Owl的领先地位</span></a><a href="#260c0110d33180e5a931fde2c3896b09" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:48px">2. 超越专有模型：GUI-Owl-32B的强大实力</span></a><a href="#260c0110d3318005bfeff75bfa7d1472" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:48px">3. 消融研究与关键技术贡献</span></a><a href="#260c0110d33180fb9757eede35308eb3" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:24px">结论与展望</span></a><a href="#260c0110d33181a289b1c7f37a4cd686" class="notion-table-of-contents-item"><span class="notion-table-of-contents-item-body" style="display:inline-block;margin-left:0">AI Agents 知识星球</span></a></div><div class="notion-blank notion-block-260c0110d331816e8497fb98f8eadbf8"> </div></div><div class="notion-spacer"></div></div><h2 class="notion-h notion-h1 notion-h-indent-0 notion-block-260c0110d33181f69911ef4fa2d965f5" data-id="260c0110d33181f69911ef4fa2d965f5"><span><div id="260c0110d33181f69911ef4fa2d965f5" class="notion-header-anchor"></div><a class="notion-hash-link" href="#260c0110d33181f69911ef4fa2d965f5" title="[2508.15144] Mobile-Agent-v3: Foundamental Agents for GUI Automation, Alibaba"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><a class="notion-link" href="https://arxiv.org/abs/2508.15144" target="_blank" rel="noopener noreferrer">[2508.15144] Mobile-Agent-v3: Foundamental Agents for GUI Automation</a>, Alibaba</span></span></h2><ul class="notion-list notion-list-disc notion-block-260c0110d331812a81d6ee2c411710f2"><li><a class="notion-link" href="https://github.com/X-PLUG/MobileAgent/tree/main/Mobile-Agent-v3" target="_blank" rel="noopener noreferrer">https://github.com/X-PLUG/MobileAgent/tree/main/Mobile-Agent-v3</a>，模型开源</li></ul><div class="notion-blank notion-block-266c0110d33180458143f142ec254b8c"> </div><div class="notion-text notion-block-260c0110d33180ae9370f9236dc16cb4">阿里巴巴通义实验室的研究团队推出了<b>Mobile-Agent-v3</b>框架及其核心模型<b>GUI-Owl</b>。本文将深入剖析Mobile-Agent-v3背后的创新技术和方法，揭示其如何成为GUI自动化领域的革新力量。</div><h3 class="notion-h notion-h2 notion-h-indent-1 notion-block-260c0110d3318020b517ec0ca4c47f90" data-id="260c0110d3318020b517ec0ca4c47f90"><span><div id="260c0110d3318020b517ec0ca4c47f90" class="notion-header-anchor"></div><a class="notion-hash-link" href="#260c0110d3318020b517ec0ca4c47f90" title="GUI-Owl：端到端的多模态GUI智能体"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>GUI-Owl：端到端的多模态GUI智能体</b></span></span></h3><div class="notion-text notion-block-260c0110d3318002b10aecc38a558ba2">Mobile-Agent-v3框架的核心是<b>GUI-Owl</b>，一个专为GUI自动化设计的端到端多模态智能体模型。它旨在<b>将UI感知、元素定位（grounding）、复杂推理、任务规划以及最终的动作执行等一系列能力，统一到一个单一的策略网络中，其实就是统一的</b><span class="notion-red"><b>智能体模型（Agent Model）</b></span><b>了</b>。GUI-Owl基于<b>Qwen2.5-VL</b>模型进行微调，并通过海量且多样化的GUI交互数据进行后训练，使其能够无缝地与各种操作系统（包括移动端的Android、PC端的Ubuntu、macOS和Windows）上的图形用户界面进行交互。这使得GUI-Owl不仅能够自主执行多轮GUI交互任务，还能泛化到诸如问答、图像描述、任务规划和元素定位等特定应用场景。</div><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-266c0110d3318075aa13d5cc8a635ce6"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3A19db9d64-3492-4f15-b905-cac180a02a90%3Aimage.png?table=block&amp;id=266c0110-d331-8075-aa13-d5cc8a635ce6&amp;t=266c0110-d331-8075-aa13-d5cc8a635ce6" alt="notion image" loading="lazy" decoding="async"/></div></figure><div class="notion-text notion-block-260c0110d331804d86cfecb681630514">GUI-Owl的强大之处在于其能够像人类一样，通过观察屏幕截图（当前环境观察）和回顾历史操作，来理解当前状态并决定下一步的行动（采用 Qwen 的函数调用格式）。在每个决策步骤中，模型会从预定义的动作空间中选择最合适的动作。值得一提的是，为了提升模型的适应性和处理复杂任务的能力，GUI-Owl在执行任何实际动作之前，都会<b>先进行“推理”（Reasoning）</b>。这种显式的推理过程，使得模型能够更好地适应动态和复杂的GUI环境。同时，<b>为了避免对话历史过长，模型还会生成一个简洁的“结论”来概括当前步骤的关键信息，并将其存储在历史上下文中</b>，确保了长期交互的效率。最终，GUI-Owl输出的抽象动作会被翻译成具体的设备操作命令，例如针对Android设备的ADB命令，或针对桌面环境的pyautogui代码，从而实现对GUI的精准控制。</div><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-266c0110d331805ea958e8a261f416e9"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3Afdb8da55-5fb0-4d56-9034-58ed093e9f69%3Aimage.png?table=block&amp;id=266c0110-d331-805e-a958-e8a261f416e9&amp;t=266c0110-d331-805e-a958-e8a261f416e9" alt="notion image" loading="lazy" decoding="async"/></div></figure><div class="notion-text notion-block-260c0110d33180c39f2fdb240d35787b">GUI-Owl的另一个重要特性是其在多智能体框架中的灵活性。它<b>不仅可以作为一个独立的智能体完成任务，还可以作为Mobile-Agent-v3框架中的一个专业模块，与其他智能体协同工作，共同解决更复杂、更长期的自动化工作流</b>。这种模块化和协作能力，为构建更高级的GUI自动化系统提供了可能。</div><div class="notion-text notion-block-266c0110d3318025890ff9c3bd9f41fc">&lt;ins/&gt;</div><h4 class="notion-h notion-h3 notion-h-indent-2 notion-block-260c0110d33180bfa903dc3747209220" data-id="260c0110d33180bfa903dc3747209220"><span><div id="260c0110d33180bfa903dc3747209220" class="notion-header-anchor"></div><a class="notion-hash-link" href="#260c0110d33180bfa903dc3747209220" title="创新一：大规模环境基础设施与自我进化轨迹生产"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>创新一：大规模环境基础设施与自我进化轨迹生产</b></span></span></h4><div class="notion-text notion-block-260c0110d33180b3b2a8c297fe53c6f9">传统的GUI自动化数据收集往往依赖于耗时耗力的人工标注，这极大地限制了模型训练的规模和多样性。Mobile-Agent-v3团队为了解决这一瓶颈，构建了一个大规模环境基础设施，并在此基础上提出了<b>Self-Evolving GUI Trajectory Production（自我进化GUI轨迹生产）</b>框架。这一创新是Mobile-Agent-v3能够实现高性能的关键之一。</div><div class="notion-text notion-block-260c0110d33180dfa95ae17d45fd0bf8">该基础设施充分利用了云计算的优势，在阿里云上部署了大量的云手机和云计算机，从而能够模拟并支持Android、Ubuntu、macOS和Windows等多种主流操作系统环境。这意味着研究人员可以在一个高度可控且动态变化的虚拟环境中，进行大规模的GUI交互数据收集和模型训练，极大地提升了实验效率和数据多样性。</div><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-266c0110d33180dc812dfcfec91f26ef"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3Ace6d4482-8100-46c0-800c-fcaee0ed8671%3Aimage.png?table=block&amp;id=266c0110-d331-80dc-812d-fcfec91f26ef&amp;t=266c0110-d331-80dc-812d-fcfec91f26ef" alt="notion image" loading="lazy" decoding="async"/></div></figure><div class="notion-text notion-block-260c0110d33180a0a461f79edc230526"><b>自我进化GUI轨迹生产</b>pipeline是这一基础设施的核心。它通过一个精巧的自动化流程，实现了高质量交互数据的持续生成和优化，具体包括以下四个关键环节：</div><ol start="1" class="notion-list notion-list-numbered notion-block-260c0110d33180578709d321658e4dc2" style="list-style-type:decimal"><li><b>高质量查询生成（High-quality Query Generation）</b>：系统能够模拟真实用户的行为模式，自动生成多样化且具有挑战性的交互查询。这些查询旨在覆盖各种复杂的GUI操作场景，例如特定应用程序内的多步骤任务、跨应用程序的协作任务，以及需要复杂逻辑判断的场景。通过精细设计的查询模板和生成策略，确保了生成数据的广度和深度。</li></ol><ol start="2" class="notion-list notion-list-numbered notion-block-260c0110d33180f98bc0c22f8680ba80" style="list-style-type:decimal"><li><b>模型试运行（Model Rollouts）</b>：在虚拟环境中，GUI-Owl和Mobile-Agent-v3会根据生成的查询进行实际操作，产生一系列的交互轨迹。这个过程是全自动的，模型会尝试完成任务，并记录下每一步的观察（屏幕截图）和执行的动作。这些轨迹包含了模型在不同场景下的决策过程和执行结果，是后续数据处理的基础。</li></ol><ol start="3" class="notion-list notion-list-numbered notion-block-260c0110d33180ab965ddceff7d57857" style="list-style-type:decimal"><li><b>严格的正确性判断（Rigorous Correctness Judgment）</b>：系统内置了强大的评估机制，能够对生成的轨迹进行严格的正确性判断。这不仅仅是简单的任务成功与否的判断，还包括对轨迹的效率、合理性以及是否符合预期行为的评估。<b>只有高质量、符合预期的交互数据才会被纳入训练集</b>，从而避免了低质量数据对模型性能的负面影响。这种机制有效地过滤了无效或错误的轨迹，保证了数据质量。</li></ol><ol start="4" class="notion-list notion-list-numbered notion-block-260c0110d3318029906de9554a1beb70" style="list-style-type:decimal"><li><b>特定查询指导生成（Query-specific Guidance Generation）</b>：该模块借助成功的轨迹创建引导，以提高模型性能。这一过程包含以下步骤：<b>(1) 动作描述</b>：VLM 依据参考轨迹，针对每个动作的结果生成描述。其输入包括动作前后的屏幕截图以及动作决策。对于基于坐标的动作，作者会突出交互点，帮助 VLM 进行分析。<b>(2) 质量控制</b>：针对模型生成的轨迹，VLM 会参照模型的决策依据，验证步骤的有效性，筛选掉次优动作。<b>(3) 引导合成</b>：将动作描述串联起来，输入到 LLM 中，由该模型总结完成查询所需的关键步骤，进而生成特定查询引导。这些指导可以帮助模型更好地理解任务，并在后续的试运行中生成更优的轨迹。例如，当模型在某个特定步骤陷入困境时，系统可以提供额外的提示或示范，引导模型走出困境，从而生成更完整的成功轨迹。</li></ol><div class="notion-text notion-block-260c0110d3318021a87dcad7696a232e">这种“自我进化”的机制形成了一个强大的正反馈循环：模型生成数据，数据反哺模型，模型能力提升后又能生成更高质量的数据。这不仅显著减少了对人工标注的依赖，还使得Mobile-Agent-v3能够持续地学习和适应新的GUI环境和任务，从而在不断变化的应用场景中保持领先地位。这种数据生成范式对于解决GUI自动化领域长期存在的数据稀缺问题具有重要意义。</div><h4 class="notion-h notion-h3 notion-h-indent-2 notion-block-260c0110d3318031be99d22fa244032d" data-id="260c0110d3318031be99d22fa244032d"><span><div id="260c0110d3318031be99d22fa244032d" class="notion-header-anchor"></div><a class="notion-hash-link" href="#260c0110d3318031be99d22fa244032d" title="创新二：多样化的基础智能体能力构建"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>创新二：多样化的基础智能体能力构建</b></span></span></h4><div class="notion-text notion-block-266c0110d331801988d9f32f137e1ee5">GUI-Owl 不仅能作为原生智能体，独立与 GUI 进行交互，还提供多种基础能力，以支持下游的独立调用，或集成到多智能体框架中。为此，作者收集并构建了各类能力（如<b>定位（grounding）、图像 caption 和 planning</b>）的数据集。在训练过程中，<b>这些数据集会与通用指令数据混合。</b>作者发现，该模型<b>不仅具备零样本 GUI 问答能力，还能针对未见任务，具备通用的指令遵循能力。</b></div><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-266c0110d331803d935af1997de63424"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3A9ea0bff2-9804-41d8-be9f-4aea85a0ca63%3Aimage.png?table=block&amp;id=266c0110-d331-803d-935a-f1997de63424&amp;t=266c0110-d331-803d-935a-f1997de63424" alt="notion image" loading="lazy" decoding="async"/></div></figure><div class="notion-text notion-block-260c0110d3318003868af79806fe0b5b">为了使GUI-Owl具备更强大的泛化能力和适应性，研究团队在数据构建方面下足了功夫，引入了多个下游数据构建pipeline，旨在全面提升智能体的基础UI能力。这些能力是GUI-Owl能够理解复杂GUI环境并执行精细操作的基石。</div><ol start="1" class="notion-list notion-list-numbered notion-block-260c0110d331802182bfea80981d2b3a" style="list-style-type:decimal"><li><b>UI元素定位（Grounding）pipeline</b>：</li><ol class="notion-list notion-list-numbered notion-block-260c0110d331802182bfea80981d2b3a" style="list-style-type:lower-alpha"><ul class="notion-list notion-list-disc notion-block-260c0110d33180cd9ed8e8556c097a98"><li><b>目标</b>：使GUI-Owl能够精确识别和定位屏幕上的任何UI元素，无论是基于其功能（如“提交按钮”）、外观（如“蓝色方框”）还是布局（如“左上角的图标”）。</li></ul><ul class="notion-list notion-list-disc notion-block-260c0110d3318043838ef15559d8bc5d"><li><b>实现细节</b>：通过构建包含大量UI元素及其对应位置、属性信息的数据集，训练模型将自然语言描述与屏幕上的视觉元素进行关联。这包括对按钮、文本框、图片、链接等各种UI组件的精确识别和边界框定位。此外，<b>还支持细粒度的单词/字符定位</b>，这意味着模型不仅能识别一个按钮，还能识别按钮上的具体文字，这对于需要精确文本交互的任务至关重要。</li></ul><ul class="notion-list notion-list-disc notion-block-260c0110d331800d90c2d21c32fc10ab"><li><b>重要性</b>：<b>精确的定位能力是GUI自动化的基础</b>，没有它，智能体就无法知道要操作哪个元素，也无法理解界面上各个组件的含义。</li></ul></ol></ol><ol start="2" class="notion-list notion-list-numbered notion-block-260c0110d33180248ef2d496269dd639" style="list-style-type:decimal"><li><b>任务规划（Task Planning）pipeline</b>：</li><ol class="notion-list notion-list-numbered notion-block-260c0110d33180248ef2d496269dd639" style="list-style-type:lower-alpha"><ul class="notion-list notion-list-disc notion-block-260c0110d33180fbbd73c13b22be738b"><li><b>目标</b>：让GUI-Owl能够将复杂、长期的任务分解为一系列可执行的子步骤，并理解这些步骤之间的逻辑关系，从而实现高效的任务完成。</li></ul><ul class="notion-list notion-list-disc notion-block-260c0110d33180c6a4eecebfd04cc697"><li><b>实现细节</b>：研究团队从大量的成功历史轨迹中提炼出程序化知识，并结合LLM的强大推理能力，构建了任务规划数据集。这些数据包含了从高层任务目标到具体操作序列的映射，例如“预订机票”可能被分解为“打开订票应用”、“选择出发地和目的地”、“选择日期”、“选择航班”等一系列子任务。这使得模型能够学习到在不同场景下完成任务的最佳路径和策略，即使面对跨应用程序协作（如从邮件中提取信息并在浏览器中搜索）的任务也能有效应对。</li></ul><ul class="notion-list notion-list-disc notion-block-260c0110d33180eebb3ae458305b76b3"><li><b>重要性</b>：<b>规划能力是智能体处理复杂任务的关键</b>，它决定了智能体能否高效、准确地完成多步骤操作，尤其是在需要多轮交互和状态转换的场景下。</li></ul></ol></ol><ol start="3" class="notion-list notion-list-numbered notion-block-260c0110d331807387aaf80eb35e4659" style="list-style-type:decimal"><li><b>动作语义（Action Semantics）pipeline</b>：</li><ol class="notion-list notion-list-numbered notion-block-260c0110d331807387aaf80eb35e4659" style="list-style-type:lower-alpha"><ul class="notion-list notion-list-disc notion-block-260c0110d33180dda1bff93a2736d9a0"><li><b>目标</b>：使GUI-Owl能够理解其执行的每个动作所带来的界面变化和潜在影响，从而形成对环境的深刻理解。</li></ul><ul class="notion-list notion-list-disc notion-block-260c0110d331805794a1cb6002a7e741"><li><b>实现细节</b>：通过捕捉动作执行前后的UI观察（屏幕截图），模型学习动作与状态转换之间的因果关系。例如，点击一个按钮后，界面可能会出现新的弹窗、内容更新、页面跳转等变化，模型需要理解这种变化是由于其点击动作引起的，并能预测不同动作可能导致的结果。这<b>有助于模型建立一个内部的世界模型，从而进行更深层次的推理和反思。</b></li></ul><ul class="notion-list notion-list-disc notion-block-260c0110d33180c9afd2cf316c425618"><li><b>重要性</b>：<b>理解动作语义有助于模型进行更深层次的推理和反思</b>，从而避免无效操作，并在出现错误时进行自我纠正，提升了智能体的鲁棒性和适应性。</li></ul></ol></ol><div class="notion-text notion-block-260c0110d33180249f73d419e7d2f2d6">除了上述三种核心能力，研究团队还特别关注了<b>推理与反思（Reasoning and Reflecting）</b>能力的构建。他们通过多种数据合成技术，如离线提示引导拒绝采样（offline hint-guided rejection sampling）、从多智能体框架中蒸馏知识（distillation from a multi-agent framework）以及迭代在线拒绝采样（iterative online rejection sampling），来生成丰富的推理和反思数据。这种监督机制使得GUI-Owl不仅能够进行独立的逻辑推理，还能在Mobile-Agent-v3这样的多智能体框架中，与其他智能体进行复杂的协作推理，并根据其在框架中扮演的角色调整其推理风格。这极大地增强了GUI-Owl在面对未知或复杂情况时的适应性和鲁棒性，使其能够处理更具挑战性的开放式任务。</div><div class="notion-text notion-block-266c0110d3318023a3caea5ec59c252c">&lt;ins/&gt;</div><h4 class="notion-h notion-h3 notion-h-indent-2 notion-block-260c0110d3318010a7c0c5a91a1a22d4" data-id="260c0110d3318010a7c0c5a91a1a22d4"><span><div id="260c0110d3318010a7c0c5a91a1a22d4" class="notion-header-anchor"></div><a class="notion-hash-link" href="#260c0110d3318010a7c0c5a91a1a22d4" title="创新三：可扩展的环境强化学习与TRPO"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>创新三：可扩展的环境强化学习与TRPO</b></span></span></h4><div class="notion-text notion-block-260c0110d33180cea56eca8b1c139a1b">为了进一步提升GUI-Owl在真实世界GUI自动化任务中的表现，研究团队引入了强化学习技术。他们开发了一个高度可扩展的训练框架，其核心在于一个统一的多任务训练接口，该接口能够标准化单轮推理任务和多轮智能体任务之间的交互。这一设计使得模型能够在一个统一的范式下学习不同复杂度的任务。</div><div class="notion-text notion-block-260c0110d3318084a79ac9c522ca019f">该框架的一个关键创新是<b>将经验生成与策略更新解耦</b>。这意味着模型在与环境交互生成经验（即操作轨迹）的同时，可以独立地进行策略更新。这种解耦提供了对策略遵循的细粒度控制，使得训练过程更加灵活和高效。更重要的是，这种设计支持<b>完全异步训练</b>，极大地加速了训练过程，并能更好地将模型的决策与实际用户在真实世界中的使用习惯对齐，从而提升了模型的实用性和泛化能力。</div><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-266c0110d33180c2ab73ee6d67165ce1"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3A3b79cf3d-e26a-4df1-a937-baae5dc08443%3Aimage.png?table=block&amp;id=266c0110-d331-80c2-ab73-ee6d67165ce1&amp;t=266c0110-d331-80c2-ab73-ee6d67165ce1" alt="notion image" loading="lazy" decoding="async"/></div></figure><div class="notion-blank notion-block-266c0110d3318098b722faa64f5e6e55"> </div><div class="notion-text notion-block-260c0110d331800b8be5ca0d905540ad">在强化学习领域，处理长且可变长度的动作序列一直是一个挑战，尤其是在在线环境中。传统的强化学习方法在处理稀疏和延迟奖励时往往效率低下。为了解决这一问题，论文引入了<b>轨迹感知相对策略优化（Trajectory-aware Relative Policy Optimization, TRPO）</b>。</div><span role="button" tabindex="0" class="notion-equation notion-equation-block"><span></span></span><div class="notion-text notion-block-266c0110d33180ff9a9afa65c2ae3078">其中， <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 为批次中 token 的总数， <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 是轨迹 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 的轨迹级优势，而 <span role="button" tabindex="0" class="notion-equation notion-equation-inline"><span></span></span> 是当前策略与旧策略下一个 token 的概率比。这种经过裁剪的目标函数，在稳定训练的同时，能够有效利用整体轨迹级奖励信号，以应对长期的 GUI 自动化任务。
</div><div class="notion-text notion-block-266c0110d331808fba28f085671deec7">TRPO是一种新颖的强化学习算法，它具有以下特点：</div><ul class="notion-list notion-list-disc notion-block-260c0110d33180c89289f97801b20338"><li><b>轨迹级别奖励（Trajectory-level Rewards）</b>：TRPO不再仅仅关注单个时间步的奖励，而是利用整个轨迹的奖励信息来计算每个时间步的优势（advantage）。具体来说，它使用轨迹的准确性和格式奖励之和来计算一个归一化的优势估计，并将这个优势均匀地分配给轨迹中的每一个动作。这种全局视角使得模型能够更好地理解长期行为对最终结果的影响，从而做出更明智的决策，尤其是在GUI自动化这种任务成功往往需要一系列正确操作的场景中。</li></ul><ul class="notion-list notion-list-disc notion-block-260c0110d3318089b5cdc0116de14d57"><li><b>重放缓冲区（Replay Buffer）</b>：为了提高强化学习的稳定性和数据利用效率，TRPO采用了重放缓冲区。它将历史上<b>成功的轨迹</b>存储起来，并在训练过程中随机采样这些经验进行学习。这有助于打破数据之间的相关性，减少训练过程中的方差，并使得模型能够从更广泛的经验中学习，从而加速收敛并提高策略的稳定性。</li></ul><ul class="notion-list notion-list-disc notion-block-260c0110d3318054b3adda71c111425e"><li><b>策略优化目标</b>：对于高分辨率的GUI屏幕截图，完整的轨迹会被分割成单步数据实例用于策略更新。损失函数会根据原始轨迹中的总步数进行缩放，以平衡优化过程。这种细致的优化策略确保了模型在处理复杂视觉信息和长序列操作时的有效性。</li></ul><div class="notion-text notion-block-260c0110d33180158be8fe817c2f17c1">通过TRPO，GUI-Owl能够更有效地从实际交互中学习和优化其行为策略，尤其是在面对那些需要一系列复杂、连续操作才能完成的GUI自动化任务时。这种强大的强化学习能力，使得Mobile-Agent-v3在处理真实世界中的动态和不确定性方面表现出色，为构建鲁棒的GUI智能体提供了坚实的技术支撑。</div><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-266c0110d331804aa49adeb022d12f4e"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3Ae99e8cc6-6670-4caa-91ca-384a364acd18%3Aimage.png?table=block&amp;id=266c0110-d331-804a-a49a-deb022d12f4e&amp;t=266c0110-d331-804a-a49a-deb022d12f4e" alt="notion image" loading="lazy" decoding="async"/></div></figure><div class="notion-text notion-block-266c0110d33180dcb964d160a7a372f1">&lt;ins/&gt;</div><h3 class="notion-h notion-h2 notion-h-indent-1 notion-block-260c0110d3318028a893c3afa827cfe1" data-id="260c0110d3318028a893c3afa827cfe1"><span><div id="260c0110d3318028a893c3afa827cfe1" class="notion-header-anchor"></div><a class="notion-hash-link" href="#260c0110d3318028a893c3afa827cfe1" title="Mobile-Agent-v3：协同工作的多智能体框架"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>Mobile-Agent-v3：协同工作的多智能体框架</b></span></span></h3><div class="notion-text notion-block-260c0110d33180c794d5e96c205c2756">Mobile-Agent-v3不仅仅是一个单一的GUI-Owl模型，它更是一个精巧设计的<b>多智能体框架</b>，通过协调多个专门的智能体来进一步提升GUI-Owl的性能，以应对更复杂、更长期的自动化工作流。这个框架将复杂的任务分解给不同的智能体，每个智能体各司其职，并通过协作机制共同完成目标。</div><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-266c0110d33180068d34fe37dd866c3c"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3Ad705b4f3-1234-44ae-8dec-fe30a9efdca6%3Aimage.png?table=block&amp;id=266c0110-d331-8006-8d34-fe37dd866c3c&amp;t=266c0110-d331-8006-8d34-fe37dd866c3c" alt="notion image" loading="lazy" decoding="async"/></div></figure><div class="notion-text notion-block-266c0110d33180148eb1ff80cb4b0a88">Mobile-Agent-v3框架主要由以下四个核心智能体组成：</div><ol start="1" class="notion-list notion-list-numbered notion-block-260c0110d3318026adf7cfe4b1b816c9" style="list-style-type:decimal"><li><b>管理智能体（Manager Agent, M）</b>：</li><ol class="notion-list notion-list-numbered notion-block-260c0110d3318026adf7cfe4b1b816c9" style="list-style-type:lower-alpha"><ul class="notion-list notion-list-disc notion-block-260c0110d3318055810ee45d21a9444c"><li><b>角色</b>：战略规划者。</li></ul><ul class="notion-list notion-list-disc notion-block-260c0110d331806ca9ece935c7fc8945"><li><b>职责</b>：<b>负责将用户给定的高层指令分解为一系列有序的子目标列表。</b>它利用外部知识（通过检索增强生成RAG模块，例如使用维基百科、搜索引擎和用户提供的文档）来获取相关信息，并<b>动态地根据执行结果和反馈更新规划。</b>这意味着Manager Agent能够根据任务的进展和遇到的问题，灵活调整后续的步骤，确保任务能够顺利进行。</li></ul></ol></ol><ol start="2" class="notion-list notion-list-numbered notion-block-260c0110d33180b2bfffed7f8b8bd011" style="list-style-type:decimal"><li><b>工作智能体（Worker Agent, W）</b>：</li><ol class="notion-list notion-list-numbered notion-block-260c0110d33180b2bfffed7f8b8bd011" style="list-style-type:lower-alpha"><ul class="notion-list notion-list-disc notion-block-260c0110d331801ba5cfde5e7d265ff4"><li><b>角色</b>：战术执行者。</li></ul><ul class="notion-list notion-list-disc notion-block-260c0110d331806fbdbcc13345124813"><li><b>职责</b>：根据Manager Agent提供的子目标，结合当前的GUI状态、历史反馈和累积的笔记，选择并执行最相关的可操作子目标。它会生成一个动作元组，其中包含其<b>思考过程（thought）、具体的动作命令（action command）以及对当前步骤的总结（summary）</b>。Worker Agent是直接与GUI环境交互并执行操作的智能体，它将GUI-Owl的能力转化为实际的GUI操作。</li></ul></ol></ol><ol start="3" class="notion-list notion-list-numbered notion-block-260c0110d331802ba39de39fadd79960" style="list-style-type:decimal"><li><b>反思智能体（Reflector Agent, R）</b>：</li><ol class="notion-list notion-list-numbered notion-block-260c0110d331802ba39de39fadd79960" style="list-style-type:lower-alpha"><ul class="notion-list notion-list-disc notion-block-260c0110d3318009b5d7cea9c991b786"><li><b>角色</b>：自我纠正机制。</li></ul><ul class="notion-list notion-list-disc notion-block-260c0110d331808db0d1c33aac403043"><li><b>职责</b>：负责评估Worker Agent执行动作后的结果。它会比较Worker Agent预期的结果与实际的界面状态变化，将结果分类为成功、中立或有害，并生成详细的因果反馈。Reflector Agent的关键作用在于提供实时的、有指导性的反馈，帮助系统识别并纠正错误，从而提升整体的鲁棒性和学习效率。</li></ul></ol></ol><ol start="4" class="notion-list notion-list-numbered notion-block-260c0110d33180a6a7a9d0e1c1530582" style="list-style-type:decimal"><li><b>笔记智能体（Notetaker Agent, C）</b>：</li><ol class="notion-list notion-list-numbered notion-block-260c0110d33180a6a7a9d0e1c1530582" style="list-style-type:lower-alpha"><ul class="notion-list notion-list-disc notion-block-260c0110d33180c1b8cefca7808c790d"><li><b>角色</b>：持久化上下文记忆维护者。</li></ul><ul class="notion-list notion-list-disc notion-block-260c0110d331809583fad9ad419c13b4"><li><b>职责</b>：仅在Reflector Agent判断为成功或中立时被触发。它负责从当前屏幕中提取并存储关键元素作为笔记，从而维护一个持续的上下文记忆。这些累积的记忆（包括关键UI元素、任务进展等）将支持Manager Agent未来的规划和Worker Agent的执行，避免重复探索和遗忘关键信息。</li></ul></ol></ol><div class="notion-text notion-block-260c0110d3318038b80eeedced533fc1">Mobile-Agent-v3框架以一个循环的方式运作：从用户指令开始，Manager Agent初始化规划，然后Worker Agent执行动作，Reflector Agent评估结果，Notetaker Agent更新记忆，最后Manager Agent根据反馈更新规划，直到任务完成或达到预设的停止条件。这种精巧的多智能体协作机制，使得Mobile-Agent-v3能够处理单一智能体难以完成的复杂、长周期和需要持续适应的任务，展现了多智能体系统在GUI自动化领域的巨大潜力。</div><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-266c0110d33180d8ac90d264c08e6341"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3Aea55f669-d82a-48ae-94e6-713299ccdcc3%3Aimage.png?table=block&amp;id=266c0110-d331-80d8-ac90-d264c08e6341&amp;t=266c0110-d331-80d8-ac90-d264c08e6341" alt="notion image" loading="lazy" decoding="async"/></div></figure><div class="notion-text notion-block-266c0110d33180cea2a2d75432c92ece">&lt;ins/&gt;</div><h3 class="notion-h notion-h2 notion-h-indent-1 notion-block-260c0110d33180a4bad1e1b333132d6c" data-id="260c0110d33180a4bad1e1b333132d6c"><span><div id="260c0110d33180a4bad1e1b333132d6c" class="notion-header-anchor"></div><a class="notion-hash-link" href="#260c0110d33180a4bad1e1b333132d6c" title="卓越的性能表现"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>卓越的性能表现</b></span></span></h3><div class="notion-text notion-block-260c0110d331801289a0de58e253553d">Mobile-Agent-v3框架及其核心模型GUI-Owl在多个主流GUI自动化基准测试中展现了卓越的性能，证明了其作为基础智能体的强大能力。这些基准测试全面评估了GUI-Owl在UI元素定位、单步决策、通用问答以及在线环境交互等方面的能力。论文通过一系列实验，不仅验证了GUI-Owl和Mobile-Agent-v3的有效性，还深入分析了各项创新技术对性能的贡献。</div><h4 class="notion-h notion-h3 notion-h-indent-2 notion-block-260c0110d33180d08bf2f4430e0ce61b" data-id="260c0110d33180d08bf2f4430e0ce61b"><span><div id="260c0110d33180d08bf2f4430e0ce61b" class="notion-header-anchor"></div><a class="notion-hash-link" href="#260c0110d33180d08bf2f4430e0ce61b" title="1. 端到端模型性能：GUI-Owl的领先地位"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>1. 端到端模型性能：GUI-Owl的领先地位</b></span></span></h4><div class="notion-text notion-block-260c0110d33180628bbcd80ff67a21c8">GUI-Owl作为端到端的多模态GUI智能体，在多个开放源代码模型中取得了新的SOTA（State-of-the-Art）性能。论文主要在以下两个关键基准上进行了评估：</div><ul class="notion-list notion-list-disc notion-block-260c0110d331800c9d4bc04c1b932b53"><li><b>AndroidWorld</b>：这是一个针对Android移动设备GUI自动化任务的基准。GUI-Owl-7B模型在此基准上取得了<b>66.4%</b>的成功率，显著超越了同等规模的其他开源模型。</li></ul><ul class="notion-list notion-list-disc notion-block-260c0110d331806c85a7ef2136705769"><li><b>OSWorld</b>：这是一个涵盖桌面操作系统（如Ubuntu、macOS、Windows）GUI自动化任务的基准。GUI-Owl-7B在此基准上取得了<b>29.4%</b>的成功率，同样表现出强大的泛化能力。</li></ul><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-266c0110d33180a7846adec5dcde23a4"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:528px;max-width:100%;flex-direction:column"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3Af061b1ac-169d-4144-bbfd-50e153089092%3Aimage.png?table=block&amp;id=266c0110-d331-80a7-846a-dec5dcde23a4&amp;t=266c0110-d331-80a7-846a-dec5dcde23a4" alt="notion image" loading="lazy" decoding="async"/></div></figure><div class="notion-text notion-block-260c0110d33180f5a63ff2abe6635c2b">值得注意的是，当GUI-Owl与Mobile-Agent-v3框架结合时，其性能得到了进一步的显著提升：</div><ul class="notion-list notion-list-disc notion-block-260c0110d33180e0a7e0e55d847cae40"><li>在<b>AndroidWorld</b>上，成功率提升至<b>73.3%</b>。</li></ul><ul class="notion-list notion-list-disc notion-block-260c0110d33180ff9978f6b2478a978a"><li>在<b>OSWorld</b>上，成功率提升至<b>37.7%</b>。</li></ul><div class="notion-text notion-block-260c0110d33180fb8598dd0f74a4d598">这充分证明了Mobile-Agent-v3多智能体框架在复杂任务协调和执行方面的强大增益效果，使得GUI-Owl能够更好地发挥其潜力。</div><h4 class="notion-h notion-h3 notion-h-indent-2 notion-block-260c0110d33180e5a931fde2c3896b09" data-id="260c0110d33180e5a931fde2c3896b09"><span><div id="260c0110d33180e5a931fde2c3896b09" class="notion-header-anchor"></div><a class="notion-hash-link" href="#260c0110d33180e5a931fde2c3896b09" title="2. 超越专有模型：GUI-Owl-32B的强大实力"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>2. 超越专有模型：GUI-Owl-32B的强大实力</b></span></span></h4><div class="notion-text notion-block-260c0110d331802fb2faf7cc39abbf94">除了与开源模型的对比，论文还展示了GUI-Owl-32B（更大规模的模型）在性能上甚至超越了一些强大的专有模型，这在GUI自动化领域是一个里程碑式的成就：</div><ul class="notion-list notion-list-disc notion-block-260c0110d331804c9554ca1a25a9c77e"><li><b>MMBench-GUI</b>：这是一个综合性的GUI理解和交互基准。GUI-Owl-32B在此基准上表现出色，其性能优于包括<b>GPT-4o</b>和<b>Claude 3.7</b>在内的所有模型。</li></ul><ul class="notion-list notion-list-disc notion-block-260c0110d33180f395f5d76704758135"><li><b>AndroidControl</b>：这是一个专注于Android设备控制的基准。GUI-Owl-32B同样在此基准上取得了领先地位，再次证明了其在复杂移动GUI操作上的卓越能力。</li></ul><ul class="notion-list notion-list-disc notion-block-260c0110d331802f8bece8e943a7d22e"><li><b>UI元素定位能力</b>：在专门的UI元素定位评估中（如ScreenSpot V2/Pro, OSWorld-G, MMBench-GUI L2），GUI-Owl-32B不仅超越了所有同等规模的开源模型，而且与专有模型相比也具有极强的竞争力，这得益于其精细的Groundingpipeline训练。</li></ul><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-266c0110d33180aa8469ceff80571e74"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3A88476b16-0823-4939-bb97-e5458ff081b9%3Aimage.png?table=block&amp;id=266c0110-d331-80aa-8469-ceff80571e74&amp;t=266c0110-d331-80aa-8469-ceff80571e74" alt="notion image" loading="lazy" decoding="async"/></div></figure><div class="notion-text notion-block-260c0110d33180449720e6f2b3b564d1">这些结果表明，GUI-Owl不仅在开源领域树立了新的标杆，也为整个GUI自动化领域带来了新的可能性，证明了通过大规模数据和先进训练方法，开源模型也能达到甚至超越商业闭源模型的性能。</div><div class="notion-text notion-block-266c0110d3318064bb7efb951789dd49">&lt;ins/&gt;</div><h4 class="notion-h notion-h3 notion-h-indent-2 notion-block-260c0110d3318005bfeff75bfa7d1472" data-id="260c0110d3318005bfeff75bfa7d1472"><span><div id="260c0110d3318005bfeff75bfa7d1472" class="notion-header-anchor"></div><a class="notion-hash-link" href="#260c0110d3318005bfeff75bfa7d1472" title="3. 消融研究与关键技术贡献"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>3. 消融研究与关键技术贡献</b></span></span></h4><div class="notion-text notion-block-260c0110d33180e0abd8dda7b43b7cef">论文还通过详细的消融研究（Ablation Studies）验证了Mobile-Agent-v3中各项关键技术组件的有效性：</div><ul class="notion-list notion-list-disc notion-block-260c0110d331800ebb1dff9cc41fb2b3"><li><b>TRPO策略的有效性</b>：实验结果显示，引入轨迹感知相对策略优化（TRPO）策略显著提升了模型在在线环境中的表现。例如，在OSWorld-Verified基准上，TRPO策略将成功率从<b>27.1%</b>提升到了<b>34.9%</b>以上，这强调了其在处理稀疏奖励和长序列动作方面的优势。</li></ul><ul class="notion-list notion-list-disc notion-block-260c0110d3318096bf68d13ad7c73684"><li><b>在线过滤、重放缓冲区和经验管理</b>：消融研究证实，这些机制对于训练的稳定性和效率至关重要。在线过滤确保了高质量数据的输入，重放缓冲区则有效利用了历史经验，减少了训练过程中的方差，使得模型能够更稳定地学习。</li></ul><ul class="notion-list notion-list-disc notion-block-260c0110d33180a9972ac2eb611362f9"><li><b>历史图像数量和交互步长预算</b>：实验表明，模型的性能与所使用的历史图像数量以及交互步长预算呈正相关。这意味着提供更丰富的上下文信息和允许更长的交互序列，有助于模型做出更准确的决策。</li></ul><ul class="notion-list notion-list-disc notion-block-260c0110d33180ffb97ef8fb7346f3c2"><li><b>推理数据合成</b>：论文详细分析了推理数据合成策略（包括离线提示引导拒绝采样、多智能体框架蒸馏和迭代在线拒绝采样）对GUI-Owl推理能力的增益。这些方法共同作用，逐步增强了GUI-Owl的推理能力，使其能够处理更复杂的逻辑和任务。</li></ul><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-266c0110d33180ffad17cd32b1525888"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3A8827d478-93bc-46aa-9c76-ebbd490c1c95%3Aimage.png?table=block&amp;id=266c0110-d331-80ff-ad17-cd32b1525888&amp;t=266c0110-d331-80ff-ad17-cd32b1525888" alt="notion image" loading="lazy" decoding="async"/></div></figure><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-266c0110d33180c993bedc9c055a6b1e"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3Ac3f40de9-681d-49bf-8079-efcf5d48c6b3%3Aimage.png?table=block&amp;id=266c0110-d331-80c9-93be-dc9c055a6b1e&amp;t=266c0110-d331-80c9-93be-dc9c055a6b1e" alt="notion image" loading="lazy" decoding="async"/></div></figure><div class="notion-text notion-block-260c0110d33180ae96d4ded29a40cb4c">这些深入的实验分析不仅展示了Mobile-Agent-v3和GUI-Owl的卓越性能，也为未来的GUI自动化研究提供了宝贵的经验和方向，证明了其创新方法在提升智能体能力方面的关键作用。</div><h3 class="notion-h notion-h2 notion-h-indent-1 notion-block-260c0110d33180fb9757eede35308eb3" data-id="260c0110d33180fb9757eede35308eb3"><span><div id="260c0110d33180fb9757eede35308eb3" class="notion-header-anchor"></div><a class="notion-hash-link" href="#260c0110d33180fb9757eede35308eb3" title="结论与展望"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title"><b>结论与展望</b></span></span></h3><div class="notion-text notion-block-260c0110d33180ae8107c4edcffc5f3a">Mobile-Agent-v3框架及其核心模型GUI-Owl的发布，无疑为GUI自动化领域注入了新的活力。通过其在<b>大规模环境基础设施</b>、<b>多样化的基础智能体能力构建</b>以及<b>可扩展的环境强化学习</b>这三大方面的创新，研究团队不仅提升了GUI智能体的性能上限，更重要的是，为构建能够真正理解并操作复杂GUI环境的通用智能体奠定了坚实的基础。</div><div class="notion-text notion-block-260c0110d33180419cf3d5bb5bcd65fc">GUI-Owl作为一个端到端的多模态智能体，其在多平台、多任务上的卓越表现，以及在多智能体框架中的灵活集成能力，预示着GUI自动化将不再局限于简单的重复性任务，而是能够处理更具挑战性、需要复杂推理和规划能力的场景。特别是“自我进化GUI轨迹生产”框架的提出，为高质量、大规模的GUI交互数据收集提供了一条可持续的路径，有望解决长期以来困扰该领域的数据瓶颈问题。</div><div class="notion-blank notion-block-260c0110d3318199bc6df8567844a256"> </div><h2 class="notion-h notion-h1 notion-h-indent-0 notion-block-260c0110d33181a289b1c7f37a4cd686" data-id="260c0110d33181a289b1c7f37a4cd686"><span><div id="260c0110d33181a289b1c7f37a4cd686" class="notion-header-anchor"></div><a class="notion-hash-link" href="#260c0110d33181a289b1c7f37a4cd686" title="AI Agents 知识星球"><svg viewBox="0 0 16 16" width="16" height="16"><path fill-rule="evenodd" d="M7.775 3.275a.75.75 0 001.06 1.06l1.25-1.25a2 2 0 112.83 2.83l-2.5 2.5a2 2 0 01-2.83 0 .75.75 0 00-1.06 1.06 3.5 3.5 0 004.95 0l2.5-2.5a3.5 3.5 0 00-4.95-4.95l-1.25 1.25zm-4.69 9.64a2 2 0 010-2.83l2.5-2.5a2 2 0 012.83 0 .75.75 0 001.06-1.06 3.5 3.5 0 00-4.95 0l-2.5 2.5a3.5 3.5 0 004.95 4.95l1.25-1.25a.75.75 0 00-1.06-1.06l-1.25 1.25a2 2 0 01-2.83 0z"></path></svg></a><span class="notion-h-title">AI Agents 知识星球</span></span></h2><div class="notion-text notion-block-260c0110d331813aa949d710393c2548">GUI Agents 技术发展迅猛，想紧跟 GUI/AI agents 技术前沿？我们的知识星球会<b>介绍 Agents 相关的最新项目和工具，并以视频方式解读最新论文</b>，为你开启技术新视野，快来加入吧！</div><div class="notion-sync-block notion-block-260c0110d3318122956bc21e46f27afe"><div class="notion-row notion-block-c9c046ed82664131ae54bf494960163c"><div class="notion-column notion-block-9bfca92ce87b4a2a902c7c1a729bdef6" style="width:calc((100% - (1 * min(32px, 4vw))) * 0.5)"><div class="notion-text notion-block-82a381c6c9884ac19e41aa9d99da6a76">加入知识星球，每周获取会员专享视频👇</div><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-260c0110d331810b9744c1a7d8ae37ce"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/attachment%3Ad1adc9e1-7b6a-453a-a9f3-2e2e826a3b09%3Aimage.png?table=block&amp;id=260c0110-d331-810b-9744-c1a7d8ae37ce&amp;t=260c0110-d331-810b-9744-c1a7d8ae37ce" alt="notion image" loading="lazy" decoding="async"/></div></figure><div class="notion-blank notion-block-da4f816748d54d2fbe76f12d542a6fb1"> </div></div><div class="notion-spacer"></div><div class="notion-column notion-block-3c596795a25f4528adea89c89458d903" style="width:calc((100% - (1 * min(32px, 4vw))) * 0.5)"><div class="notion-text notion-block-a3ae1b26bc1a4c07855cf3305d202f0b">扫码加微信小助手为好友，备注「agent」，小助手会定期邀请入群👇</div><figure class="notion-asset-wrapper notion-asset-wrapper-image notion-block-260c0110d33181c792dac1caa43a8fe7"><div style="position:relative;display:flex;justify-content:center;align-self:center;width:100%;max-width:100%;flex-direction:column;height:100%"><img style="object-fit:cover" src="https://www.notion.so/image/https%3A%2F%2Fprod-files-secure.s3.us-west-2.amazonaws.com%2F9341931a-53f0-48e1-b026-0f1ad17b457c%2Feed2e715-74df-4361-bd15-bc084f0d791f%2Fimage.png?table=block&amp;id=260c0110-d331-81c7-92da-c1caa43a8fe7&amp;t=260c0110-d331-81c7-92da-c1caa43a8fe7&amp;width=337.741455078125&amp;cache=v2" alt="notion image" loading="lazy" decoding="async"/></div></figure></div><div class="notion-spacer"></div></div></div><div class="notion-sync-block notion-block-151c0110d33180b3ba16fe7b239b5be6"><div class="notion-text notion-block-446d571c1ef64379a26332ffa4bf728b"><b>当前星球包含的专享视频包括：</b></div><ul class="notion-list notion-list-disc notion-block-e279ee05d7d84f14867c4426e1c40dbb"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1fcSEBMEzr" target="_blank" rel="noopener noreferrer">AI-Agents 中的上下文工程（Context-Engineering）</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-ba3388c448dc4898b72965d6c8b0f98d"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV13wuozDExH" target="_blank" rel="noopener noreferrer">GUI Agents 最新技术综述（2025）</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-3fb739bf89304e2eab663f887c9d6266"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1EeTvzaEBw" target="_blank" rel="noopener noreferrer">GUI Agent 最新技术：MONDAY—从视频自动构建 GUI Agents 轨迹数据</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-b049f409ac8843daad060dac3491d7cb"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1MVG1zsEB7" target="_blank" rel="noopener noreferrer">GUI Agent 最新技术：InfiGUI-R1—从反应式执行向推理式决策的进阶之路</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-37b926f98a28482b93a183a226f56d3f"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1bmdzYzEty" target="_blank" rel="noopener noreferrer">GUI Agent 最新技术：自动驾驶与具身智能技术能带来哪些启示？</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-f54e2c5bc7e648b2aba39ab1985c65c6"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1uyRhY2EFi" target="_blank" rel="noopener noreferrer">GUI Agent 最新技术：ATLaS—同时提升训练效率和模型泛化性</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-0021ce23ee594382abfbedf06ee3582b"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1gm96YrEQY" target="_blank" rel="noopener noreferrer">GUI Agent 技术分享：DigiQ/VEM—使用 RL 提升模型的泛化能力</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-4f3f5fc916124dfb95912767379db9b9"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1pPFceFE42" target="_blank" rel="noopener noreferrer">UI Agent 技术分享： UI-TARS—利用长期记忆和反思调整迭代优化模型</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-989f4fc28f3243e5b2545363fc5bfae0"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1itwkerEyu" target="_blank" rel="noopener noreferrer">AI Agent 技术分享：Insight-V—探索 VLM 的长链条视觉推理能力</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-279ade68f2e74691befa0fd63d4bd627"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1hZcGe1ELm" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：PC-Agent—提升模型认知能力以便更好完成复杂任务</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-6da2c8d0d77148f988157bc8bca8fb05"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1aKrTY7EWB" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：OS-Genesis—自动合成高质量且多样化的训练数据</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-9e3d811d175f473080c7cccf21ae5e8b"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1u26hY5Eyw" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：PAE-通过自动探索新任务不断扩展模型能力</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-3d22b1de3c97465ea2ae3ca46f7f3322"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1dgCNYXEfa" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：Iris-通过自动构造的数据提升模型效果</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-fc8987322bf84ac883f1723c8fd47fe7"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV17VqfYfEjk" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：Falcon-UI—利用无监督数据预训练 UI Agent 模型</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-0bfba06238534895ad33829d495e0672"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1erqxYhEBc" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：Aguvis-来自 HKU &amp; Salesforce 的大一统训练数据和训练框架</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-16f47cc74840469885af43454f46a8d0"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1U86FY9E1G" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：ShowUI-当前最好的 UI Agents 开源模型，还适用中文 APP？</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-0c0eb8f030cd4a2fa702a8c8adabd98a"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1pjBtYnE6C" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：使用世界模型提升 UI Agents 效果？</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-64ec5513bf7445a38cb55d71224e3705"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV14eU7YWEEs" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：来自华为诺亚方舟实验室的 LiMAC</a></b></span></li></ul><ul class="notion-list notion-list-disc notion-block-20f715d38a624d65acb65337d3f00620"><li><span class="notion-blue"><b><a class="notion-link" href="https://www.bilibili.com/video/BV1c1mpYtEqG" target="_blank" rel="noopener noreferrer">UI Agent 技术分享：来自 LG AI Research 的 Auto-Intent</a></b></span></li></ul><div class="notion-blank notion-block-1fe7ae2650754f9db74d20ee936a5a23"> </div></div><div class="notion-text notion-block-260c0110d33181e8a837d385b0bf6c38">&lt;ins/&gt;</div><div class="notion-blank notion-block-260c0110d33181fcbe35eecbe2c65cd4"> </div></main></div>]]></content:encoded>
        </item>
    </channel>
</rss>