爱游戏登录入口围绕爱游戏娱乐网址不断创新,回应用户的真实需求。

精选爱游戏APP内容,爱游戏登录入口与你一同发现更多精彩。

过去两年,众多手机制造商已将大型语言模型集成进移动设备。

“手机是离个人智能助手最近的一块终端”这一观点在现阶段的行业内已形成广泛共识:手机的普及率几乎达到100%,始终伴随用户左右,连接着通信、支付、出行、影像及各类生活服务,占据大部分人90%的使用时长,自然积累了个人最完整的上下文信息。

然而,多数情况下,搭载大模型的手机仅能扮演一个更智能的“语音助手”:能回答问题、总结文档、编辑图片,却难以真正替用户完成一项复杂的任务。

如今,智能体的出现正改变这一局面。

智能体使手机开始具备任务规划、工具调用及长期执行的能力——用户无需再告诉手机每一步的具体操作,只需设定目标,剩余问题由模型去理解、分解,并调用系统功能、应用和服务来完成。

这促使AI手机竞争的重心开始转移——决定用户体验的,不再仅仅是模型的智能程度,而是模型之外的一整套系统:上下文如何组织、记忆如何调用、工具和技能如何编排、图形界面如何操作、任务失败后如何恢复等。

阿里在今年云栖大会上推出的手机智能业务Qwen Intelligence正是这样一套系统。

阿里并不亲自制造手机,Qwen Intelligence也不只是一个模型或一个智能体,而是一套面向手机厂商的AI手机全栈解决方案。它基于千问大模型,为终端厂商提供从底层模型、智能体平台到场景方案的一整套“智能层”。覆盖从用户意图理解、复杂任务规划,到工具调用、跨应用执行、多模态创作、记忆及主动服务等能力,目标是帮助手机从“能理解用户”进一步走向“能替用户把事情办完”。

Qwen Intelligence此次发布了三个智能体方案:Mobile Planner Agent、Mobile Use Agent和Creative Agent,分别对应“规划、操作和创作”。其中,Mobile Planner Agent负责理解复杂需求、分解任务和编排工具;Mobile Use Agent负责实际操控手机,采用“API优先、GUI兜底”的混合模式;Creative Agent则面向图片和多模态内容生成,由规划模型理解需求并自动组织创作流程。

而这每一个智能体背后,都由针对手机专门优化过的千问大模型,以及与之协同适配的Harness进行调度。

对手机厂商而言,这套方案采用模块化交付方式:模型底座、Harness、端云协同、运维与安全能力均可按需接入,厂商也可继续加入自己的工具、技能和系统能力。在AI手机产业链中,阿里希望扮演的并非手机操作系统的替代者,而是操作系统与基础模型之间的一层智能体基础设施。

云栖大会期间,智能涌现与阿里巴巴ATH事业群副总裁、Token Foundry Qwen手机智能负责人许主洪探讨了这套AI手机解决方案,以及他眼中的下一代智能体手机。

以下为智能涌现与许主洪的对话,内容略有编辑。

01. 智能体手机是不可阻挡的趋势

智能涌现: 为何会开辟出Qwen Intelligence这样一个业务,看到了什么样的机遇?

许主洪: 手机智能体这一方向从去年起行业便开始关注,今年真正升温,至今几乎每家手机厂商和大模型厂商都在进行相关布局。手机行业正面临自2007年iPhone发布以来最大的技术变革,我们看到了未来巨大的市场机会。

手机智能体在渗透力、使用深度和商业化收入方面,未来都有机会实现十倍甚至百倍的增长,但今天这一行业仍处于早期阶段,需要大家共同投入。而阿里在此能提供的核心价值,是我们的模型以及AI全栈能力。因此,我们决定孵化Qwen Intelligence这条业务线,期望为行业构建通用的智能平台,从而加速整个AI手机的发展,让体验加速成熟。

智能涌现: 现在的智能设备种类繁多,为何选择手机作为这一业务的载体?手机有何独特优势?

许主洪: 手机已是中国最大规模的个人智能终端,其渗透率几乎达到100%,占据大部分人90%的使用时长,用户90%的上下文也沉淀在手机上。如果未来每个用户都有一个个人AI助理,那么这个助理的大部分交互很可能也发生在手机上。因此,我相信智能体手机是个人智能进入真实世界的第一入口,也是迈向个人ASI的必经之路。

智能涌现: 那有什么特殊难点吗?

许主洪: 手机上的任务更碎片化,意图理解的挑战也更大——在手机场景下,意图经常模糊,用户的查询通常也很短,一般不超过20个字。

手机还有各种传感器,可接收不同模态,包括声音、影像、位置等一系列感知信号,这些都是PC不具备的。这些信号能为手机带来更丰富的上下文,也让手机智能体有机会提供更多主动服务。但这同时对模型和智能体的核心能力提出了更高要求,比如多模态的理解交互,以及如何做出更好的推理决策,这些都是我们在手机场景下需要解决的问题。

此外,手机场景还面临更严格的工程约束,如时延、功耗、成本,这些都比PC严格得多。还有隐私安全问题,这在手机场景下也需要用更严格的标准对待。

智能涌现: “手机助手”这一形态其实一直存在,比如Siri,但过去这类助手并未成为用户使用手机的真正入口。你认为今天是什么变量发生了变化,让手机能成为这样一个入口?

许主洪: 最核心的变量还是整体智能的提升。

手机智能体的能力边界要从完成简单指令任务,到未来能支持更模糊的意图、更多种工具调用、跨应用操作,甚至跨小时跨天的复杂任务。未来随着模型能力的进一步提升,我们觉得离质变的临界点已不远。

实际上,随着智能体能力的提升,用户也在不断被教育,整体用户心智在快速成熟。比如过去两年,我们看到编码智能体已被广泛应用;年初的OpenClaw爆火,也预示着下一阶段智能体的爆发点,很大概率会发生在手机上。

02. 模型和智能体,如何在手机里真正理解用户

智能涌现: 请详细介绍Qwen Intelligence,它是一个什么样的业务?

许主洪: 这是一个我们专为手机场景深度优化的模型与智能体解决方案。

我们的定位很清晰,就是要做toB的解决方案提供商,而非自己制造手机。我们希望通过输出解决方案来赋能手机厂商,共同打造下一代的智能体手机。

因此,我们在行业早期便站出来,围绕我们的千问大模型打造解决方案,牵引行业整体智能的提升。我们希望推动智能体手机的加速发展,让个人智能真正进入真实世界。

智能涌现: 这其实是一个“模型+平台+智能体方案”三个部分组成的解决方案,为何这样设计?这三个部分分别想解决什么问题?

许主洪: 这三部分中,最底层是我们的千问大模型,是专门为手机场景深度优化的智能底座。传统通用模型直接迁移到手机场景是不够的,模型需要针对手机场景做深度优化——它相比通用模型不仅能力更强,性价比也更高。

中间一层是平台层,支持模块化接入。而且,我们不是简单给客户提供一个黑盒的API,而是提供可定制化的平台——比如Harness及客户的一些业务规则,都可定制。此外,我们还提供一站式的运维平台,提升整体运营及迭代效率,期望帮助客户在降低研发与接入成本的同时,满足客户差异化竞争的需求。

最上层是我们的智能体方案。我们提供高价值的垂直场景解决方案,也愿意支持厂商打磨好一些垂类的精品智能体,这样才能更好地满足真实场景下的用户需求。

最后,我想强调安全与隐私方面,这是解决方案落地过程中手机厂商和用户都非常关注的问题。因此,我们也会以最高安全标准设计产品解决方案,以全方位保护确保用户隐私得到最大保障。无论是模型研发、智能体设计,还是整体平台的开发,我们始终严守安全边界。

智能涌现: 为何手机直接接入通用大模型体验不够好?为何要做针对手机的定制化模型?

许主洪: 手机场景有非常特殊的挑战。

我们前面提到,手机用户的需求往往是碎片化的,意图也是模糊的,所以要准确理解用户需求,需要模型从分享的上下文中挖掘用户信息。而这些上下文可能来自手机的不同传感器、不同应用,这与PC有很大不同。

在动作空间方面,差异化也很大。手机有各种系统工具,它是一个高度复杂的智能体环境——如何调用不同应用、不同工具、不同API,挑战非常巨大。

最后,手机对时延、功耗、成本也很敏感。

这些特点对模型的端云协同、闭环执行及操作安全都提出了很高的工程约束要求。这些挑战无法通过其他手段解决,还是得针对模型做深度优化——需要把手机特有的一些场景需求,如端侧感知、工具理解、推理实验需求、思考速度、记忆使用等,都优化进模型。

智能涌现: 具体做了怎样的优化?

许主洪: 在真实业务场景中,不仅评测模型本身的准确率,还要评测具体端到端任务的完成率。我们的手机模型,就是针对手机的这些真实场景做优化,尽可能达到SOTA。

今天,我们端到端任务的成功率超过90%。在移动类评测上,我们也超过了业界最前沿通用模型的能力。

智能涌现: 你提到“端云协同”,具体什么样的任务适合放在端上,什么又适合让云端处理?

许主洪: 长期来看,随着手机芯片算力不断提升,端云协同是必然趋势。我们也相信智能体手机要做好用户体验,背后的架构必须使用端云协同——端侧负责低时延、强隐私的需求,同时兼顾成本;云侧主要处理复杂请求,如基于开放知识的复杂回答,以及长程任务的规划分解等。

短期来看,端侧算力仍相对有限。受限于手机端侧严格的工程约束,端侧模型会更侧重负责一些简单任务,比如简单指令的意图理解执行。但随着端侧算力增强和模型智能提升,以前在云侧完成的一部分任务也会逐步放到端侧闭环。对于整体端云协同的时间成本,未来也会有较大改善。

智能涌现: 要让智能体完成复杂任务,不仅依赖模型,Harness也非常重要。在这个解决方案中,模型和Harness分别解决什么问题?

许主洪: 要完成真实复杂任务,确实需要模型与Harness深度适配。

模型是智能体的智能底座,它需要在开放目标中做到全局理解。今天的模型,你给它一个明确、完整的目标,其分解步骤已做得不错。但若放到真实场景,用户很少会给出非常完整的目标。

比如,用户说“你今天帮我安排去趟北京出差”——这个表达背后涉及很多不同需求和步骤,如订机票、订酒店、改行程、通知同事等,模型需要根据多方面信息,包括消息、偏好、历史对话等,推断简单一句话背后的隐含需求。更难的是,用户中途还会改变想法,比如原来智能体准备订机票,但用户说“算了,我这次坐高铁”,那么模型就需要在这些局部调整中保持对最终目标的理解判断——用户是要修改原计划的一部分,还是重新提出了一个新任务请求。这对模型要求很高。

那么Harness是让整体任务推进的关键模块。它需要维护跨应用、跨会话的任务状态,比如智能体目前做到哪一步、中间结果如何、还差什么等。更关键的是,当某个任务执行过程发生异常时,要怎么办——是继续执行、重试、回退,还是再向用户请求确认。这些都是Harness需要处理的。

此外,要让智能体手机更懂用户,智能体还要维护一套主动服务能力,以及用精细的多层记忆体系做好个性化服务。这时需要用户长短期的身份识别和更丰富的上下文处理,才能做到精准且不打扰用户的主动服务能力。

因此,我们需要提供一个深度优化的整体解决方案,包括模型的智能底座,以及适配模型能力协同进化的一套Harness。这套Harness同时支持用户自己定制一些能力。当模型升级时,这套Harness也会随之适配和优化。比如,模型新增了对某种工具调用的支持,Harness在智能编排上也需要纳入这个新工具。

模型和Harness的协同优化,提高整体智能体的性能,并会随着不断积累用户经验和记忆,持续提升对用户个性化需求的理解。

智能涌现: 模型和Harness的协同优化如何实现?在训练环节就做协同训练吗?

许主洪: 以后训练为主。我们在模型的后训练中要加入智能体环境,让模型能通过智能体的强化学习,学习到环境的各种适配信息。

智能涌现: 所以关键是来自真实场景的任务轨迹数据?

许主洪: 轨迹数据是其中一部分,另一块是要在真实环境中获取一些执行反馈——比如什么时候会出现异常,什么条件下需要调用不同工具、不同技能等。

很多时候,这些东西无法在仿真环境里模拟出来。所以我们除了在仿真环境做训练,也要在真机场景中把模型与智能体Harness的协同做好。

智能涌现: 是不是针对所有要帮用户完成复杂任务的智能体来说,这种协同训练都很有必要?

许主洪: 我觉得是必须的。复杂任务需要智能体跨多个应用、跨多个会话,甚至跨多种场景。这时无论对模型本身的规划能力,还是对智能体的稳定执行,都提高了要求。如果模型和Harness没有协同,很难把事情办好。

智能涌现: 具体到智能体上,为何这次发布了 Planner、Use 和 Creative 三个智能体?

许主洪: 我们是针对手机场景用户的一些核心痛点和需求来思考的。我们认为,目前智能体手机最缺乏的是一个能规划的大脑,这也是最关键的一环;另外除了大脑,还需要一双能执行任务的手,这对应的是我们提出的两个核心智能体:Mobile Planner Agent 和 Mobile Use Agent。

此外,考虑到手机场景中影像类需求非常高频,我们也推出了创作智能体来承接用户表达、创作的核心诉求。

智能涌现: 这三个智能体具体能完成什么?

许主洪: 首先是手机的大脑Mobile Planner Agent,它是一个核心规划中枢,主要解决智能规划问题。

从简单任务到复杂的长程任务,这个智能体需要负责用户意图理解、复杂任务分解、工具编排调用。它的核心能力是精准理解长程规划并能做动态调整。比如用户说“帮我安排周末去上海出差”,它要能分解成订机票、订酒店、设日历、规划路线等一系列子任务。当用户诉求有变化,也要能根据变化做动态调整。

第二个Mobile Use Agent,它主打手机操作,即解决智能执行问题。我们的思路是不单纯依靠GUI操作,而采取混合执行模式——API优先,GUI兜底。当有API的高效路径可用,我们会优先调用API;如果走不通,再考虑GUI操作这个选项。GUI操作我们主要用于常规场景,整体策略是严守安全边界,确保用户隐私得到保障。

最后是我们的Mobile Creative Agent,它是一个影像创作智能体。手机用户对影像需求很大,但要求也很高,比如希望能一句话完成作品。所以我们对这个智能体做了极致优化,包括一些轻量的生成编辑模型,能做到效果领先、速度最快、性价比最高。

这三个智能体虽分开模块设计,但它们又可互相协同——手机大脑负责思考,操作负责执行,而影像承接创意,复杂任务的落地。

智能涌现: 影像创作智能体已是一个较热的赛道,市场上toC、toB产品都有不少,为何选择在这样一个拥挤的赛道中再做一个智能体?优势在哪里?

许主洪: 我们做的是专门针对手机场景的创作智能体,能针对手机场景做深度优化。其实我们做了很多工作,比如针对手机场景设计轻量化的生成、编辑模型。

千问模型在通用创作能力上能达到行业第一梯队,但在手机专属场景里,我们做到了行业领先。整体上,我们能让影像创作在手机上有更好体验——效果更好、速度更快、成本更低。举个简单例子,我们现在做首图生成只需3秒,相比市场上最好的竞品,可提速2倍,性价比也能提升2到3倍。

未来我们也会推出更多影像智能体,覆盖拍摄前、拍摄中、拍摄后整个全流程。解决用户在影像创作方面的需求,还有很多工作可做。

智能涌现: 你觉得在什么情况下,手机可被认为是真正进入智能体手机阶段?目前哪些能力已具备,哪些能力还有很长路要走?

许主洪: 一个重要标准是,是否每个人都能把手机智能体的能力在日常生活中用起来,今天显然没达到。

但就像iPhone从发布第一代到真正全面使用,也经过三四代迭代,智能体手机这个大方向现已非常明确,但还需要很多投入。当模型继续变强,当有更多工具可用,当手机芯片能力进一步提升,我们一定会看到更多用户体验提升。未来两三年,我们会看到手机智能体巨大的爆发趋势。

03. 不下场做手机,只做AI技术解决方案

智能涌现: 你们采用了API优先GUI兜底的交互方式,这是否意味着有多少App愿意开放能力成了这件事能否做成的关键点?

许主洪: 目前手机的应用生态不够统一——有些App有API,更多App仍依赖GUI操作。而用户的真实任务往往需要跨多个应用协同完成。所以我们认为,API+GUI操作的混合模式还会较长时间存在。但我们相信开放是大趋势,主流应用都会慢慢走向API开放。

GUI操作是一个通用调度能力,能解决长尾应用的覆盖问题。所以我们整体策略是“API优先,GUI兜底”——有接口时,我们通过多种方式,如MCP、CLI、deeplink等直接调用应用,缩短执行路径,提升整体效率;没有接口时,我们通过视觉理解、视觉操作等能力覆盖长尾应用。前面提到的Mobile Use Agent会根据任务目标及实施状态动态选择和组合这两种方式。

智能涌现: 关于GUI操作,行业里一直有权限和隐私的争议,你们怎么解决?

许主洪: 在安全隐私方面我们高度重视。我们提出了多种策略对智能体的安全边界进行控制与保护。

第一层,对违法、违规的高风险请求直接拒绝,智能体在动作执行上被直接终止。

第二层,一些关键步骤如需用户确认,我们会让用户接管,比如涉及转账、数据删除、隐私授权等敏感操作,我们会主动叫停,等待用户指示。

第三层,我们会严格遵守应用自己设定的规则。比如有些应用明确不让智能体做自动操作,如自动评论、自动发消息等,我们都会遵守。

最后一层是安全护栏。因为今天模型还做不到百分百完美,我们在真正执行动作前还会经过一层安全护栏,避免智能体在模型理解错误或信息不足的情况下做有风险的操作。

智能涌现: 阿里自己就拥有庞大的App生态,怎样最大限度地把这个阿里生态先用好?

许主洪: 在行业早期,阿里的应用生态确实是Qwen Intelligence与用户之间的一道抓手,我们也支持手机厂商通过应用生态提高渗透率。未来,我们会与厂商一起在一些垂直场景中打磨好精品智能体,满足用户真实需求,让用户能把AI助手在真实场景中用起来。

但长期来看,在手机智能体这个赛道,最重要的还是整体智能的提升。我们还是得围绕阿里的大模型能力,用最好的模型打造出更聪明更懂用户的手机智能体,然后在真实场景中真正把这些模型和智能体的能力落地。

智能涌现: 未来当Qwen Intelligence每天处理大量用户请求时,你们如何平衡自有生态利益和用户利益?比如用户提出一个

Qwen Intelligence负责人许主洪:Agent手机的竞争,不只在模型