先说清这件事
2026年9月,一款手机智能体的消费者版本正式上线,距离它的技术预览版发布,过去了约9个月。它的核心能力不是新的模型,而是一种更笨也更通用的做法:直接识别屏幕上的文字、图标与按钮,再像人一样去点按、滑动和输入。
这带来一个关键区别。多数能「干活」的智能体,取信息的方式是调接口、读网页——互联网上的信息它看得到,装在手机应用里的信息它望尘莫及。而靠屏幕识别的路线,只要一个应用能被人正常操作,它就能尝试理解界面、自己摸索出完成任务的路径。能被人操作的东西,理论上都能被它操作。
从"聊天机器人"到"行动代理"
过去几年,AI产品的形态主要是聊天机器人——你问它答,它给信息但不行动。
豆包手机助手代表的新形态是:AI不仅能理解你的意图,还能像人一样操作App、点击按钮、填写表单、跨应用完成完整任务流。
技术上,它靠的是屏幕识别+通用操作能力——不需要每个App都做专门的接口适配,而是像人一样"看"屏幕上的文字和图标,然后决定点哪里、滑哪里。
这个变化的意义不小。因为过去AI工具的能力边界,基本就卡在"文字交互"这一层。现在AI能动手了,相当于从"顾问"变成了"助理"。
一次出差安排,看清它怎么干活
拿一次出差行程举例,最能看出这类智能体的工作方式。
任务描述很简单:在协作工具里写一份规划文档,记下日期、城市和几个目的地;剩下的——查行程、订机票、订酒店、确认机场到酒店与酒店到会场的通勤时间和方式——全交给它。
它的执行顺序是:先进协作工具读取行程安排,确认出发日期与全部目的地;再把整趟行程拆成一条具体的时间线;然后进预订平台,按出发时间、到达时间与价格条件筛选;最后打开地图,核对每段路程的距离、通勤方式与耗时,重新整理后汇总回来。
过程中有两处细节值得注意。一是遇阻会停下来问:从机场到酒店坐地铁还是打车、酒店订便宜的还是订更近会场的,它不会替人拍板,而是征求意见后再执行。二是敏感动作交还给人:涉及付款、登录这类环节,它主动停下,等确认。
还有一点常被忽略:这些活可以挂在后台执行,不占用使用者正常使用手机的时间。
记忆与偏好:从「听懂指令」到「知道习惯」
比执行更进一步的,是记忆。
使用过程中,它会逐渐记下偏好——比如出差更愿意住离会场近的地方、订机票不喜欢太早的航班;这类信息被保留下来,执行同类任务时会优先满足。使用者也可以主动要求它记住某些关键信息,例如几天后的一场会议。
这件事的意义在于,智能体的价值不只是「听懂这一句话」,而是「不用每句话都说得那么细」。偏好积累得越多,任务描述的负担就越轻。
变强的地方,和撞上的墙
但它并非没有边界。实测下来,问题出在最朴素的地方:能操作的应用太少。
几款日常生活中使用频率最高的应用,它基本都无法调用;一些原本被认为最容易自动化的场景——比如点外卖——反而因为生态限制成了奢望。目前它能稳定操作的,主要是自家生态内的工具,以及少量开放程度较高的第三方应用。
这是一堵无形的墙:技术上它能看懂界面,但生态上它进不去。
不过换个角度看,这堵墙的存在恰恰说明了方向:当智能体开始尝试用「看界面」这种通用方式绕过接口壁垒时,压力会反向传导给整个生态。过去一年,各终端厂商的官方智能功能都在加速迭代,这种提速本身,就是被搅局者推着走的。
AI能操作App了,但它真的"懂"企业吗?
这里有个很现实的问题:AI在帮用户做决策的时候,它的信息来源是什么?
举个例子,用户让AI帮忙订酒店,说"找一家性价比高的商务酒店"。AI需要从海量酒店里筛选——它靠什么判断哪家性价比高?价格?评分?位置?
这些信息,AI都是从公开网络上抓取的。但问题在于:
公开网络上关于企业的信息,不一定是最新的,不一定是完整的,甚至不一定是对的。
这就是行业里常说的"AI幻觉"在企业信息层面的体现:AI会基于它训练数据里的内容,"脑补"出关于某家企业的描述。产品介绍错了、价格信息过时了、业务范围张冠李戴了——这些情况并不少见。
过去,AI幻觉的影响范围还停留在"回答错了"的层面。但当AI开始替用户做决策、执行任务的时候,一个错误的信息认知,就可能直接导致错误的选择。
这也是为什么,企业侧正在出现一种新的自查动作:定期检查主流模型在行业问题里怎么描述这家公司,看名称是否准确、业务边界是否清晰、信息是否停留在旧版本,把错误认知在扩散之前主动修正掉。幻觉不会自己消失,只会随着被引用次数增加而变得更像事实。
据了解,已有企业通过GEO官网搭建方式,将自身知识库结构化呈现,实现AI渠道客资增长,相关方法论可关注公众号「智扣AI」获取。
从AI手机看行业趋势:信息准确性的价值在上升
豆包手机助手的出现,只是AIAgent落地的一个缩影。接下来,会有越来越多的AI工具替用户做筛选、做比较、做决策。
这个趋势下,一个很朴素的判断会越来越成立:
工具层会越来越同质化,但企业自己的信息资产、数据主权、认知准确性,是别人拿不走的。
就像豆包手机助手现在还受限于App生态的围墙一样,AI的能力边界一直在往外扩。等到哪天AI真的能自由操作各种应用了,用户最终选哪个产品、哪家服务,很大程度上取决于AI"记得"你是谁、"怎么描述"你。
结语
回到那款手机智能体。它最值钱的地方,不是把某件事做得更快,而是找到了一种不依赖对方配合的通用路线。
企业面对AI生态时也一样:等待模型自己变准确,是最被动的一种选择;更现实的做法,是把自己那份准确的信息,主动放进AI能读到、能引用、能校对的位置上。
留一个开放问题:当有人向AI打听这家公司时,得到的答案里,有多少是这家公司自己写下的?