当前位置:首页 >  科技 >  互联网 >  正文

豆包手机助手消费者版发布:AI助手开始看屏幕办事

 2026-09-15 20:29  来源: 互联网   我来投稿 撤稿纠错

  一键部署OpenClaw

9 月 14 日,豆包手机助手消费者版本正式发布。首个消费者版本将搭载在中兴努比亚与字节跳动联合研发的努比亚 NaviX Ultra 上,目前已开启预约,9 月 16 日开售。相比去年底的技术预览版,这一版对外强调的重点是稳定性和日常可用性。对做应用的人来说,这次发布里最有信息量的不是功能清单,而是一份关于操作边界的协议。

唤醒方式有语音和专属 AI 键两种。AI 键支持指纹鉴权,本人验证之后不需要二次解锁就能调用,解决的是「随手按一下会不会误触发」的问题。屏幕问答是这一版的主打。用户不需要截图或者切换应用,直接围绕当前屏幕内容提问或下指令。官方演示里有一个例子:对着室内环境拍一下,说「按这个装修风格帮我选一个一米二以内、一千元以内的柜子」,助手结合画面和条件去电商平台找商品推荐。

本地信息检索在用户主动授权的前提下展开,覆盖电话、相册、短信、便签等数据。用户也可以手动把当前屏幕内容保存下来,方便以后查找。录音能力接入飞书妙记,支持转录、实时翻译、区分说话人和自动总结,还能检索过往录音里的具体内容。任务执行还只是起步。官网显示「豆包智能服务」测试版已接入出行和地图类服务,打车场景可以确认常用地址、选择车型并下单,首批支持的城市有限。

这次发布里最关键的动作是那份屏幕自动化协议。此前预览版里被讨论最多的「操作手机」功能,这一版以测试版形式开放。做法上,豆包推出了一份屏幕自动化操作声明协议,并同步启动为期 30 天的规则公示。协议的核心是:第三方应用可以自主声明操作边界,明确允许或者拒绝 AI 助手在本应用内做屏幕自动化操作;对明确拒绝的应用,助手不会进行自动化操作。

这条规则值得单独拿出来说。图形界面操作的本质是识别页面上的文字、按钮和输入框,再模拟点击、滑动、输入来完成任务——它沿用人的操作流程,但对页面变化、应用限制和用户授权高度依赖。谁来定边界、边界怎么表达,过去没有明确答案。把声明权交给应用方,是一个偏向开发者利益的选择,也给这套能力划了一条可执行的红线。

开发者需要提前想的事有几件。如果你的应用不希望被自动化操作,协议给了表达的渠道,公示期结束后值得按流程声明一次,别等出问题再补。页面结构的重要性也在上升。GUI 操作靠识别页面元素,语义化标签、稳定的元素标识、清晰的可交互区域,会直接影响助手能不能正确完成操作;反过来说,靠不稳定的布局和图片按钮撑起来的界面,会更容易出问题。端侧数据的授权设计得提前想。助手能在系统层面读取电话、相册、短信这类数据,意味着用户对授权范围的敏感度会提高,应用自己的权限申请文案和最小必要原则会被拿来对比。

合规这条线也走完了。公开信息显示,这款机型已从大模型备案到终端入网完成整套合规流程,官方把「AI 智能体手机」作为产品定位。数据方面,官方表示遵循最小必要与用户自主控制原则,采用端云结合方案,并对助手可操作的范围做分层分级管理。手机厂商和模型厂商联手做系统级助手,是这两年最清楚的一条产品路线。它带来的变化不只是多一个入口,而是应用与操作系统之间的交互方式要重新谈一遍——协议、权限、页面结构,都是新的谈判内容。

申请创业报道,分享创业好点子。点击此处,共同探讨创业新机遇!

相关标签
ai手机
ai智能

相关文章

热门排行

信息推荐