豆包Agent是具备跨应用操作能力的智能体,能识别GUI并模拟点击滑动输入,支持自动订外卖、打车、跨平台任务协同、本地化长期记忆调用及多模态实时交互五大核心功能。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

豆包Agent是一种具备跨应用操作能力的智能体,它能直接在手机系统层识别图形界面元素,并模拟人类点击、滑动与输入行为。以下是其核心功能的具体说明:
一、自动订外卖
豆包Agent可基于用户语音或文字指令,在多个外卖平台间执行比价与下单全流程。该能力依赖系统级UI识别与多App顺序调用权限,无需用户手动切换界面。
1、说出“帮我对比美团、京东秒送、淘宝闪购上黄焖鸡米饭的价格并下单最便宜的那家”;
2、Agent自动依次启动美团外卖、京东秒送、淘宝闪购三个应用;
立即进入“豆包AI人工智官网入口”;
立即学习“豆包AI人工智能在线问答入口”;
3、在每个应用中定位目标商户与商品,提取标价信息;
4、选定最低价订单,跳转至支付页并暂停,等待用户刷脸确认;
5、完成支付后,按指令将订单截图发送至指定微信群。
二、自动打车
豆包Agent支持调用主流出行平台SDK或模拟GUI操作完成叫车任务,涵盖起点设定、终点输入、车型选择及呼叫发起等环节,全程无需人工干预界面操作。
1、发出指令“叫一辆车从公司去机场,提醒我带身份证”;
2、Agent自动打开高德地图或滴滴出行(依预设偏好);
3、读取当前定位设为起点,输入“机场”并触发地点联想补全;
4、选择经济型车型,点击“呼叫”按钮;
5、在订单生成后,向微信置顶联系人发送含车牌号与预计到达时间的消息。
三、跨平台任务协同
该功能体现Agent对多任务流的编排能力,可在一次指令中串联不同App的操作逻辑,形成闭环工作流,例如订餐+通知+清理痕迹的一体化执行。
Doubao-Seedream-5.0-lite是字节跳动发布的最新图像创作模型。该模型首次搭载联网检索功能,能融合实时网络信息,提升生图时效性。同时,模型的聪明度进一步升级,能够精准解析复杂指令和视觉内容。此外,模型在世界知识广度、参考一致性及专业场景生成质量上均有增强,可更好地满足企业级视觉创作需求。
1、指令“订完肯德基吮指原味鸡后,把截图发到‘项目组’群,并从相册删除原图”;
2、Agent先完成外卖平台比价与下单;
3、截取订单成功页面;
4、唤起微信,搜索“项目组”,粘贴截图并发送;
5、进入系统相册,定位该截图文件,执行删除操作。
四、本地化长期记忆调用
豆包Agent在端侧存储用户习惯数据,如常用地址、偏爱餐厅、高频联系人等,使后续指令可省略重复信息,提升任务执行准确率与响应效率。
1、首次设置“公司地址是XX科技园A座12楼”后,系统自动归档为结构化地址条目;
2、后续指令如“订份沙拉送到公司”无需再次输入地址;
3、Agent从本地记忆库提取该地址,直接填入外卖收货栏;
4、若地址变更,用户仅需说“公司搬到B座”,Agent即更新对应字段。
五、多模态实时交互支持
该能力使Agent不仅能处理文本指令,还可解析用户上传的图片内容,并据此触发搜索、比价或下单动作,实现视觉意图到操作行为的直接映射。
1、用户拍摄一张奶茶店菜单照片并上传至豆包助手;
2、Agent识别图中商品名称与价格,定位对应品牌小程序或外卖店铺;
3、自动跳转至该店铺页面,加载识别出的SKU;
4、加入购物车并唤起支付界面;
5、提示用户“已找到图中‘杨枝甘露’,是否现在下单?”


















