在浏览器自动化方向,开发者过去常常需要借助 selenium、playwright 或 puppeteer 等第三方工具,依靠截图分析或底层协议实现对网页的“硬性”控制。最近,阿里巴巴正式开源了一款名为 page agent 的轻量级 javascript 客户端库,为该领域带来了一种全新范式:将自动化行为从外部驱动迁移至页面内部原生执行。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

Page Agent 的核心突破在于“DOM 脱水”机制。与传统方法依赖多模态图像识别不同,它直接运行于目标页面上下文中,将实时 DOM 树压缩为高度简化的纯文本结构——即“FlatDomTree”。这种设计让大模型无需解析复杂视觉信息,仅通过紧凑的语义化文本表示,即可准确识别元素并完成点击、输入等交互任务。

对开发者而言,该方案具备显著工程优势。由于 Page Agent 作为脚本嵌入页面执行,天然继承当前用户的 Cookie、Session 及登录态,大幅降低身份同步与后端对接成本。其架构采用模型中立设计,兼容所有遵循 OpenAI API 规范的大语言模型。在实际落地场景中,无论是 SaaS 应用中的 AI 助手、智能表单填充,还是面向残障用户的无障碍操作增强,Page Agent 均展现出优异的成本效益比与实施效率。
将小说章节转换为电影分镜剧本。用户上传txt/md/docx文本,AI分析场景、角色、情绪、镜头语言,输出专业分镜脚本。适用于用户提及“分镜”“storyboard”“小说转分镜”“影视改编”“镜头脚本”或需要将小说改编为分镜的场景。

尽管 Page Agent 在易集成性和响应速度方面优势突出,项目团队也明确指出了当前的能力边界:现阶段仅支持单页应用(SPA)范围内的操作。此外,基于提示词的权限约束(例如“禁止发起支付请求”)属于软性引导策略,并非强制性的安全隔离层。因此,在涉及资金转移、敏感数据变更等高风险动作时,服务端仍需保留完备的身份校验与业务风控逻辑。
目前,Page Agent 已以 MIT 开源协议发布于 GitHub。对于希望在自有产品中快速集成 AI 驱动的前端交互能力,同时规避昂贵多模态模型训练与推理开销的团队来说,这是一项兼具实用性与扩展性的技术选择。

















