4GB运存手机可运行Hermes Agent,需裁剪浏览器、量化向量库、收紧缓存、限制并发:禁用Browserbase/Chromium,改用requests;Qdrant启用磁盘存储与标量量化;提示缓存max_breakpoints设为2、cache_ttl缩至90秒;并发限为1,禁用轨迹持久化。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

4GB运存手机运行Hermes Agent确实吃紧,但并非不可行。关键不是“硬塞”,而是主动裁剪、分时释放、绕开高耗组件。重点控制三类内存大户:浏览器渲染进程、向量库加载、上下文缓存膨胀。
关闭所有图形化浏览器组件
Browserbase 或本地 Chromium 是内存黑洞,单个会话常驻 600MB+,且不会自动释放。在 4GB 设备上必须彻底禁用:
- 注释掉 agent/tools/browser_tool.py 中所有与 launch_browser、new_page 相关的调用链
- 将配置文件 environments/default.yaml 中的 browser_enabled: true 改为 false
- 确保环境变量 BROWSERBASE_API_KEY 和 BROWSERBASE_SESSION_TTL 完全未设置(而非设为空),防止兜底加载
- 改用纯 HTTP 工具链:用 requests_tool 替代网页抓取,用 curl 命令直连 API
强制向量库走磁盘+量化
Qdrant 默认全量载入内存,在 4GB 环境下极易触发 OOM。必须启用磁盘后端和标量量化:
- 定位 vector_store 初始化处(通常在 agent/vector_store.py),确认 QdrantVectorStore 构造参数含:on_disk_payload=True 和 quantization_config=ScalarQuantization()
- 删除旧索引:rm -rf ~/.hermes/qdrant/storage/*(首次启用磁盘模式前必须清空)
- 在 collection 配置中添加:prefer_grpc: True,降低序列化开销
- 实测该组合可将向量库内存峰值从 1.8GB 压至 320MB 左右
收紧提示与会话缓存上限
默认缓存策略面向桌面环境,需手动降级以适配移动端小内存:
- 修改 agent/prompt_caching.py:将 max_breakpoints 从 4 改为 2,cache_ttl 从 "5m" 缩短为 "90s"
- 编辑 tools/memory_tool.py:设 memory_char_limit = 900,user_char_limit = 500
- 禁用模型元数据自动刷新:在 agent/model_metadata.py 中,把 _MODEL_CACHE_TTL 从 3600 改为 300(5分钟)
- 移除 prompt_caching.py 第 42–45 行的 cache_control 注入逻辑,避免冗余标记增加 token 负担
限制并发与禁用轨迹持久化
单核或双核 SoC 无法支撑多路推理并行,必须物理限流:
- 在 main.py 或启动脚本中,硬编码设置:max_concurrent_sessions = 1,task_queue_size = 2
- 进入 config/trajectory_compression.yaml,将 enabled: true 改为 false
- 删除 config/trajectory_cache/ 目录及其全部内容
- 注释掉 main.py 中对 TrajectoryManager 的导入和初始化语句


















