在 macOS 中用 Homebrew 安装网页抓取开发库,需先通过 brew install python 安装 Python 及 pip,再安装 libxml2、libxslt、chromedriver 等系统依赖,最后用 pip install requests beautifulsoup4 lxml selenium playwright 安装 Python 库,并推荐使用 venv 创建隔离环境。
在 macos 中用 homebrew 安装网页抓取(web scraping)开发库,核心是安装 python 环境及相关主流库(如 requests、beautifulsoup4、lxml、selenium、playwright 等),homebrew 本身不直接安装 python 库,但它能高效提供底层依赖和运行环境支持。
先装好 Python 和关键系统依赖
Homebrew 安装的是 Python 解释器及其编译依赖,这是后续 pip 安装抓取库的基础:
- 运行
brew install python—— 这会安装最新稳定版 Python(含pip和venv) - 若需解析 HTML/XML 更快,建议同时装
lxml的系统依赖:brew install libxml2 libxslt - 如要用 Selenium 驱动浏览器,还需装浏览器及对应 driver(例如 Chrome):
brew install --cask google-chromebrew install chromedriver - Playwright 用户推荐:
brew install --cask playwright(自动下载浏览器二进制)
用 pip 安装网页抓取库(在 Homebrew 提供的 Python 环境中)
Homebrew 安装的 Python 已自带 pip,无需额外配置。直接运行:
-
pip install requests beautifulsoup4—— 基础 HTTP 请求 + HTML 解析 -
pip install lxml—— 替代默认解析器,大幅提升bs4解析速度 -
pip install selenium—— 动态页面抓取必备 -
pip install playwright—— 更现代、更稳定的无头浏览器自动化方案 - 可选:加
--user参数避免权限问题(但 Homebrew Python 默认写入安全,通常不需要)
验证是否可用
快速测试一个最小抓取脚本:
python3 -c "import requests; print(requests.get('https://httpbin.org/get').status_code)"
输出 200 即说明 requests 可用;再试:
python3 -c "from bs4 import BeautifulSoup; print(BeautifulSoup('<p>test</p>', 'lxml').text)"
输出 test 表示 lxml + bs4 协同正常。
进阶建议:隔离环境更可靠
避免全局污染,推荐为每个项目建独立虚拟环境:
python3 -m venv myscrapesource myscrape/bin/activatepip install requests beautifulsoup4 lxml
这样不同项目的依赖互不干扰,也方便版本控制与协作。


















