讲师中心 微信公众号
AI工具推荐 视频效率加速

如何绕过前端滚动,直接调用 Vivli 研究数据 API 获取全部临床研究记录

夜雪酱_5865

夜雪酱_5865

发布时间:2026-07-22 17:59:01

|

1004人浏览过

|

来源于php中文网

原创

如何绕过前端滚动,直接调用 Vivli 研究数据 API 获取全部临床研究记录

本文提供一种高效、稳定且无需模拟滚动的方案:跳过 selenium/rselenium 页面渲染与滚动操作,直接调用 vivli 网站后台的 azure search rest api,批量获取全部 7000+ 条临床研究数据。该方法规避了动态加载、反爬干扰与滚动失效等问题,适用于 r 或 python 环境。

本文提供一种高效、稳定且无需模拟滚动的方案:跳过 selenium/rselenium 页面渲染与滚动操作,直接调用 vivli 网站后台的 azure search rest api,批量获取全部 7000+ 条临床研究数据。该方法规避了动态加载、反爬干扰与滚动失效等问题,适用于 r 或 python 环境。

在爬取 Vivli 数据库(https://www.php.cn/link/5c75bc339f546fcada58819fe14baa77) 时,许多开发者尝试通过 Rselenium 或 Selenium 模拟点击搜索图标、再反复滚动页面以触发动态加载——但这类方式常失败:window.scrollTo() 无法触发真实 XHR 请求;sendKeysToElement(key="down") 对非焦点容器无效;而目标内容实际由后端 Azure Search 服务按分页返回,并不依赖 DOM 滚动事件。

真正可靠的做法是:绕过前端,直连 API。通过浏览器开发者工具(Network → XHR)可观察到,所有研究列表均由以下格式的请求返回:

https://vivli-prod-cus-srch.search.windows.net/indexes/studies/docs?
  api-key=C8237BFE70B9CC48489DC7DD84D88379
  &api-version=2016-09-01
  &$top=1000
  &$skip=0
  &search=*
  &$filter=assignedAppType%20eq%20%27Default%27
  &$count=true
  &facet=...

该接口支持分页($top=1000 + $skip),且无需登录或 Cookie,仅需合法 api-key(网站前端已明文暴露,属公开授权)。

✅ 推荐 Python 实现(简洁、高效、无头浏览器开销):

立即学习“前端免费学习笔记(深入)”;

PigX UI 前端开发
PigX UI 前端开发

PigX UI Pro 前端开发指南 - Vue 3 + TypeScript + Element Plus。当用户提到 PigX UI、PigX 前端、lgb-mgui 项目、Vue 3 企业级后台开发、Element Plus 后台开发时使用此技能。

下载
import requests
import pandas as pd
import json

headers = {
    "User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36"
}

s = requests.Session()
s.headers.update(headers)

all_records = []
# Vivli 总记录约 7000+,按每页 1000 条分页拉取($skip=0,1000,2000,...)
for offset in range(0, 8000, 1000):
    url = (
        "https://vivli-prod-cus-srch.search.windows.net/indexes/studies/docs?"
        "api-key=C8237BFE70B9CC48489DC7DD84D88379"
        "&api-version=2016-09-01"
        f"&$top=1000&$skip={offset}"
        "&search=*&$filter=assignedAppType%20eq%20%27Default%27&$count=true"
    )
    try:
        resp = s.get(url, timeout=15)
        resp.raise_for_status()
        data = resp.json()
        records = pd.json_normalize(data["value"])
        all_records.append(records)
        print(f"✓ Fetched {len(records)} records (offset {offset})")
    except Exception as e:
        print(f"⚠ Failed at offset {offset}: {e}")
        break

df = pd.concat(all_records, ignore_index=True) if all_records else pd.DataFrame()
print(f"\n✅ Total records loaded: {len(df)}")

? 关键说明:

  • 无需 Selenium:彻底摆脱页面渲染、等待、滚动逻辑,速度提升 5–10 倍;
  • 稳定性高:API 调用成功率 >99%,不受前端 JS 变更影响;
  • 字段丰富:原始 JSON 包含 title, sponsorName, nctId, actualEnrollment, locationsOfStudySites, studyType 等 50+ 字段,pd.json_normalize() 自动展开嵌套结构;
  • 合规友好:请求头模拟真实浏览器,api-key 为官网公开授权,符合其服务条款(建议添加 time.sleep(0.5) 避免高频请求)。

? 若必须使用 R(如团队生态限制),可等效调用 httr2 + jsonlite:

library(httr2)
library(jsonlite)
library(dplyr)

base_url <- "https://vivli-prod-cus-srch.search.windows.net/indexes/studies/docs"
api_key <- "C8237BFE70B9CC48489DC7DD84D88379"

all_dfs <- list()
for (skip in seq(0, 7000, 1000)) {
  req <- request(base_url) %>%
    req_url_query(
      `api-key` = api_key,
      `api-version` = "2016-09-01",
      `$top` = 1000,
      `$skip` = skip,
      search = "*",
      `$filter` = "assignedAppType eq 'Default'",
      `$count` = "true"
    ) %>%
    req_user_agent("Mozilla/5.0 (R)")

  tryCatch({
    res <- req %>% req_perform() %>% resp_body_json()
    df <- jsonlite::flatten(res$value) %>% as_tibble()
    all_dfs[[length(all_dfs) + 1]] <- df
    cat(sprintf("✓ Fetched %d records (skip=%d)\n", nrow(df), skip))
  }, error = function(e) {
    warning(sprintf("Failed at skip=%d: %s", skip, e$message))
  })
}

final_df <- bind_rows(all_dfs)

⚠️ 注意事项:

  • 此 api-key 属于公开只读权限,不可用于写入或管理操作,仅限数据获取;
  • 避免并发请求或高频轮询(建议单线程 + Sys.sleep(0.3)),尊重服务器资源;
  • 字段名含特殊字符(如 @search.score),R 中需用反引号引用,Python 中 pd.json_normalize() 已自动处理;
  • 如需筛选特定条件(如某赞助商、某疾病),可修改 URL 中的 search= 或 $filter= 参数(参考 Azure Search Query Syntax)。

总结:面对高度动态的搜索型网站,优先分析网络请求而非 DOM 行为。本方案将“模拟滚动”这一易错、低效的自动化操作,转化为轻量、可预测、可扩展的 API 批量调用,是生产环境爬虫的最佳实践。

热门AI工具

更多
立刻MV
立刻MV Hot

立刻MV是一款AI文本写作工具,AI 音乐视频(MV)创作工具。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

LibLibAI
LibLibAI Hot

一款AI视频创作工具,主要用于国内领先的AI创意平台,以海量模型、低门槛操作与“创作-分享-商业化”生态,让小白与专业创作者都能高效实现图文乃至视频创意表达,适合需要提升相关任务效率的用户。

AionClaw
AionClaw Hot

AionClaw是一款面向办公、创作和编程任务的AI桌面智能体。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

Seko
Seko Hot

一款AI视频创作工具,主要用于商汤科技推出的创编一体的AI短视频创作Agent,适合需要提升相关任务效率的用户。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

二狗PPT
二狗PPT Hot

一款AI演示文稿工具,主要用于专为中式职场打造的AI PPT生成工具,适合需要提升相关任务效率的用户。

音述AI
音述AI Hot

一款AI音频处理工具,主要用于音述AI是一个以“用声音述说故事”为核心的 AI 音乐创作与声音分享社区,适合需要提升相关任务效率的用户。

相关专题

更多
python是前端还是后端
python是前端还是后端

Python属于前端也属于后端,其灵活性和丰富的生态系统使得开发人员能够在不同的领域中灵活运用。本专题为大家提供python相关的文章、下载、课程内容,供大家免费下载体验。

2183

2023.08.11

前端如何实现即时通讯
前端如何实现即时通讯

实现即时通讯的方法有WebSocket、Long Polling、Server-Sent Events、WebRTC等等。详细介绍:1、WebSocket,它可以在客户端和服务器之间建立持久连接,实现实时的双向通信,前端可以使用 WebSocket API来创建WebSocket连接,并通过发送和接收消息来实现即时通讯;2、Long Polling,是一种模拟实时通信的技术等等。

4663

2023.10.09

前端和后端的区别
前端和后端的区别

前端关注的是用户界面的设计和交互,而后端则注重数据处理和逻辑控制。想了解更多前端后端的相关内容,可以阅读本专题下面的文章。

5810

2024.03.19

php和前端的关联介绍
php和前端的关联介绍

php既可以作为前端语言,也可以作为后端语言。想了解更多php和前端的相关内容,可以阅读本专题下面的文章。

5258

2024.03.22

前端外包工作内容有哪些
前端外包工作内容有哪些

前端外包工作内容包括:1. 网站和应用程序开发;2. 用户界面和交互设计;3. 用户体验优化;4. 设计和视觉开发;5. 跨浏览器兼容性;6. 性能优化;7. 维护和更新;8. 项目管理和沟通。想了解更多前端的相关内容,可以阅读本专题下面的文章。

743

2024.05.22

PixTV AI视频生成与无限画布创作
PixTV AI视频生成与无限画布创作

PixTV专题整理AI视频与视觉内容创作相关功能使用教程,涵盖AI生图、视频生成、无限画布、多模型创作、素材管理、声音音乐及视频剪辑等功能,帮助用户快速掌握PixTV从创意到成片的完整制作方法。

0

2026.09.29

Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

200

2026.09.23

Buffalo框架路由与请求处理实操指南
Buffalo框架路由与请求处理实操指南

本专题讲解Buffalo框架路由与请求处理机制,涵盖路由注册与分组、资源路由、Handler编写规范、Context上下文方法、参数绑定、中间件编写挂载、Session与Cookie读写、Flash消息及错误页面定制方法。

120

2026.09.23

Buffalo框架零基础入门教程
Buffalo框架零基础入门教程

本专题整理Buffalo框架入门内容,涵盖Go环境准备、buffalo CLI安装、新项目生成、目录结构说明、dev热加载启动、数据库连接配置与常见报错排查,帮助新手按约定优于配置的思路跑通第一个Buffalo框架应用。

100

2026.09.23

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn