美しいスープとセレンでモダンなウェブスクレイピング
Webスクレイピング:Webページからデータを効率的に抽出
このチュートリアルでは、Webページのコンテンツのレンダリング方法と、Python、リクエスト、美しいスープ、セレンを使用してそれを削る方法を説明しています。 ダイナミックコンテンツのスクレイピング、特にコメントに焦点を当てますいつウェブスクレイピングが必要ですか?
Webスクレイピングは、Webページから情報を自動的に取得、解析、抽出します。 APIが利用できないときの最後の手段です。 これらの欠点を考慮してください:
- 脆弱性:
- webページが頻繁に変更され、スクレーパーを壊します。 制限:
- 多くのウェブサイトはスクレイピングを禁止しています パフォーマンス: 大量のデータのスクレイプは、遅くて高価になる可能性があります。
- 現代のWebページの理解 典型的なWebアプリケーションの構造を調べてみましょう。 例として「Vagrantの紹介」記事を使用します。 コンテンツをこするには、最初に関連するHTML要素を見つける必要があります。
ブラウザでは、HTMLソースを表示できます。 「Vagrantの紹介」ソースは、記事のコンテンツ自体とは無関係の模倣されたJavaScriptのかなりの部分を明らかにしています。 小さな抜粋を以下に示します:
これが実際のHTML:
のサンプルです
static vs. dynamic scraping
静的スクレイピング
ダイナミックスクレイピング
ウェブサイトからコメントをこすりましょう(例:Codecanyonコメント)。 Seleniumを使用して、コメントURLに移動します
コメント要素を見つけるには、ページを検査する必要があります(右クリック、「検査」)。 Seleniumのは、非同期負荷を処理するのに役立ちます:
必要なデータがAPIを介して容易に入手できない場合、 このチュートリアルには、Envato Tutsのソフトウェア開発者兼ライターであるEsther Vaatiからの貢献が組み込まれています。from selenium import webdriver
driver = webdriver.Chrome()
driver.get('https://codecanyon.net/item/whatshelp-whatsapp-help-and-support-plugin-for-javascript/42202303/comments')
以上が美しいスープとセレンでモダンなウェブスクレイピングの詳細内容です。詳細については、PHP 中国語 Web サイトの他の関連記事を参照してください。

ホットAIツール

Undresser.AI Undress
リアルなヌード写真を作成する AI 搭載アプリ

AI Clothes Remover
写真から衣服を削除するオンライン AI ツール。

Undress AI Tool
脱衣画像を無料で

Clothoff.io
AI衣類リムーバー

Video Face Swap
完全無料の AI 顔交換ツールを使用して、あらゆるビデオの顔を簡単に交換できます。

人気の記事

ホットツール

メモ帳++7.3.1
使いやすく無料のコードエディター

SublimeText3 中国語版
中国語版、とても使いやすい

ゼンドスタジオ 13.0.1
強力な PHP 統合開発環境

ドリームウィーバー CS6
ビジュアル Web 開発ツール

SublimeText3 Mac版
神レベルのコード編集ソフト(SublimeText3)

ホットトピック











LinuxターミナルでPythonバージョンを表示する際の許可の問題の解決策PythonターミナルでPythonバージョンを表示しようとするとき、Pythonを入力してください...

fiddlereveryversings for the-middleの測定値を使用するときに検出されないようにする方法

PythonのPandasライブラリを使用する場合、異なる構造を持つ2つのデータフレーム間で列全体をコピーする方法は一般的な問題です。 2つのデータがあるとします...

UvicornはどのようにしてHTTPリクエストを継続的に聞きますか? Uvicornは、ASGIに基づく軽量のWebサーバーです。そのコア機能の1つは、HTTPリクエストを聞いて続行することです...

10時間以内にコンピューター初心者プログラミングの基本を教える方法は?コンピューター初心者にプログラミングの知識を教えるのに10時間しかない場合、何を教えることを選びますか...

Investing.comの反クラウリング戦略を理解する多くの人々は、Investing.com(https://cn.investing.com/news/latest-news)からのニュースデータをクロールしようとします。
