


Bereinigen Sie HTML-Inhalte für die Retrieval-Augmented Generation mit Readability.js
Web Scraping ist eine gängige Methode zum Sammeln von Inhalten für Ihre RAG-Anwendung (Retrieval-Augmented Generation). Das Parsen von Webseiteninhalten kann jedoch eine Herausforderung sein.
Mozillas Open-Source-Bibliothek Readability.js bietet eine praktische Lösung zum Extrahieren nur der wesentlichen Teile einer Webseite. Lassen Sie uns die Integration in eine Datenaufnahmepipeline für eine RAG-Anwendung untersuchen.
Unstrukturierte Daten aus Webseiten extrahieren
Webseiten sind reichhaltige Quellen unstrukturierter Daten, ideal für RAG-Anwendungen. Webseiten enthalten jedoch häufig irrelevante Informationen wie Kopfzeilen, Seitenleisten und Fußzeilen. Dieser zusätzliche Inhalt ist zwar nützlich zum Durchsuchen, lenkt jedoch vom Hauptthema der Seite ab.
Für optimale RAG-Daten müssen irrelevante Inhalte entfernt werden. Während Tools wie Cheerio HTML basierend auf der bekannten Struktur einer Website analysieren können, ist dieser Ansatz für das Scraping verschiedener Website-Layouts ineffizient. Um nur relevante Inhalte zu extrahieren, ist eine robuste Methode erforderlich.
Nutzung der Reader View-Funktionalität
Die meisten Browser verfügen über eine Leseransicht, die alles außer dem Titel und Inhalt des Artikels entfernt. Das folgende Bild veranschaulicht den Unterschied zwischen dem Standard-Browsing und dem Lesemodus, der auf einen DataStax-Blogbeitrag angewendet wird:
Mozilla stellt Readability.js, die Bibliothek hinter dem Lesemodus von Firefox, als eigenständiges Open-Source-Modul bereit. Dadurch können wir Readability.js in eine Datenpipeline integrieren, um irrelevante Inhalte zu entfernen und die Scraping-Ergebnisse zu verbessern.
Scraping von Daten mit Node.js und Readability.js
Lassen Sie uns den Scraping-Artikelinhalt aus einem früheren Blogbeitrag über das Erstellen von Vektoreinbettungen in Node.js veranschaulichen. Der folgende JavaScript-Code ruft den HTML-Code der Seite ab:
const html = await fetch( "https://www.datastax.com/blog/how-to-create-vector-embeddings-in-node-js" ).then((res) => res.text()); console.log(html);
Dazu gehört der gesamte HTML-Code, einschließlich Navigation, Fußzeilen und andere auf Websites übliche Elemente.
Alternativ können Sie Cheerio verwenden, um bestimmte Elemente auszuwählen:
npm install cheerio
import * as cheerio from "cheerio"; const html = await fetch( "https://www.datastax.com/blog/how-to-create-vector-embeddings-in-node-js" ).then((res) => res.text()); const $ = cheerio.load(html); console.log($("h1").text(), "\n"); console.log($("section#blog-content > div:first-child").text());
Dies ergibt den Titel und den Artikeltext. Dieser Ansatz setzt jedoch die Kenntnis der HTML-Struktur voraus, was nicht immer machbar ist.
Ein besserer Ansatz besteht in der Installation von Readability.js und jsdom:
npm install @mozilla/readability jsdom
Readability.js arbeitet in einer Browserumgebung und erfordert, dass jsdom dies in Node.js simuliert. Wir können den geladenen HTML-Code in ein Dokument konvertieren und Readability.js verwenden, um den Inhalt zu analysieren:
import { Readability } from "@mozilla/readability"; import { JSDOM } from "jsdom"; const url = "https://www.datastax.com/blog/how-to-create-vector-embeddings-in-node-js"; const html = await fetch(url).then((res) => res.text()); const doc = new JSDOM(html, { url }); const reader = new Readability(doc.window.document); const article = reader.parse(); console.log(article);
Das article
-Objekt enthält verschiedene analysierte Elemente:
Dazu gehören der Titel, der Autor, der Auszug, der Zeitpunkt der Veröffentlichung sowie sowohl HTML (content
) als auch einfacher Text (textContent
). textContent
ist bereit für die Aufteilung, Einbettung und Speicherung, während content
Links und Bilder zur weiteren Verarbeitung behält.
Mit der Funktion isProbablyReaderable
können Sie feststellen, ob das Dokument für Readability.js geeignet ist:
const html = await fetch( "https://www.datastax.com/blog/how-to-create-vector-embeddings-in-node-js" ).then((res) => res.text()); console.log(html);
Ungeeignete Seiten sollten zur Überprüfung markiert werden.
Integration der Lesbarkeit mit LangChain.js
Readability.js lässt sich nahtlos in LangChain.js integrieren. Das folgende Beispiel verwendet LangChain.js, um eine Seite zu laden, Inhalte mit MozillaReadabilityTransformer
zu extrahieren, Text mit RecursiveCharacterTextSplitter
zu teilen, Einbettungen mit OpenAI zu erstellen und Daten in Astra DB zu speichern.
Erforderliche Abhängigkeiten:
npm install cheerio
Sie benötigen Astra DB-Anmeldeinformationen ( ASTRA_DB_APPLICATION_TOKEN
, ASTRA_DB_API_ENDPOINT
) und einen OpenAI-API-Schlüssel (OPENAI_API_KEY
) als Umgebungsvariablen.
Notwendige Module importieren:
import * as cheerio from "cheerio"; const html = await fetch( "https://www.datastax.com/blog/how-to-create-vector-embeddings-in-node-js" ).then((res) => res.text()); const $ = cheerio.load(html); console.log($("h1").text(), "\n"); console.log($("section#blog-content > div:first-child").text());
Komponenten initialisieren:
npm install @mozilla/readability jsdom
Dokumente laden, transformieren, teilen, einbetten und speichern:
import { Readability } from "@mozilla/readability"; import { JSDOM } from "jsdom"; const url = "https://www.datastax.com/blog/how-to-create-vector-embeddings-in-node-js"; const html = await fetch(url).then((res) => res.text()); const doc = new JSDOM(html, { url }); const reader = new Readability(doc.window.document); const article = reader.parse(); console.log(article);
Verbesserte Web-Scraping-Genauigkeit mit Readability.js
Readability.js, eine robuste Bibliothek, die den Lesemodus von Firefox unterstützt, extrahiert effizient relevante Daten aus Webseiten und verbessert so die RAG-Datenqualität. Es kann direkt oder über MozillaReadabilityTransformer
.
Dies ist nur die Anfangsphase Ihrer Aufnahmepipeline. Chunking, Einbettung und Astra DB-Speicher sind nachfolgende Schritte beim Erstellen Ihrer RAG-Anwendung.
Verwenden Sie andere Methoden zum Bereinigen von Webinhalten in Ihren RAG-Anwendungen? Teilen Sie Ihre Techniken!
Das obige ist der detaillierte Inhalt vonBereinigen Sie HTML-Inhalte für die Retrieval-Augmented Generation mit Readability.js. Für weitere Informationen folgen Sie bitte anderen verwandten Artikeln auf der PHP chinesischen Website!

Heiße KI -Werkzeuge

Undresser.AI Undress
KI-gestützte App zum Erstellen realistischer Aktfotos

AI Clothes Remover
Online-KI-Tool zum Entfernen von Kleidung aus Fotos.

Undress AI Tool
Ausziehbilder kostenlos

Clothoff.io
KI-Kleiderentferner

Video Face Swap
Tauschen Sie Gesichter in jedem Video mühelos mit unserem völlig kostenlosen KI-Gesichtstausch-Tool aus!

Heißer Artikel

Heiße Werkzeuge

Notepad++7.3.1
Einfach zu bedienender und kostenloser Code-Editor

SublimeText3 chinesische Version
Chinesische Version, sehr einfach zu bedienen

Senden Sie Studio 13.0.1
Leistungsstarke integrierte PHP-Entwicklungsumgebung

Dreamweaver CS6
Visuelle Webentwicklungstools

SublimeText3 Mac-Version
Codebearbeitungssoftware auf Gottesniveau (SublimeText3)

Heiße Themen











Unterschiedliche JavaScript -Motoren haben unterschiedliche Auswirkungen beim Analysieren und Ausführen von JavaScript -Code, da sich die Implementierungsprinzipien und Optimierungsstrategien jeder Engine unterscheiden. 1. Lexikalanalyse: Quellcode in die lexikalische Einheit umwandeln. 2. Grammatikanalyse: Erzeugen Sie einen abstrakten Syntaxbaum. 3. Optimierung und Kompilierung: Generieren Sie den Maschinencode über den JIT -Compiler. 4. Führen Sie aus: Führen Sie den Maschinencode aus. V8 Engine optimiert durch sofortige Kompilierung und versteckte Klasse.

Python eignet sich besser für Anfänger mit einer reibungslosen Lernkurve und einer kurzen Syntax. JavaScript ist für die Front-End-Entwicklung mit einer steilen Lernkurve und einer flexiblen Syntax geeignet. 1. Python-Syntax ist intuitiv und für die Entwicklung von Datenwissenschaften und Back-End-Entwicklung geeignet. 2. JavaScript ist flexibel und in Front-End- und serverseitiger Programmierung weit verbreitet.

Die Verschiebung von C/C zu JavaScript erfordert die Anpassung an dynamische Typisierung, Müllsammlung und asynchrone Programmierung. 1) C/C ist eine statisch typisierte Sprache, die eine manuelle Speicherverwaltung erfordert, während JavaScript dynamisch eingegeben und die Müllsammlung automatisch verarbeitet wird. 2) C/C muss in den Maschinencode kompiliert werden, während JavaScript eine interpretierte Sprache ist. 3) JavaScript führt Konzepte wie Verschlüsse, Prototypketten und Versprechen ein, die die Flexibilität und asynchrone Programmierfunktionen verbessern.

Zu den Hauptanwendungen von JavaScript in der Webentwicklung gehören die Interaktion der Clients, die Formüberprüfung und die asynchrone Kommunikation. 1) Dynamisches Inhaltsaktualisierung und Benutzerinteraktion durch DOM -Operationen; 2) Die Kundenüberprüfung erfolgt vor dem Einreichung von Daten, um die Benutzererfahrung zu verbessern. 3) Die Aktualisierung der Kommunikation mit dem Server wird durch AJAX -Technologie erreicht.

Die Anwendung von JavaScript in der realen Welt umfasst Front-End- und Back-End-Entwicklung. 1) Zeigen Sie Front-End-Anwendungen an, indem Sie eine TODO-Listanwendung erstellen, die DOM-Operationen und Ereignisverarbeitung umfasst. 2) Erstellen Sie RESTFUFFUPI über Node.js und express, um Back-End-Anwendungen zu demonstrieren.

Es ist für Entwickler wichtig, zu verstehen, wie die JavaScript -Engine intern funktioniert, da sie effizientere Code schreibt und Leistungs Engpässe und Optimierungsstrategien verstehen kann. 1) Der Workflow der Engine umfasst drei Phasen: Parsen, Kompilieren und Ausführung; 2) Während des Ausführungsprozesses führt die Engine dynamische Optimierung durch, wie z. B. Inline -Cache und versteckte Klassen. 3) Zu Best Practices gehören die Vermeidung globaler Variablen, die Optimierung von Schleifen, die Verwendung von const und lass und die Vermeidung übermäßiger Verwendung von Schließungen.

Python und JavaScript haben ihre eigenen Vor- und Nachteile in Bezug auf Gemeinschaft, Bibliotheken und Ressourcen. 1) Die Python-Community ist freundlich und für Anfänger geeignet, aber die Front-End-Entwicklungsressourcen sind nicht so reich wie JavaScript. 2) Python ist leistungsstark in Bibliotheken für Datenwissenschaft und maschinelles Lernen, während JavaScript in Bibliotheken und Front-End-Entwicklungsbibliotheken und Frameworks besser ist. 3) Beide haben reichhaltige Lernressourcen, aber Python eignet sich zum Beginn der offiziellen Dokumente, während JavaScript mit Mdnwebdocs besser ist. Die Wahl sollte auf Projektbedürfnissen und persönlichen Interessen beruhen.

Sowohl Python als auch JavaScripts Entscheidungen in Entwicklungsumgebungen sind wichtig. 1) Die Entwicklungsumgebung von Python umfasst Pycharm, Jupyternotebook und Anaconda, die für Datenwissenschaft und schnelles Prototyping geeignet sind. 2) Die Entwicklungsumgebung von JavaScript umfasst Node.JS, VSCODE und WebPack, die für die Entwicklung von Front-End- und Back-End-Entwicklung geeignet sind. Durch die Auswahl der richtigen Tools nach den Projektbedürfnissen kann die Entwicklung der Entwicklung und die Erfolgsquote der Projekte verbessert werden.
