Links extrahieren aus HTML und Text

Links extrahieren aus HTML-Quelltext oder Text: alle URLs als Liste, Duplikate entfernen, interne und externe Links unterscheiden, Linktexte anzeigen.

–

 

HTML-Quelltext oder Text
Gefundene Links
URLLinktextTypAnzahl

Alles läuft in Ihrem Browser. Eingaben verlassen Ihr Gerät nicht.

Links aus HTML und Text auslesen

Mit diesem Werkzeug können Sie Links extrahieren, die in einem HTML-Quelltext oder in normalem Text stecken. Fügen Sie den Quelltext einer Seite ein (im Browser mit Strg+U oder Rechtsklick → Seitenquelltext anzeigen) oder einfach einen Text, eine E-Mail oder ein Protokoll. Das Werkzeug liest die Links aus HTML über alle <a href>-Elemente, nimmt den Linktext mit und findet zusätzlich ausgeschriebene Adressen im Text. Bei reinem Text sucht es nach allem, was mit http://, https:// oder www. beginnt; so lassen sich URLs extrahieren, auch wenn sie nicht verlinkt sind.

Jeder Link wird eingeordnet: interne und externe Links unterscheidet das Werkzeug anhand der Basis-URL. Links auf dieselbe Domain (mit oder ohne www) gelten als intern, alle anderen als extern. Relative Pfade wie /produkte/ werden mit der Basis-URL zu vollständigen Adressen ergänzt. Dazu kommen E-Mail-Links (mailto), Telefonnummern (tel) und Sprungmarken (#). Mit „Duplikate entfernen“ erscheint jede Adresse nur einmal, die Spalte „Anzahl“ zeigt, wie oft sie vorkam. Links mit rel="nofollow" werden markiert. Das Ergebnis kopieren Sie als Liste, als CSV für eine Tabellenkalkulation oder als Markdown.

Typische Einsätze: interne Verlinkung einer Seite prüfen, alle ausgehenden Links für einen Linkcheck sammeln oder Adressen aus einem langen Text herausziehen. Grenzen: Das Werkzeug lädt keine Seiten aus dem Netz und prüft nicht, ob die Links erreichbar sind. Links, die erst per JavaScript entstehen, stehen nicht im Quelltext. Einzelne Adressen zerlegt der URL-Parser in ihre Bestandteile.

Anleitung: Links extrahieren in 5 Schritten

  1. Die Basis-URL der Seite eintragen, damit relative Links vollständig werden und intern von extern unterschieden wird.
  2. HTML-Quelltext oder Text in das Eingabefeld einfügen; unter „Eingabe ist“ lässt sich die Erkennung festlegen.
  3. Unter „Anzeigen“ alle, nur interne, nur externe, mailto-, tel- oder Sprungmarken-Links wählen.
  4. „Duplikate entfernen“, „Alphabetisch sortieren“ und bei Bedarf „Auch Bilder, Skripte und Stylesheets“ setzen.
  5. Ein Ausgabeformat wählen, als Liste, CSV mit Linktext und Typ oder Markdown, und die gefundenen Links kopieren.

Typische Anwendungsfälle

  • Interne Verlinkung prüfen: Alle internen Links einer Seite samt Linktext auflisten und Lücken finden.
  • Linkcheck vorbereiten: Ausgehende Links sammeln und an ein Prüfwerkzeug oder eine Tabelle übergeben.
  • URLs aus Text ziehen: Adressen aus einer langen E-Mail, einem Chat oder einem Protokoll herausfiltern.
  • Ressourcen inventarisieren: Bilder, Skripte und Stylesheets einer Seite für einen Umzug oder eine CSP auflisten.
Fragen

Häufige Fragen

Wie bekomme ich den HTML-Quelltext einer Seite?

Im Browser drücken Sie Strg+U (am Mac Wahltaste+Befehl+U) oder wählen per Rechtsklick „Seitenquelltext anzeigen“. Markieren Sie alles mit Strg+A, kopieren Sie es und fügen Sie es hier ein.

Woran erkennt das Werkzeug interne und externe Links?

Am Hostnamen. Stimmt er mit dem der Basis-URL überein, wobei ein vorangestelltes www ignoriert wird, ist der Link intern. Subdomains wie shop.example.com gelten als extern, weil sie technisch eine andere Herkunft sind.

Werden die Links auf Erreichbarkeit geprüft?

Nein. Das Werkzeug arbeitet nur mit dem eingefügten Text und schickt keine Anfragen ins Netz. Es findet also auch Links auf Seiten, die nicht mehr existieren.

Findet das Werkzeug auch Bilder und Skripte?

Ja, wenn Sie „Auch Bilder, Skripte und Stylesheets“ einschalten. Dann kommen die Adressen aus img, script, link, iframe, source, video und audio dazu.

Warum fehlen manche Links einer Seite?

Viele Seiten erzeugen Menüs oder Listen erst per JavaScript. Diese Links stehen nicht im ursprünglichen Quelltext. Kopieren Sie in diesem Fall das HTML aus den Entwicklertools (Element untersuchen → äußeres HTML kopieren).

Wie exportiere ich die Links einer Seite nach Excel?

Wählen Sie als Ausgabeformat „CSV mit Linktext und Typ“, kopieren Sie das Ergebnis und fügen Sie es in Excel ein oder speichern Sie es als .csv-Datei. Jede Zeile enthält dann Adresse, Linktext und Typ.

Wie finde ich nofollow-Links auf einer Seite?

Fügen Sie den HTML-Quelltext ein; Links mit rel="nofollow" werden in der Ergebnistabelle markiert. So sehen Sie schnell, welche ausgehenden Links keine Empfehlung weitergeben sollen.

Weitere Werkzeuge

Das könnte auch helfen

Alle 358 Werkzeuge