Fügen Sie einen Textausschnitt ein, um die wahrscheinlichste Sprache und das Konfidenzniveau zu sehen. Der Detektor eignet sich zum Sortieren mehrsprachiger Materialien, zur Überprüfung von Übersetzungen, Kommentaren, Suchanfragen und versehentlich gemischtem Inhalt.
Was bedeutet der Konfidenzwert in Prozent
Der Prozentsatz gibt an, wie stark das Ergebnis mit den Merkmalen übereinstimmt, die das Modell mit einer bestimmten Sprache verbindet. Er ist keine Garantie für Richtigkeit und keine Aussage, dass genau dieser Prozentsatz des Textes in dieser Sprache verfasst ist.
Beispielsweise bedeutet ein Ergebnis „Spanisch – 72 %, Portugiesisch – 24 %“, dass Spanisch am wahrscheinlichsten erscheint, der Text aber Merkmale einer verwandten Sprache aufweist und überprüft werden sollte. Je kürzer und neutraler der Ausschnitt, desto vorsichtiger sollte das Ergebnis interpretiert werden.
Welche Texte werden besser erkannt
Für eine zuverlässige Bestimmung fügen Sie mindestens einige vollständige Sätze ein. Der Text sollte gewöhnliche Wörter und grammatikalische Strukturen enthalten, die für die Sprache typisch sind.
Das Ergebnis wird in der Regel weniger zuverlässig, wenn der Ausschnitt überwiegend aus Folgendem besteht:
- einem oder zwei kurzen Wörtern;
- Personennamen, Marken und Produkten;
- URLs, E-Mail-Adressen, Zahlen und Artikeln;
- Programmiercode;
- internationalen Begriffen;
- Transliterationen;
- Wörtern, die in mehreren Sprachen gleich sind;
- Text, der gleichzeitig in mehreren Sprachen verfasst ist.
Das Wort menu, der Name Anna oder die Zeichenfolge SEO audit 2026 allein liefern dem Sprachmodell kaum ausreichenden Kontext.
Sprache, Schrift und Land sind nicht dasselbe
Kyrillisch bedeutet nicht automatisch Russisch, und Lateinisch nicht automatisch Englisch. In derselben Schrift können Dutzende Sprachen verwendet werden. Außerdem kann der Spracherkenner normalerweise nicht zuverlässig das Herkunftsland des Autors bestimmen.
Beispiel:
ptbezeichnet die portugiesische Sprache;pt-BR– die portugiesische Variante für Brasilien;pt-PT– die Variante für Portugal;sr-Cyrl– Serbisch in kyrillischer Schrift;sr-Latn– Serbisch in lateinischer Schrift.
Solche Bezeichnungen nennt man Sprach-Tags nach BCP 47. Der Detektor kann die Hauptsprache erkennen, aber das bedeutet nicht, dass er die regionale Variante oder die Schrift sicher bestimmt hat.
Wie Sie das Ergebnis für Ihre Website nutzen
Die Spracherkennung ist nützlich als Vorabprüfung, ersetzt aber nicht die Konfiguration der Website.
- Die Hauptsprache eines HTML-Dokuments wird mit dem Attribut
langangegeben, z.B.<html lang="de">. - Ein Abschnitt in einer anderen Sprache kann separat ausgezeichnet werden:
<span lang="en">...</span>. - Zur Verknüpfung sprachlicher Versionen von Seiten verwendet man
hreflang; der Textdetektor prüft dieses nicht. - Automatische Änderungen von
langoderhreflangallein aufgrund eines kurzen Ausschnitts sind nicht zu empfehlen.
Ein korrektes lang-Attribut hilft Browsern, Screenreadern, Sprachsynthesen und Übersetzern, den Text richtig zu verarbeiten.
Nützliche Anwendungsszenarien
Überprüfung mehrsprachiger Websites
Fügen Sie den Text eines verdächtigen Blocks ein, wenn in der deutschen Version der Seite versehentlich englische, spanische oder andere Lokalisierungen stehen geblieben sind. Für die Prüfung der gesamten Seite analysieren Sie die Haupttextblöcke getrennt – nicht Menü, Artikelnummern und Code zusammen.
Sortierung eingehender Nachrichten
Der Detektor hilft, Rückmeldungen, Anfragen und Anliegen vorab nach Sprachwarteschlangen zu verteilen. Bei geringer Konfidenz sollte die Nachricht besser manuell geprüft werden.
Kontrolle von Übersetzungen
Man kann feststellen, ob in übersetztes Material ein größeres Fragment in der Ausgangssprache gelangt ist. Das Tool bewertet nicht die Qualität der Übersetzung, Grammatik oder Übereinstimmung mit dem Original – es bestimmt nur die wahrscheinliche Sprache.
Bereinigung von Semantik
Bei der Arbeit mit mehrsprachigen Keywords hilft der Detektor, Suchanfragen in der falschen Sprache zu finden. Einwort-Keywords und Markennamen müssen dennoch manuell überprüft werden.
So erhöhen Sie die Genauigkeit des Ergebnisses
- Verwenden Sie einen zusammenhängenden Ausschnitt aus mehreren Sätzen.
- Entfernen Sie URLs, Nummern, Code und sich wiederholende Service-Elemente.
- Teilen Sie gemischten Text in Sprachblöcke auf und prüfen Sie diese separat.
- Vergleichen Sie nicht nur die erste, sondern auch die folgenden wahrscheinlichen Sprachen.
- Bei nahe beieinanderliegenden Werten lassen Sie das Ergebnis von einem Muttersprachler oder Übersetzer überprüfen.
Häufige Interpretationsfehler
- Ein hoher Prozentsatz bedeutet nicht, dass der Text fehlerfrei ist.
- Eine bestimmte Sprache bedeutet nicht ein bestimmtes Land.
- Der Detektor bestätigt weder Qualität noch Vollständigkeit der Übersetzung.
- Der Sprachname ersetzt nicht den korrekten BCP-47-Tag für HTML und Integrationen.
- Ein einziges Gesamtergebnis für gemischten Text kann eine zweite Sprache im Dokument verschleiern.
Häufig gestellte Fragen
Wie viel Text wird benötigt?
Es gibt keine strenge universelle Grenze. Mehrere vollständige Sätze liefern in der Regel mehr Merkmale als ein einzelnes Wort oder eine Überschrift. Bei kurzen Texten sollte das Ergebnis als vorläufig betrachtet werden.
Kann man zwei Sprachen in einem Text erkennen?
Das Tool kann mehrere wahrscheinliche Optionen anzeigen, markiert aber nicht unbedingt die Grenzen jeder Sprache. Gemischte Blöcke sollten besser getrennt und einzeln geprüft werden.
Erkennt der Detektor Dialekt oder Land?
Manchmal lassen sprachliche Merkmale eine Variante vermuten, aber das Hauptergebnis bezieht sich meist auf die Sprache. Die Region lässt sich aus einem kurzen Text allein nicht zuverlässig ableiten.
Kann das Tool übersetzen oder die Rechtschreibung prüfen?
Nein. Spracherkennung, Übersetzung und Grammatikprüfung sind verschiedene Aufgaben.
Verwandte Tools: Textverarbeitung; Diffchecker; Duplikate entfernen.
Offizielle Standards
- BCP 47 / RFC 5646 — Tags for Identifying Languages: https://www.rfc-editor.org/rfc/rfc5646
- WHATWG HTML — Attribut
lang: https://html.spec.whatwg.org/multipage/dom.html#the-lang-and-xml:lang-attributes
