Alltag

Unicode-Zeichen untersuchen

Fügen Sie Zeichen ein oder geben Sie Codepoints wie U+20AC ein. Der Rechner zeigt Nummern, Bytes, Kategorie und, wo hinterlegt, den Namen jedes Zeichens.

Ihre Zeichen
Bei Codepoints mehrere Werte mit Leerzeichen trennen, z. B. U+0041 U+20AC.
Ergebnis

Was hinter einem Zeichen steckt

Unicode ordnet jedem Schriftzeichen der Welt eine feste Nummer zu, den Codepoint. Geschrieben wird er als U+ mit mindestens vier Hexziffern: das große A ist U+0041, das Eurozeichen U+20AC, das lachende Gesicht U+1F600. Wie diese Nummer gespeichert wird, regelt die Kodierung. Im Web ist UTF-8 Standard, Programmiersprachen wie JavaScript, Java und C# rechnen intern mit UTF-16.

Der Rechner zerlegt Ihre Eingabe in einzelne Codepoints und zeigt für jeden die Bytes in UTF-8, die Zahl der UTF-16-Codeeinheiten, Dezimalwert und HTML-Entität. Für häufige Zeichen nennt er den offiziellen englischen Unicode-Namen, für alle anderen die allgemeine Kategorie wie Großbuchstabe, Satzzeichen oder Formatzeichen sowie den Unicode-Block.

Umgekehrt können Sie Codepoints eingeben und erhalten die Zeichen. Erlaubt sind Schreibweisen wie U+00E4, 0xE4, \u00E4, ä oder schlicht E4. Das hilft, wenn in einer Fehlermeldung oder einer Datenbank nur die Nummer eines Zeichens steht.

UTF−8: U+0000 bis U+007 F 1 Byte , bis U+07 FF 2 , bis U+FFFF 3 , daru¨ber 4 Bytes; UTF−16: bis U+FFFF 1 Einheit , daru¨ber 2\text{UTF} - 8:\ U + 0000\,\text{bis U} + 007\,F\,1\,\text{Byte}\,{,}\ \text{bis U} + 07\,\text{FF}\,2\,{,}\ \text{bis U} + \text{FFFF}\,3\,{,}\ \text{darüber}\,4\,\text{Bytes};\ \text{UTF} - 16:\ \text{bis U} + \text{FFFF}\,1\,\text{Einheit}\,{,}\ \text{darüber}\,2

Beispiel: Die Eingabe „ä€😀“ besteht aus den Codepoints U+00E4 U+20AC U+1F600. In UTF-8 sind das die Bytes C3 A4 E2 82 AC F0 9F 98 80, also 9 Bytes. In UTF-16 belegt sie 4 Codeeinheiten, weil das Emoji außerhalb der Basisebene liegt und ein Surrogatpaar braucht.

Unsichtbare Zeichen, Emojis und Längenangaben

Viele Probleme mit Text entstehen durch Zeichen, die man nicht sieht. Ein geschütztes Leerzeichen (U+00A0) sieht aus wie ein normales, wird aber von Suchfunktionen und Programmen anders behandelt. Ein Byte-Order-Mark (U+FEFF) am Dateianfang stört Skripte und CSV-Importe, ein Zero Width Space (U+200B) verhindert, dass zwei Wörter als gleich erkannt werden. Kopieren Sie einen verdächtigen Text hier hinein, dann tauchen solche Zeichen in der Codepoint-Liste auf.

Die Länge eines Textes hängt davon ab, was gezählt wird. Ein Emoji ist für das Auge ein Zeichen, für UTF-16 aber zwei Einheiten und in UTF-8 vier Bytes. Emojis mit Hautfarbe, Flaggen oder Familien bestehen sogar aus mehreren Codepoints, verbunden durch Zero Width Joiner. Feldbegrenzungen in Datenbanken und Formularen zählen oft Bytes oder UTF-16-Einheiten, nicht sichtbare Zeichen. Der Wort-und-Zeichen-Zähler zählt Wörter und Zeichen ganzer Texte.

Ein ä kann auf zwei Arten gespeichert sein: als ein Codepoint U+00E4 oder als a mit nachgestelltem kombinierendem Trema U+0308. Beide sehen gleich aus, sind für einen Vergleich aber verschieden. Programme gleichen das durch Normalisierung aus (NFC fasst zusammen, NFD zerlegt). Der Rechner zeigt Ihnen, welche Form in Ihrem Text steckt.

Die Zeichennamen sind für eine Auswahl häufig gebrauchter Zeichen hinterlegt, damit der Rechner klein und schnell bleibt. Die vollständige Liste veröffentlicht das Unicode-Konsortium in der Unicode Character Database.

Tipps und typische Fehler

Text sauber halten.

  • Unsichtbares: U+200B suchen.
  • BOM: Am Dateianfang prüfen.
  • Normalisieren: NFC verwenden.
  • Länge: Bytes oder Zeichen?

Weitere Rechner: Alltag

Häufige Fragen

Wie viele Bytes braucht ein Emoji?

Meist vier Bytes in UTF-8 und zwei Einheiten in UTF-16, zusammengesetzte Emojis mehr.

Was ist der Unterschied zwischen Codepoint und Byte?

Der Codepoint ist die Nummer des Zeichens, die Bytes sind seine gespeicherte Form in einer Kodierung.

Wie finde ich unsichtbare Zeichen?

Text einfügen und die Codepoint-Liste auf Werte wie U+00A0, U+200B oder U+FEFF prüfen.

Was ist UTF-8?

Eine Kodierung, die jeden Unicode-Codepoint in ein bis vier Bytes speichert und zu ASCII kompatibel ist.

Wie viele Zeichen hat Unicode?

Der Standard bietet Platz für über 1,1 Millionen Codepoints, davon sind rund 150.000 belegt.

Auch gesucht als:
  • Unicode Zeichen nachschlagen
  • Codepoint ermitteln
  • UTF-8 Bytes anzeigen
  • Unicode Rechner
  • Zeichen Code herausfinden
  • Emoji Unicode

Alle Berechnungen erfolgen direkt in Ihrem Browser, Ihre Eingaben werden nicht übertragen oder gespeichert. Die Ergebnisse sind Orientierungswerte ohne Gewähr und ersetzen keine steuerliche, rechtliche oder finanzielle Beratung. Die Erklärtexte auf dieser Seite wurden mit KI erstellt. Letzte inhaltliche Änderung dieser Seite: . Mehr dazu: So entstehen und prüfen wir die Rechner.