Was hinter einem Zeichen steckt
Unicode ordnet jedem Schriftzeichen der Welt eine feste Nummer zu, den Codepoint. Geschrieben wird er als U+ mit mindestens vier Hexziffern: das große A ist U+0041, das Eurozeichen U+20AC, das lachende Gesicht U+1F600. Wie diese Nummer gespeichert wird, regelt die Kodierung. Im Web ist UTF-8 Standard, Programmiersprachen wie JavaScript, Java und C# rechnen intern mit UTF-16.
Der Rechner zerlegt Ihre Eingabe in einzelne Codepoints und zeigt für jeden die Bytes in UTF-8, die Zahl der UTF-16-Codeeinheiten, Dezimalwert und HTML-Entität. Für häufige Zeichen nennt er den offiziellen englischen Unicode-Namen, für alle anderen die allgemeine Kategorie wie Großbuchstabe, Satzzeichen oder Formatzeichen sowie den Unicode-Block.
Umgekehrt können Sie Codepoints eingeben und erhalten die Zeichen. Erlaubt sind Schreibweisen wie U+00E4, 0xE4, \u00E4, ä oder schlicht E4. Das hilft, wenn in einer Fehlermeldung oder einer Datenbank nur die Nummer eines Zeichens steht.
Unsichtbare Zeichen, Emojis und Längenangaben
Viele Probleme mit Text entstehen durch Zeichen, die man nicht sieht. Ein geschütztes Leerzeichen (U+00A0) sieht aus wie ein normales, wird aber von Suchfunktionen und Programmen anders behandelt. Ein Byte-Order-Mark (U+FEFF) am Dateianfang stört Skripte und CSV-Importe, ein Zero Width Space (U+200B) verhindert, dass zwei Wörter als gleich erkannt werden. Kopieren Sie einen verdächtigen Text hier hinein, dann tauchen solche Zeichen in der Codepoint-Liste auf.
Die Länge eines Textes hängt davon ab, was gezählt wird. Ein Emoji ist für das Auge ein Zeichen, für UTF-16 aber zwei Einheiten und in UTF-8 vier Bytes. Emojis mit Hautfarbe, Flaggen oder Familien bestehen sogar aus mehreren Codepoints, verbunden durch Zero Width Joiner. Feldbegrenzungen in Datenbanken und Formularen zählen oft Bytes oder UTF-16-Einheiten, nicht sichtbare Zeichen. Der Wort-und-Zeichen-Zähler zählt Wörter und Zeichen ganzer Texte.
Ein ä kann auf zwei Arten gespeichert sein: als ein Codepoint U+00E4 oder als a mit nachgestelltem kombinierendem Trema U+0308. Beide sehen gleich aus, sind für einen Vergleich aber verschieden. Programme gleichen das durch Normalisierung aus (NFC fasst zusammen, NFD zerlegt). Der Rechner zeigt Ihnen, welche Form in Ihrem Text steckt.
Die Zeichennamen sind für eine Auswahl häufig gebrauchter Zeichen hinterlegt, damit der Rechner klein und schnell bleibt. Die vollständige Liste veröffentlicht das Unicode-Konsortium in der Unicode Character Database.
Tipps und typische Fehler
Text sauber halten.
- Unsichtbares: U+200B suchen.
- BOM: Am Dateianfang prüfen.
- Normalisieren: NFC verwenden.
- Länge: Bytes oder Zeichen?
Weitere Rechner: Alltag
Häufige Fragen
Wie viele Bytes braucht ein Emoji?
Meist vier Bytes in UTF-8 und zwei Einheiten in UTF-16, zusammengesetzte Emojis mehr.
Was ist der Unterschied zwischen Codepoint und Byte?
Der Codepoint ist die Nummer des Zeichens, die Bytes sind seine gespeicherte Form in einer Kodierung.
Wie finde ich unsichtbare Zeichen?
Text einfügen und die Codepoint-Liste auf Werte wie U+00A0, U+200B oder U+FEFF prüfen.
Was ist UTF-8?
Eine Kodierung, die jeden Unicode-Codepoint in ein bis vier Bytes speichert und zu ASCII kompatibel ist.
Wie viele Zeichen hat Unicode?
Der Standard bietet Platz für über 1,1 Millionen Codepoints, davon sind rund 150.000 belegt.
- Unicode Zeichen nachschlagen
- Codepoint ermitteln
- UTF-8 Bytes anzeigen
- Unicode Rechner
- Zeichen Code herausfinden
- Emoji Unicode
Alle Berechnungen erfolgen direkt in Ihrem Browser, Ihre Eingaben werden nicht übertragen oder gespeichert. Die Ergebnisse sind Orientierungswerte ohne Gewähr und ersetzen keine steuerliche, rechtliche oder finanzielle Beratung. Die Erklärtexte auf dieser Seite wurden mit KI erstellt. Letzte inhaltliche Änderung dieser Seite: . Mehr dazu: So entstehen und prüfen wir die Rechner.