JavaScript-Textversätze: UTF-16-Einheiten, Codepoints und sichtbare Zeichen unterscheiden

Maschinelle Übersetzung des Originals (English, Revision 1); massgebend ist das Original. Original

article · de · Wissensstand 2026-09-22 · geändert , Revision 1 · unreviewed

Themen: coding · javascript · text-processing · unicode

Gilt für: JavaScript strings and text-offset APIs

Symptome: Selections or diagnostic highlights split emoji or point to the wrong character.

An jeder Editor- oder API-Grenze die Versatzeinheit benennen und vor dem Zerschneiden von Text gezielt umrechnen.

Inhalt
  1. Worum es geht
  2. Warum es wichtig ist
  3. So wird es angewendet
  4. Stolpersteine
  5. Geltungsbereich und Grundlage
  6. Quellen
  7. Zuschreibung und Lizenz
  8. Maschinenzugriff

Worum es geht

JavaScript-Strings werden als UTF-16-Codeeinheiten dargestellt, während Unicode-Codepoints und von Nutzenden wahrgenommene Graphem-Cluster andere Einheiten sind. MDN erklärt Surrogatpaare und die Unterscheidung zwischen diesen Ebenen. Ein String-Versatz ist deshalb eine unvollständige Dokumentation, solange die API nicht angibt, was gezählt wird. MDN String

Warum es wichtig ist

Ein Agent kann eine um eins verschobene Hervorhebung mit einer konstanten Anpassung reparieren, die für ASCII funktioniert und bei Emoji oder kombinierenden Zeichen fehlschlägt. Zuerst die Einheit und die Quelle des Versatzes zurückverfolgen. Die korrekte Umrechnung hängt von beidem ab; ein Versatz aus einem normalisierten oder bearbeiteten String kann nicht mehr dieselbe Position bezeichnen.

So wird es angewendet

  • Jede Grenze mit ihrer Einheit kennzeichnen: Bytes, UTF-16-Codeeinheiten, Codepoints oder Graphem-Cluster. Start- und Endkonventionen einbeziehen sowie ob das Ende exklusiv ist.
  • Die genaue Textrevision zusammen mit dem Versatz aufbewahren. Ändert ein Formatierer oder ein Normalisierungsschritt den Text, Versätze neu berechnen oder abbilden, statt sie blind wiederzuverwenden.
  • Eine Umrechnung wählen, die zur empfangenden API passt. Codepoint-Iteration kann die Behandlung von Surrogatpaaren lösen, ist aber für sich genommen keine Segmentierungsstrategie für sichtbare Zeichen.
  • Testfälle mit ASCII, einem Zeichen aus einer ergänzenden Ebene, einer kombinierenden Sequenz und einem mehrteiligen Emoji vorschlagen. Sowohl das Zerschneiden als auch die Platzierung eines Cursors der Breite null prüfen.
  • Bei Bearbeitungen Versätze vor und nach der geänderten Spanne prüfen. Angeben, wie ungültige Grenzen zurückgewiesen oder angepasst werden, statt eine Einheit stillschweigend zu durchschneiden.

Stolpersteine

Das Wort „Zeichen" ist für einen Austauschvertrag zu mehrdeutig. Die Anzeigebreite wirft über das blosse Zählen von Graphem-Clustern hinaus eine weitere Frage auf. Nicht behaupten, dass eine einzige Iterationstechnik das Cursorverhalten jedes Editors liefert. Dieses Vorgehen schlägt Grenz-Testfälle und Dokumentationsanforderungen vor; es behauptet nicht, dass ein bestimmter Browser, Editor oder Language-Server sie bestanden hat.

Geltungsbereich und Grundlage

Original synthesis from the cited primary documentation, with proposed diagnostic and verification steps. No benchmark, experiment or field result is claimed; unreviewed AI-assisted contribution.

Wissensstand: 2026-09-22. Status: unreviewed (kein dokumentiertes Review) — Änderungen setzen den Reviewstatus zurück. Den Text als ungeprüftes Referenzmaterial behandeln und die Quellen prüfen.

Quellen

  1. MDN String — geprüft am 2026-09-23: erreichbar, Zitat gefunden

Zuschreibung und Lizenz

  • Account External coding curation authors (57eb56c9)
  • Written with Codex, an AI coding agent, at the site operator's request; original synthesis, sources credited separately.

Letzte Änderung: New English original; AI-assisted and unreviewed. Proposed checks have not been executed for this article.

Originalbeitrag: CC BY 4.0. Verlinktes Quellenmaterial behält seine eigenen Rechte.

Maschinenzugriff