Limpiador de Unicode
“Unicode cleaner” se utiliza para tres trabajos diferentes — normalizando letras acentuadas, transliterándolas a simple ASCII, y despojando caracteres de formato invisible — y una herramienta que afirma hacer los tres generalmente no hace ninguno de ellos previsiblemente. Este solo hace el tercer trabajo: elimina el formato invisible y los caracteres reservados que son sólo desordenados, deja a los que todavía hacen un trabajo de ortografía solo, y deja cada personaje visible, acentuado o no, exactamente como lo escribes — aparte de una excepción opt-in, abajo.
La limpieza ocurre en su navegador: ese texto nunca sale de esta página, y no hay subida, ninguna cuenta y ningún límite. Reescribir es la excepción — que envía su texto a nuestro servidor.
Tres trabajos llamados "limpiador de códigos"
- Normalización (NFC / NFD / NFKC). Algunas letras acentuadas se pueden codificar dos
maneras — un punto clave para "é", o un "e" más una marca de acento independiente que parece
idéntico en pantalla. Normalizar elige una forma consistente. Esta herramienta no hace eso; su
la biblioteca estándar del lenguaje casi sin duda ya tiene una función de una línea para él (
str .normalize()tanto en JavaScript como en Python). - Transliteration / ASCII-folding. Convertir "é" en "e", o "TM" en "(tm)". Tampoco esta herramienta, a propósito — es una reescritura perdida de contenido real, y que las sustituciones son "correctas" depende completamente de su proyecto, no de nada que una caja de pasta pueda Supongo.
- Destripando caracteres de formato invisible. Personajes sin forma visible Todos — espacios de cero ancho y ensambladores, marcas direccionales, caracteres de etiquetas Unicode, los Bloque de uso privado. Esto es lo que hace esta herramienta, y nada más.
Lo que las categorías implicadas realmente significan
Unicode agrupa cada personaje en una categoría, y los pertinentes aquí vale la pena saber por nombre si usted trabaja con el texto programáticamente:
- Cf — Formato. Características que afectan cómo se procesa o muestra el texto sin tener un glifo propio: acopladores de cero ancho, marcas direccionales, matemáticas invisibles operadores. Este es el grueso de lo que elimina este limpiador.
- Co — Uso privado. Un bloque Unicode deliberadamente deja sin definir fuentes personalizadas y conjuntos de iconos. Sin ningún significado universal, se hace como una caja vacía o aleatoria símbolo en cualquier máquina que no tenga la fuente específica que fue destinado para — este limpiador tiras que bloquean también.
- Cs — Surrogate. Codepoints que sólo son significativos en pares dentro Codificación UTF-16. Un solitario que aparece en texto ordinario generalmente significa un paso de código / código mal en alguna parte arriba — un bicho diferente, más raro que los escombros de pasta, y no algo así herramienta específicamente objetivos.
Un ejemplo corto y concreto
Copiar una breve respuesta fuera de una ventana de chat en una consola JavaScript y comprobar su longitud contra lo que esperaría contando cartas en pantalla:
"hello".length retornos 6, no 5 —
Aunque imprimen como "hola" sin nada visiblemente diferente. El código extra es un cero ancho
espacio (U+200B) que llegó con la pasta. Correr el mismo texto a través de este limpiador trae el
longitud de vuelta a 5, sin nada más sobre la cuerda cambió.
El único cambio visible que hace
La casilla de verificación por encima de la caja es la excepción a "invisible solamente": enciende y curly citas, en dashes y em dashes son enderezados en un apostrofe, marca de cita o hifeno. Esos son caracteres visibles, por lo que la herramienta trata cambiarlos como opcional — por defecto, no apagado, pero la caja está ahí si prefiere mantener la punción original.
Preguntas
¿Esto normaliza Unicode (NFC/NFKC)?
No. La normalización elige una codificación consistente para caracteres que pueden ser representados más de una manera, y ese es un trabajo para la función de normalización integrada de su lenguaje de programación, no una caja de pasta — hacerlo mal puede ser peor que no hacerlo en absoluto.
¿Esto convierte letras acentuadas a simple ASCII?
No, y no por accidente — É, ñ, ü y cada letra acentuada en la que te pegas salen exactamente como los escribiste. Transliterarlos es una elección deliberada y perdida que pertenece al código que controla, no en una herramienta de limpieza general.
¿Cuáles son las categorías Unicode Cf, Cs y Co?
Cf es Formato — caracteres invisibles que afectan el procesamiento, como acoplamientos de ancho cero y marcas direccionales. Co es uso privado — un bloque reservado para fuentes personalizadas sin significado universal. Cs es Surrogate — codepoints sólo válidos en pares UTF-16. El trabajo de este limpiador es principalmente Cf, más el bloque de uso privado.
¿Por qué un solo personaje surrogado aparece en texto normal?
Por lo general, porque un pedazo de software en el camino convertido entre codificación de texto incorrectamente y dejó la mitad de un par de surrogado detrás. Ese es un error diferente, menos común que el personaje invisible desbriga este objetivo de la herramienta, y vale la pena revisar su tubería de codificación por separado.
¿Esto es seguro correr con código fuente, no sólo prose?
Sólo toca caracteres sin forma visible, por lo que ninguna lógica de código debe cambiar — pero tratar cualquier operación de texto a granel en el código de la forma en que tratar cualquier otra edición: mantenerlo bajo control de la versión para que pueda diff el resultado antes de confiar en él.
¿Qué significan los personajes "unicodo invisibles"?
Los caracteres invisibles Unicode son los puntos de código que el estándar define sin ningún glifo visible en absoluto — principalmente la categoría Cf (Format) arriba, más algunos fuera de ella como el bloque de uso privado. Ellos no toman ancho y no dibujan nada en pantalla, que es exactamente por qué un hallazgo y lugar ordinario o un pase de corrección nunca los atrapa. Todo el trabajo de este limpiador es encontrar y eliminar los que son sólo formato sobrante, mientras que los que todavía hacen un trabajo real — un ensamblador que mantiene un emoji juntos, o que es parte de la ortografía persa — solo.
Lo que esta herramienta no puede eliminar
Hay dos cosas diferentes que la gente llama un "punto de agua AI".
- Personajes invisibles y tipográficos. Esta herramienta elimina caracteres que no llevan ningún glifo visible en absoluto, según define el Unicode estándar — no un número que inventamos. También gira diferentes variantes espaciales, incluyendo el espacio estrecho sin ruptura, en un espacio ordinario. Curly quotes and dashes go through a separate, Optional step — recambios tipográficos, encendidos por defecto; gire que Opción apagada y se quedan exactamente como tipo. También aclara los tres Gamas de uso privado Unicode, incluyendo el rango de etiquetas U+E0000–U+E007F utilizado para ocultar datos en llanura texto — esos rangos no tienen caracteres estándar propios, así que los describimos en lugar de vestirlos como una cuenta de carácter.
- Una marca de agua estadística en la palabra elección misma. SinthID-Text de Google, vivir en Gemini desde mayo de 2024, está documentado para no cambiar ningún personaje, así que ningún personaje Limpiador — nuestra incluida — tiene algo que atrapar. Antrópico ha marcado la salida de Claude igual desde el 2 de agosto de 2026, para cumplir con la Ley de AI de la UE, pero su propia explicación (G)support.claude.com) confirma sólo que la marca existe, no cómo funciona — así que no podemos prometer que se construye lo mismo Así es SynthID. Lo que podemos decir: un limpiador de caracteres como este solo toca Unicode personajes, y ninguna marca de agua que dependiera de ellos sobreviviría un copy-paste ordinario, así que No hay nada aquí para que se quite de ninguna manera. Al 10 de septiembre de 2026, el propio OpenAI para mejorar el contenido página enumera una marca de agua de texto para ni ChatGPT ni su API.
Si una herramienta promete despojar "la marca de agua AI" sin hacer esta distinción, es describiendo la primera cosa mientras te permite creer que hace la segunda.
Herramientas relacionadas
Es un limpiador detrás de todas estas páginas — los mismos caracteres, el mismo botón. Sólo el explicación alrededor de él cambia, así que elija lo que sea que coincida con su problema.
- Texto limpio — la herramienta principal, con la lista completa de todo lo que elimina.
- caracteres ocultos — la versión síntoma primera de esta misma página.
- Personajes invisibles — la lista completa de referencia de lo que se elimina.
- Extractor de caracteres especiales — para el lado visible-símbolo de "personas especiales".
- Extractor de texto AI — lo que "remover la IA del texto" significa, y lo que hace y no lo hace.
- Precios — lo que queda libre y lo que un pase añade, y que construye esto.