Looking up...
Proceso de reducir palabras a su raíz o base común mediante la eliminación de afijos (prefijos, sufijos) para normalizar el texto en análisis lingüístico.
The stemming algorithm converts 'running', 'runner', and 'ran' into 'run'.
El algoritmo de procesamiento de raíces convierte 'running', 'runner' y 'ran' en 'run'.
Común en motores de búsqueda y análisis de texto para mejorar la eficiencia y precisión.
En lingüística computacional, técnica que elimina sufijos flexivos para obtener la forma canónica de una palabra.
Stemming helps in reducing the vocabulary size in text classification tasks.
El procesamiento de raíces ayuda a reducir el tamaño del vocabulario en tareas de clasificación de texto.
Diferente de lematización, que reduce palabras a su forma base (lemma) considerando el contexto.
El stemming es útil en motores de búsqueda, análisis de sentimiento o clasificación de texto donde la precisión exacta no es crítica. Para tareas que requieren precisión lingüística (ej. traducción automática), la lematización es preferible.
El stemming no garantiza que la raíz resultante sea una palabra válida en el idioma. Su objetivo es agrupar variantes morfológicas bajo una misma forma base para mejorar la eficiencia computacional.
Del inglés *stem* (raíz, base) + sufijo *-ing* (gerundio). El término se popularizó en lingüística computacional a finales del siglo XX con el desarrollo de algoritmos como el de Porter (1979).
Aunque a veces se usan indistintamente, *stemming* y *lemmatization* no son lo mismo: el stemming es más agresivo y puede generar formas no válidas (ej. 'happi' de 'happy'), mientras que la lematización produce formas lingüísticamente correctas.