3 Conclusiones
La implementación del modelo HMM categórico Definición 2.3 para el reconocimiento de caracteres del alfabeto latino ha demostrado ser una aproximación viable, alcanzando una exactitud global (accuracy) del 76.12% sobre un conjunto de prueba de 10,382 muestras. El uso de secuencias estocásticas permite modelar la variabilidad en los trazos de los caracteres.
A partir del análisis de las métricas de evaluación (Precisión, Recall y F1-Score) Sección 3.10 y la matriz de confusión Figura 3.5, se extraen las siguientes conclusiones clave:
- Efectividad de los Rasgos Estructurales: El modelo es altamente eficaz para clasificar caracteres con atributos morfológicos muy definidos y únicos. Esto se evidencia en los altos niveles de exactitud individual obtenidos en letras como la “T” (91.00%), la “X” (83.75%) y la “L” (precisión de 0.92).
- Limitaciones morfológicas: El principal cuello de botella del sistema radica en la confusión entre caracteres que comparten similitudes estructurales o direccionales. Las caídas de rendimiento más notables ocurrieron en letras como la “B”, “C” y “N” (con exactitudes en el rango del 64% al 66%). Esto indica que los rasgos estructurales extraídos actualmente no son suficientes para capturar las sutilezas geométricas que diferencian a estas clases.
- Viabilidad de la Arquitectura: La adopción de una topología de Bakis (Chen et al. 2012) resulta adecuada para el problema de reconocimiento fuera de línea (off-line), ya que restringe las transiciones de estado a un flujo unidireccional que se alinea naturalmente con la lectura secuencial de los rasgos extraídos de la imagen.
Trabajo futuro Para mejorar el rendimiento del sistema, las líneas de investigación futuras deberían enfocarse en refinar el algoritmo de extracción de características. Combinar los rasgos estructurales actuales con características estadísticas o direccionales (como gradientes) podría reducir significativamente la tasa de falsos positivos entre letras similares. Asimismo, la expansión del conjunto de datos mediante técnicas de aumento de imágenes con distintos niveles de ruido permitiría entrenar matrices de transición y emisión más robustas. Como posible investigación a futuro se puede dar el desarrollo de un modelo basado en Redes Neuronales Convolucionales (CNN) para establecer un análisis comparativo. Dado que las CNN aprenden representaciones espaciales y topológicas directamente de los píxeles sin necesidad de un diseño manual de características, contrastar ambas arquitecturas permitirá evaluar el equilibrio entre la interpretabilidad estocástica del HMM y el rendimiento del aprendizaje profundo en esta tarea de clasificación.
Aunque el modelo HMM categórico Definición 2.3 implementado muestra un rendimiento prometedor, la mejora de la extracción de características es crucial para alcanzar niveles de exactitud más altos y reducir la confusión entre caracteres morfológicamente similares.