Teth Azrael Cortés Aguilar, Adriana Tovar Arriaga · Programación matemática y software 2026 · 2026
DOI: 10.30973/progmat/2026.18.3/1
Counts differ because each database indexes a different set of publications. We treat OpenAlex as the canonical count; Google Scholar is not shown (no API, and crawling it violates its ToS).
En el método tradicional de reconocimiento automático de voz, las señales de voz se traducen a texto para identificar palabras. Sin embargo, en algunos casos, como la robótica colaborativa, se requiere un reconocimiento rápido de comandos de voz, evitando la transformación de fonemas en texto. La extracción de características de las señales de voz es un paso crítico de preprocesamiento antes del entrenamiento de un modelo de aprendizaje automático. En este artículo se describe el método de extracción de características MFCC, CHROMA, TZ en el dominio de la frecuencia y RMS, ZC, TEMPO en el dominio del tiempo. Se creó un conjunto de datos de 600 grabaciones de audio. Para cada uno de los 10 comandos en español se hicieron 30 grabaciones de 20 hablantes adultos. En el análisis de la importancia de las características, concluimos que las características CHROMA no proporcionan datos informativos que mejoren la tarea de clasificación de señales de voz. Los resultados muestran que el reconocimiento de comandos de voz mediante un modelo de refuerzo de gradiente basado en histogramas HGB logra predicciones correctas en un 80% de los casos de prueba en 21.77 ms. Este modelo se comparó contra otros modelos de aprendizaje automático, logrando una mejor métrica de exactitud.
No comments yet — start the discussion below.