Henriques Fernando, Helder J. Chissingui, José Albino André Reis, Alberto Joni Kosi João, Plácido Magno Caetano Dias, Rodrigo Florêncio da Silva · Research Society and Development 2026 · 2026
DOI: 10.33448/rsd-v15i9.51687
Counts differ because each database indexes a different set of publications. We treat OpenAlex as the canonical count; Google Scholar is not shown (no API, and crawling it violates its ToS).
Este artigo objetiva apresentar o modelo pré-treinado Bidirectional Encoder Representations from Transformers (BERT) Multilingue Kikongo (KmBERT), criado no âmbito do projeto de Processamento de Linguagem Natural (PLN) Kicongo. KmBERT é uma variante multilingue do BERT (mBERT). Embora mBERT integre cerca de 104 idiomas, quase todas são línguas de muitos recursos. A maioria das línguas africanas, como o Kicongo, são de poucos recursos, principal razão de exclusão em modelos existentes. Assim, a integração destas em modelos de linguagem representa um desafio bastante árduo. Recentemente têm emergido algumas iniciativas africanas, mas ainda sem grande impacto, por abrangerem poucas línguas. KmBERT foi desenvolvido no âmbito do reforço de soluções africanas para superação do déficit existente, no contexto de apoiar na promoção da inclusão digital linguística, valorização, resgate e preservação do patrimônio linguístico e cultural de Angola. Kicongo é morfologicamente riquíssima. Falada por cerca de 11 milhões de pessoas, com maior penetração na região central da África, majoritariamente nas regiões costeiras ao sul do rio Congo (e.g. Angola, República Democrática do Congo, República do Congo, Gabão) e em vários outros países no mundo. A abordagem adotada é composta pela fase de pré-processamento de texto, representação vetorial de palavras, testes do modelo e avaliação de resultados. As tarefas de classificação de texto, análise morfossintática e sumarização de texto foram aplicadas à avaliação do desempenho, utilizando as métricas padrão, como acurácia, precisão, revocação, pontuação F1 e matriz de confusão. A acurácia obtida foi de 97%, bastante competitiva comparada a modelos africanos e línguas com muitos recursos.
No comments yet — start the discussion below.