Modelos de linguagem grandes multimodais (MLLMs), que processam múltiplos tipos de informações sensoriais, como texto, imagens e áudio, simultaneamente, estão expandindo rapidamente o leque de aplicações para inteligência artificial (IA). No entanto, em ambientes do mundo real, esses modelos podem interpretar erroneamente as características físicas dos sensores, identificar objetos equivocadamente ou alegar ouvir sons que não estão realmente presentes simplesmente porque um determinado objeto aparece em um vídeo. Esses erros são conhecidos como alucinações.
Fonte: TechXplore AI
Publicado em 2026-08-01