MoshiVis: un modelo de código abierto para el diálogo oral y la comprensión de imágenes en tiempo real
Introducción general MoshiVis es un proyecto de código abierto desarrollado por Kyutai Labs y alojado en GitHub. Se basa en el modelo de voz a texto Moshi (7B parámetros), con cerca de 206 millones de nuevos parámetros de adaptación y Pal...

































































































