1. Voicebox – El modelo de IA multitarea para audio avanzado 




Tipo: Modelo de síntesis de voz basado en inteligencia artificial, desarrollado por Meta AI.

 ¿Qué es y cómo funciona?

Voicebox es un modelo de investigación de última generación capaz de realizar múltiples tareas de audio sin necesidad de entrenamiento específico para cada una. Entre sus funciones destacan:

  • Síntesis de voz multilingüe (inglés, francés, alemán, español, polaco, portugués).
  • Edición de audio: reemplazar palabras en un fragmento de voz sin regrabar.
  • Conversión de estilo vocal: cambiar el tono o acento de una voz.
  • Generación zero-shot: crear voz en idiomas sin datos de entrenamiento explícitos.
  • Supresión de ruido en grabaciones.

Utiliza un enfoque de "denoising" difusivo, similar a los modelos de imágenes como DALL·E, pero aplicado al dominio del audio.  

Costo: Gratuito para investigación (no es un producto comercial). Disponible solo a través de publicaciones científicas y repositorios académicos.


¿Cómo usarlo?

Actualmente, no está disponible como API pública. Solo se puede acceder a través de código abierto o colaboraciones con Meta AI. Ideal para investigadores y desarrolladores en IA del habla.


 ¿Para quién es ideal?

  • Investigadores en IA del habla.
  • Desarrolladores de audio que buscan integrar técnicas avanzadas.
  • Universidades y laboratorios tecnológicos.

Voicebox (de Meta): sitio oficial del proyecto

https://voicebox.metademolab.com