Gemini 2.5 Flash Image - El modelo de generación y edición de imágenes más potente de Google
Gemini 2.5 Flash Image (nombre en clave nano banana) es un modelo de generación y edición de imágenes de última generación de Google que mantiene la coherencia de los caracteres en todas las escenas y admite la edición precisa de imágenes mediante lenguaje natural, como el desenfoque de fondos y la eliminación de manchas.
Wan2.2-S2V - Modelo de generación de vídeo basado en audio de código abierto Ali Tongyi
Wan2.2-S2V es un modelo de generación de vídeo multimodal de código abierto de Ali Tongyi , sólo una imagen estática y un fragmento de audio , puede generar vídeo humano digital de alta calidad , y soporta una variedad de tipos de imagen y marco .
Curso gratuito sobre ingeniería de consejos ChatGPT para desarrolladores por Ernest Ng
ChatGPT Tip Engineering for Developers es un curso conjunto de DeepLearning.AI y OpenAI diseñado para desarrolladores, que cuenta con Isa Fulford, Andrew Ng para enseñar a utilizar Large Language Models (LLM...
Ask o4 - Un modelo de pensamiento paralelo introducido por Ask o4 que abre 8 vías de pensamiento al mismo tiempo
Ask White o4 es un innovador modelo de pensamiento paralelo que abre 8 vías de pensamiento al mismo tiempo, analiza el problema desde múltiples perspectivas y filtra automáticamente la solución óptima. El modelo incorpora técnicas avanzadas de aprendizaje por refuerzo Long-CoT y aprendizaje por recompensa de procesos, tiene potentes capacidades de razonamiento profundo y rinde bien en tareas complejas.
VibeVoice - Modelado de texto a voz de Microsoft
VibeVoice es un nuevo modelo de conversión de texto a voz (TTS) de Microsoft. Este modelo genera audio conversacional a partir de hasta cuatro altavoces diferentes y admite hasta 90 minutos de emisión continua de voz, con lo que rompe las limitaciones de duración de los sistemas TTS tradicionales.
SpatialGen - Modelos de generación de escenas 3D de código abierto de Qunar Technologies
SpatialGen es un modelo de generación de escenas 3D de código abierto de Qunar Technology, basado en la arquitectura del modelo de difusión, que admite la generación de imágenes multivista coherentes espaciotemporalmente a partir de descripciones textuales, imágenes de referencia y disposición espacial 3D, y que además genera escenas gaussianas 3D y renderiza vídeos itinerantes.
EchoMimicV3 - Modelo de generación de animación humana digital multimodal de código abierto Ant
EchoMimicV3 es un modelo multimodal de generación de vídeo humano digital lanzado por Ant Group, con 1.300 millones de parámetros, capaz de manejar múltiples entradas como audio, texto e imágenes para generar animaciones humanas digitales de alta calidad.
¿Cuáles son las mejores herramientas de AI para escribir ensayos? 15 Asistentes gratuitos recomendados para ensayos académicos con IA
En la era del auge de la Inteligencia Artificial, las herramientas de IA han cambiado nuestras vidas y han sido de gran ayuda para la investigación académica y la redacción de trabajos. Con el fin de ayudar a los usuarios a trabajar y estudiar de manera más eficiente, esta compilación selecciona cuidadosamente y presenta 15 asistentes gratuitos de vanguardia para la redacción de trabajos académicos.
Fun-ASR: una nueva generación de modelos de reconocimiento del habla lanzada conjuntamente por Nail y Tongyi
Fun-ASR es un gran modelo de reconocimiento de voz lanzado conjuntamente por Nail y Tongyi Labs. El modelo se ha entrenado con datos de audio masivos y puede identificar con precisión terminología multisectorial, como Internet, tecnología, decoración del hogar, etc., mejorando significativamente la precisión del reconocimiento. El modelo se combina con la información empresarial de Nail para optimizar la inferencia y reducir el problema de las...
Squibler: plataforma de escritura asistida por inteligencia artificial que impulsa todo el proceso, desde la idea hasta la creación.
Squibler es una potente plataforma de escritura asistida por IA diseñada para escritores que ayuda a los usuarios en todo el proceso, desde la concepción a la creación y la publicación. La plataforma ofrece diversas plantillas de historias que abarcan novelas, guiones, relatos cortos, etc. Los usuarios solo tienen que introducir el concepto inicial, y la IA puede generar esquemas, personajes, escenas...









