Círculo de intercambio de inteligencia artificial

Puesta en común diaria de los últimos productos, proyectos, marcos, interpretaciones de documentos, etc.~ sobre IA.
Qwen-Image-Edit - 阿里通义开源的图像编辑模型

Qwen-Image-Edit - Modelo de edición de imágenes de código abierto Ali Tongyi

Qwen-Image-Edit es un modelo de edición de imágenes polivalente introducido por Ali Tongyi, basado en la arquitectura Qwen-Image con 20.000 millones de parámetros. El modelo combina capacidades de edición semántica y de apariencia, y puede realizar ediciones de apariencia visual de bajo nivel en imágenes (por ejemplo, añadir, eliminar...
hace 1 año
075.4K
MoE-TTS - 昆仑万维推出的最新语音生成框架

MoE-TTS: el último marco de generación de voz de KunlunWei

MoE-TTS es un marco de síntesis del habla introducido por KunlunWanwei, basado en la arquitectura Mixed Expert (MoE), que combina Large Language Models (LLMs) preentrenados con módulos expertos del habla.MoE-TTS conserva el potente razonamiento textual congelando los parámetros del módulo textual y actualizando sólo los parámetros del módulo del habla....
hace 1 año
072.5K
Mureka V7.5 - 昆仑万维推出的先进AI音乐创作模型

Mureka V7.5 - Modelos avanzados de creación musical por IA de Quintessence

Mureka V7.5 es un modelo de generación musical de IA de última generación de Kunlun World Wide, centrado en la composición de canciones chinas. El modelo reproduce con precisión el timbre y las técnicas de interpretación para generar voces naturales, suaves y emotivas. Basado en la tecnología optimizada de reconocimiento automático del habla (ASR), Mureka V...
hace 1 año
072.8K
Skywork Deep Research Agent v2 - 昆仑万维推出的深度研究智能体升级版

Skywork Deep Research Agent v2 - Una versión mejorada de la Inteligencia de Investigación Profunda de Kunlun

Skywork Deep Research Agent v2 es un organismo inteligente de investigación profunda lanzado por Kunlun Wave, centrado en la integración y el análisis de información multimodal.Skywork Deep Research Agent v2 puede procesar texto, gráficos...
hace 1 año
070.1K
Hunyuan-GameCraft - 腾讯混元开源的下一代游戏交互式视频生成框架

Hunyuan-GameCraft - Marco de código abierto de Tencent Hunyuan para generar vídeo interactivo para juegos de nueva generación.

Hunyuan-GameCraft es el marco de generación de vídeo de juegos interactivos de código abierto del equipo Tencent Hunyuan. Marco de una sola imagen y le pide que genere vídeo de juego altamente dinámico , apoyar al usuario a través del teclado y el ratón para controlar el contenido de vídeo en tiempo real .
hace 1 año
075.3K
Skywork UniPic 2.0 - 昆仑万维开源的高效多模态模型

Skywork UniPic 2.0 - Modelado multimodal eficiente de código abierto por KunlunWanwei

Skywork UniPic 2.0 es un eficiente modelo multimodal de código abierto de Quintessence, centrado en la generación, edición y comprensión de imágenes. El modelo se basa en una arquitectura SD3.5-Medium de 2B parámetros, y se realiza mediante pre-entrenamiento, estrategia de refuerzo progresivo de doble tarea y co-entrenamiento....
hace 1 año
072.8K
RynnRCP - 阿里达摩院推出的首个开源机器人上下文协议

RynnRCP - Primer protocolo de contexto robótico de código abierto del Instituto Ali Dharma

RynnRCP es un protocolo de contexto robótico (RCP, Robot Context Protocol) de código abierto del Instituto Ali Dharma que reduce el umbral para el desarrollo de la inteligencia incorporada y abre todo el proceso de desarrollo.
hace 1 año
084K
RynnEC - 阿里达摩院开源的世界理解模型

RynnEC - El modelo de comprensión del mundo de código abierto del Instituto Ali Dharma

RynnEC es un modelo de comprensión del mundo presentado por el Instituto Dharma de Alibaba, centrado en tareas de inteligencia incorporada. El modelo se basa en una tecnología de fusión multimodal que combina datos de vídeo y lenguaje natural, y puede analizar objetos de una escena desde múltiples dimensiones, lo que permite funciones como la comprensión de objetos, la percepción espacial y la segmentación de objetivos de vídeo.
hace 1 año
086.2K
Matrix-3D - 昆仑万维开源的3D世界生成框架

Matrix-3D - Marco de generación de mundos 3D de código abierto para todo el mundo Kunlun

Matrix-3D es un framework de código abierto del equipo Skywork AI, centrado en la generación de mundos 3D panorámicos explorables. El marco combina técnicas de generación de vídeo panorámico y reconstrucción 3D para generar mundos 3D explorables omnidireccionales de alta calidad a partir de una sola imagen o...
hace 1 año
079.9K
GLM-4.5V - 智谱推出的多模态开源视觉推理模型

GLM-4.5V - Modelo de razonamiento visual multimodal de código abierto de Smart Spectrum

GLM-4.5V es el modelo de inferencia visual de código abierto líder mundial presentado por Smart Spectrum, con 106.000 millones de parámetros totales y 12.000 millones de parámetros activados. El modelo se entrena a partir del modelo base de texto de nueva generación GLM-4.5-Air, con potentes capacidades de comprensión y razonamiento visual, capaz de manejar imágenes, vídeo...
hace 1 año
084.6K