最新AI资源

共 3185 篇文章
Doppl - 谷歌推出的AI虚拟试衣应用

Doppl - 谷歌推出的AI虚拟试衣应用

Doppl是谷歌推出的AI虚拟试衣应用。用户上传全身照片后,应用支持将服装图片或截图“穿”在数字版自己身上,且能将静态图片转换为AI生成的视频,让用户更真切地感受服装上身效果。
1年前
077.4K
Genie 3 - 谷歌推出的通用世界模型

Genie 3 - 谷歌推出的通用世界模型

Genie 3 是谷歌 DeepMind 推出的新一代通用世界模型,支持实时生成高度动态且连贯的虚拟世界。Genie 3 能模拟物理现象、自然生态系统,还支持创建奇幻场景和历史场景。用文本提示,用户能...
1年前
076.7K
JoyHallo - 京东开源的AI数字人模型

JoyHallo - 京东开源的AI数字人模型

JoyHallo是京东开源的AI数字人模型,专为普通话设计,支持将音频转化为逼真的说话视频。JoyHallo基于wav2vec2模型嵌入音频特征,用半解耦结构,提升唇部运动预测准确性,支持生成英语视频...
1年前
076K
企鹅读伴 - 腾讯推出的中小学生AI阅读助手

企鹅读伴 - 腾讯推出的中小学生AI阅读助手

企鹅读伴是腾讯推出的专为中小学生设计的AI阅读助手。企鹅读伴依托腾讯混元大模型和元器平台,结合《义务教育语文课程方案和课程标准(2022年版)》,为学生提供个性化阅读推荐、多种阅读模式(专注、朗读、听...
1年前
075.9K
Ovis-U1 - 阿里推出的多模态统一AI模型

Ovis-U1 - 阿里推出的多模态统一AI模型

Ovis-U1是阿里巴巴集团Ovis团队推出的多模态统一模型,参数规模达到30亿。模型具备多模态理解、文本到图像生成以及图像编辑等三大核心能力,凭借先进的架构设计和协同统一训练方法,支持实现高保真图像...
1年前
075.1K
EXAONE 4.0 - LG推出的混合推理模型

EXAONE 4.0 - LG推出的混合推理模型

EXAONE 4.0是韩国LG AI Research推出的混合推理大模型,融合通用自然语言处理和高级推理能力。模型支持韩语、英语和西班牙语,分为32B的专业版和1.2B的端侧版。专业版适用法律、会计...
1年前
075K
SAM Audio - Meta推出的开源多模态音频分割模型

SAM Audio - Meta推出的开源多模态音频分割模型

SAM Audio是Meta推出的开源多模态音频分割模型,从复杂的音频混合中精准分离出任意目标声音。通过结合文本、视觉和时间维度的提示,实现灵活、高效的音频处理,为音频编辑、去噪、声音提取等任务提供了...
9个月前
074K
CWM - Meta FAIR开源的代码世界语言模型

CWM - Meta FAIR开源的代码世界语言模型

CWM(Code World Model)是Meta FAIR团队发布的一款320亿参数的开源代码世界语言模型,专为代码生成和推理设计。引入“世界模型”概念,能模拟代码执行过程,预测变量状态变化,提前...
12个月前
073.9K
MedASR - 谷歌开源的医疗语音识别模型

MedASR - 谷歌开源的医疗语音识别模型

MedASR是谷歌开源的1.05亿参数医疗语音识别模型,在5000小时脱敏临床语料上微调,针对药品、剂量、解剖术语优化,内置6-gram医学语言模型,在私有放射科数据集RAD-DICT上词错率仅4.6...
9个月前
073.4K