AI分享圈

AI正在改变世界!
ERNIE-4.5-21B-A3B-Thinking - 百度开源的推理思考模型

ERNIE-4.5-21B-A3B-Thinking - 百度开源的推理思考模型

ERNIE-4.5-21B-A3B-Thinking 是百度开源的专注于推理任务的大型语言模型。采用混合专家(MoE)架构,总参数量达210亿,每个token激活30亿参数,支持128K的长上下文窗口...
10个月前
046.5K
MobiAgent - 上海交大开源的移动端智能体全栈构建框架

MobiAgent - 上海交大开源的移动端智能体全栈构建框架

MobiAgent 是上海交通大学 IPADS 实验室开源的移动端智能体工具链,帮助用户构建专属的手机智能助手。通过记录用户操作轨迹并生成高质量数据,训练出能理解自然语言指令的智能体。核心特点包括高效...
10个月前
055.5K
ZipVoice - 小米开源的语音合成系列模型

ZipVoice - 小米开源的语音合成系列模型

ZipVoice是小米发布的基于 Flow Matching 架构的系列语音合成(TTS)模型,包括 ZipVoice(零样本单说话人语音合成模型)和 ZipVoice-Dialog(零样本对话语音合...
10个月前
066.9K
PP-OCRv5 - 百度开源的新一代文字识别AI模型

PP-OCRv5 - 百度开源的新一代文字识别AI模型

PP-OCRv5是百度发布的最新一代文字识别AI模型。具有轻量级设计,参数量仅0.07B,适合在CPU和边缘设备上高效运行,每秒可处理超过370个字符。模型支持简体中文、繁体中文、英文、日文和拼音等五...
10个月前
083.1K
Youtu-GraphRAG - 腾讯优图实验室开源的图检索增强生成框架

Youtu-GraphRAG - 腾讯优图实验室开源的图检索增强生成框架

Youtu-GraphRAG 是腾讯优图实验室开源的图检索增强生成框架,帮助大语言模型更精准地处理复杂问答任务。通过构建四层知识树,将知识拆解为属性、关系、关键词和社区四个层次,实现跨领域知识的自主演...
10个月前
056.5K
Stand-In - 腾讯微信视觉开源的轻量级视频生成框架

Stand-In - 腾讯微信视觉开源的轻量级视频生成框架

Stand-In 是腾讯微信视觉团队推出的轻量级、即插即用的身份保留视频生成框架。专注于在视频生成中保留特定身份特征,仅需训练基础模型1%的额外参数,能在人脸相似度和自然度方面取得优异效果。
10个月前
056K
IndexTTS2 - B站开源的免费TTS模型,首个支持精确时长控制

IndexTTS2 - B站开源的免费TTS模型,首个支持精确时长控制

IndexTTS2是B站语音团队开源的新型免费文本转语音(TTS)模型,在情感表达和时长控制方面实现了重大突破,首个支持精确时长控制的自回归TTS模型。支持零样本声音克隆,只需一个音频文件可精准复制音...
10个月前
0123.7K
HuMo - 清华大学联合字节开源的多模态视频生成框架

HuMo - 清华大学联合字节开源的多模态视频生成框架

HuMo是清华大学和字节跳动智能创作实验室联合开源的多模态视频生成框架,专注于人类中心的视频生成。能从文本、图像和音频等多种模态输入中生成高质量、精细且可控的人类视频。HuMo支持强大的文本提示跟随能...
10个月前
0142.9K
AntSK FileChunk - 免费的AI语义文档切片工具,动态切片调整

AntSK FileChunk - 免费的AI语义文档切片工具,动态切片调整

AntSK FileChunk 是免费的智能文档切片工具,专为 RAG(检索增强生成)应用设计。以语义为核心,将文档智能切分为语义完整、连贯的片段,支持多语言,可动态调整切片大小,确保上下文连贯性。
11个月前
059K
UnifiedTTS - 一站式TTS API服务平台,实时性能监控

UnifiedTTS - 一站式TTS API服务平台,实时性能监控

UnifiedTTS 是一站式文本转语音(TTS)服务的平台。支持多种语言,包括中文、英文、日文和韩文等,能满足全球业务的需求。通过统一的 API 接口,整合多种主流的 TTS 服务,包括 Micro...
11个月前
063K