优雅YOYA - 中科闻歌推出的AI音视频内容创作平台优雅YOYA是中科闻歌推出的多模态文生视频平台,平台基于AI多模态技术赋能视频内容创作全链路。用户只需输入主题要求,平台能快速生成脚本、图像、视频,且能完成智能剪辑、语音合成和人物口型驱动等操作,输出...最新AI资源1年前077.4K
Gemini 2.5 Flash Image - 谷歌推出的最强图像生成与编辑模型Gemini 2.5 Flash Image(代号nano banana)是谷歌推出的先进图像生成与编辑模型,能保持角色在不同场景中的一致性,支持通过自然语言进行精准图像编辑,如模糊背景、消除污渍等。最新AI资源1年前077.4K
Doppl - 谷歌推出的AI虚拟试衣应用Doppl是谷歌推出的AI虚拟试衣应用。用户上传全身照片后,应用支持将服装图片或截图“穿”在数字版自己身上,且能将静态图片转换为AI生成的视频,让用户更真切地感受服装上身效果。最新AI资源1年前077.4K
LongCat-Video - 美团LongCat开源的视频生成模型LongCat-Video是美团LongCat团队开源的13.6亿参数视频生成模型,采用MIT开源协议,支持文生视频、图生视频和视频续写三大任务。模型通过"粗到细"生成策略和块稀疏注意力机制,能在数分...最新AI资源11个月前077.3K
Qwen3-VL-Embedding - 阿里通义团队开源的多模态嵌入模型Qwen3-VL-Embedding是阿里通义团队开源的多模态嵌入模型,属于Qwen3-VL系列,主要用于跨模态检索任务。模型将文本、图像、视频等不同模态数据映射到同一语义空间,通过双塔架构生成向量表...最新AI资源8个月前077.3K
商汤如影 - 商汤科技推出的AI数字人视频制作平台商汤如影是商汤科技推出的AI数字人视频制作平台。平台基于大模型技术,支持创建高度逼真的数字人形象,支持个性化定制,包括面部特征、服装、发型等。平台具备声音克隆、视频生成、自动化数据标注、实时互动等功能...最新AI资源1年前077.3K
VoxCPM 1.5 - 面壁智能开源的端到端文本到语音模型VoxCPM 1.5 是面壁智能发布的开源语音生成模型,基于无需分词器的文本到语音(TTS)技术,具有多项创新和改进。采用端到端的扩散自回归架构,直接从文本生成连续的语音波形,避免了传统分词方法的局限...最新AI资源9个月前077.2K
LongCat-Video-Avatar - 美团开源的虚拟人视频生成模型LongCat-Video-Avatar 是美团开源的基于 LongCat-Video 构建的先进音频驱动视频生成模型,专注于生成超逼真、唇部同步且具有自然动态和一致身份的长视频。最新AI资源9个月前077.2K
Chatterbox-Turbo - Resemble AI开源的文本到语音模型Chatterbox-Turbo 是 Resemble AI 推出的开源文本到语音(TTS)模型,专为高效、低延迟的语音合成而设计。基于350M参数的精简架构,单步推理生成音频,时间延迟极低,在150...最新AI资源9个月前077.2K
ChatGPT Agent – OpenAI推出的通用智能AI AgentChatGPT Agent 是 OpenAI 推出的通用AI Agent,融合多种能力,能自主完成复杂任务。用户只需用自然语言描述需求,Agent 能自动选择合适工具,比如浏览网页、提取信息、运行代码...最新AI资源1年前077.2K
SkyReels-A3 - 昆仑万维推出的音频驱动数字人创作工具SkyReels-A3 是昆仑万维集团推出的音频驱动数字人创作工具。能通过简单的输入(如人像图片和语音)生成高质量的动态视频内容,让静态照片“活”起来,可以为现有视频更换台词,人物会自动对上新的口型...最新AI资源1年前077.1K
Hunyuan-GameCraft - 腾讯混元开源的下一代游戏交互式视频生成框架Hunyuan-GameCraft 是腾讯 Hunyuan 团队开源的交互式游戏视频生成框架。框架能从单张图片和提示生成高动态的游戏视频,支持用户通过键盘和鼠标实时控制视频内容。最新AI资源1年前077.1K
MiniCPM-V 4.6 - 面壁智能联合清华开源的端侧多模态大模型MiniCPM-V 4.6 是面壁智能(OpenBMB)联合清华大学发布并开源的端侧多模态大模型。模型总参数量仅 1.3B,是 MiniCPM-V 系列有史以来最小的模型,在多模态综合能力上超越了阿里...最新AI资源4个月前077.1K
Hailuo Video Agent - MiniMax推出的AI视频创作AgentHailuo Video Agent 是 MiniMax 稀宇科技推出的零门槛AI视频创作Agent,开放Beta版本。通过简单的文字输入或图片上传,可一键生成高质量的创意视频,涵盖多种应用场景,如广...最新AI资源1年前077K
Tencent-HY-MT1.5 - 腾讯混元开源的翻译模型系列Tencent-HY-MT1.5是腾讯混元开源的翻译模型1.5版本,包含1.8B和7B两个模型,支持33种国际语言及5种民汉/方言互译。1.8B模型专为手机等消费级设备优化,仅需1GB内存即可实现端侧...最新AI资源9个月前076.9K
Shortbread - AI漫画生成工具,自然语言描述完成漫画创作Shortbread是AI漫画生成工具,用户基于简单的自然语言描述快速创作出完整的漫画作品。Shortbread无需任何绘图技能,只需输入文字,AI快速生成具有独特角色、场景和情感的个性化漫画。Sho...最新AI资源1年前076.8K
Intern-S1-mini - 上海AI Lab开源的轻量化科学多模态模型Intern-S1-mini 是上海人工智能实验室推出的轻量化科学多模态大模型,参数规模为 8B。继承了 Intern-S1 的强大能力,兼具通用与专业科学能力,适合快速部署和二次开发。在性能方面,I...最新AI资源1年前076.8K
Kaleido - 智谱AI联合清华大学等开源的多主体参考视频生成模型Kaleido是合肥工业大学、清华大学和智谱AI联合开发的开源多主体参考视频生成模型。通过多个参考图像生成主体一致的视频,解决了现有模型在多主体一致性和背景解耦方面的不足。Kaleido通过专门的数据...最新AI资源9个月前076.7K
Genie 3 - 谷歌推出的通用世界模型Genie 3 是谷歌 DeepMind 推出的新一代通用世界模型,支持实时生成高度动态且连贯的虚拟世界。Genie 3 能模拟物理现象、自然生态系统,还支持创建奇幻场景和历史场景。用文本提示,用户能...最新AI资源1年前076.7K
Higress MCP - 今日投资推出的MCP服务平台Higress MCP 是今日投资推出的创新型平台,支持将传统金融数据API快速转化为现代化的MCP服务。Higress MCP基于简单配置即可实现REST API到MCP Server的转换,无需编...最新AI资源1年前076.7K
NitroGen - 英伟达联合斯坦福大学、加州理工等开源的游戏AI模型NitroGen是英伟达联合斯坦福大学、加州理工学院等机构研发的开源游戏AI模型,能玩转超1000款不同类型游戏。模型基于GROOT N1.5架构,通过分析4万小时游戏视频数据(含手柄操作标注),实现...最新AI资源9个月前076.7K
FlowAct-R1 - 字节跳动开源的实时交互数字人视频生成框架FlowAct-R1是字节跳动开源的实时交互数字人视频生成框架,能通过单张参考图和音频流式生成无限时长的高保真全身动态视频。核心创新在于分块流式生成技术,将视频拆解为0.5秒一小段接力处理,配合结构化...最新AI资源8个月前076.7K
gpt-oss - OpenAI推出的开源推理模型系列gpt-oss是 OpenAI 推出的开源推理模型系列,支持为开发者提供高效、灵活且易于部署的 AI 解决方案。gpt-oss包含两个版本,gpt-oss-120B 拥有 1170 亿参数,支持在 8...最新AI资源1年前076.6K
FireRed-Image-Edit - 小红书团队开源的通用图像编辑模型FireRed-Image-Edit 是小红书 Super Intelligence 团队开源的通用图像编辑模型,基于扩散 Transformer 架构,在 GEdit、ImgEdit 等多个权威评测...最新AI资源7个月前076.6K
职达AI简历 - AI简历生成与优化平台,精准分析问题、提供优化建议职达AI简历是高效便捷的智能简历生成与优化平台。平台基于AI技术,帮助用户快速生成专业个性化的简历。用户只需输入基本信息和经历,平台能在短时间内生成优质简历,提供2800+精美模板,覆盖多种岗位。最新AI资源1年前076.6K
ClawWork - 香港大学数据科学实验室开源的AI经济压力测试框架ClawWork是香港大学数据科学实验室开发的AI经济压力测试框架,允许AI在模拟经济环境中完成真实工作任务并获得报酬。核心逻辑是让初始资金仅10美元的AI通过完成220个专业任务(覆盖制造、金融、医...最新AI资源7个月前076.6K
Hunyuan3D-Omni - 腾讯混元开源的3D模型生成框架Hunyuan3D-Omni(混元3D-Omni)是腾讯混元3D团队开源的3D资产生成框架,通过多种控制信号实现精准的3D模型生成。基于Hunyuan3D 2.1架构,引入了统一的控制编码器,可处理点...最新AI资源12个月前076.6K
InternVLA-A1 - 上海AI Lab开源一体化操作能力的具身大模型InternVLA-A1 是上海人工智能实验室开源的具身操作大模型。具备理解、想象、执行一体化的能力,能精准地完成任务。模型融合了真实和模拟的操作数据,通过大规模虚实混合场景资产,自动化构建海量多模态...最新AI资源1年前076.5K
OpenAI《在AI时代保持领先》PDF指南 - 附下载链接《Staying ahead in the age of AI》是OpenAI推出的AI领导力指南,助力企业领导者在AI时代保持竞争优势。指南指出AI发展迅猛,模型发布速度加快、成本降低,企业采用速度...最新AI资源课程资料1年前076.4K
Magistral - Mistral AI 推出的系列推理模型Magistral 是 Mistral AI 推出的推理模型,专注透明、多语言和特定领域的推理能力。模型包含开源版(Magistral Small)和企业版(Magistral Medium),后者在...最新AI资源1年前076.3K
Qwen3-Coder-Flash - 阿里通义推出的开源高性能编程模型Qwen3-Coder-Flash 是阿里通义千问团队推出的高性能编程模型,具备卓越的代理式编程和工具调用能力,擅长处理复杂编程任务。模型支持 256K tokens 的长上下文理解,能扩展至 1M ...最新AI资源1年前076.3K
AnimaTensor - 吐司AI等机构推出的二次元图像生成模型AnimaTensor 是 CagliostroLab 团队与 TensorArt 联合推出的二次元图像生成模型,基于创新的 V-Prediction 技术,用预测图像生成过程中的“速度”优化噪声调度...最新AI资源1年前076.3K
GLM-Experimental - 智谱AI推出的实验性模型GLM-Experimental 是智谱 AI 推出的实验性大语言模型,已在 Z.ai 平台上线。模型具备自动生成 PPT 的能力,用户输入主题或要点后,模型能快速生成结构清晰、格式规范的演示文稿,将...最新AI资源1年前076.3K
gpt-realtime - OpenAI最新推出的AI语音模型gpt-realtime 是 OpenAI 推出的先进语音模型,支持直接处理音频,生成自然流畅的语音。模型支持多种语言和风格,能理解非语言线索,如笑声,能在不同语言间切换。最新AI资源1年前076.2K
VibeVoice-ASR - 微软开源的统一语音转文本(ASR)模型VibeVoice-ASR是微软开源的统一语音转文本(ASR)模型,专为处理长音频设计,可一次性处理长达60分钟的连续音频,确保语义连贯性和说话人追踪的一致性。支持自定义热词功能,用户可输入特定词汇或...最新AI资源8个月前076.1K
无问芯穹:企业级AI开发,云端资源服务平台综合介绍 无问芯穹是一个面向AI开发者的综合服务平台,提供能力强大的AI开发工具与大模型服务。该平台具有AIStudio, GenStudio等多种机器学习开发工具,同时还支持模型部署、数据存储和模型...最新AI资源# AI开放服务2年前076.1K
靠岸妙写 - AI论文写作工具,构思到成稿一站式解决靠岸妙写是AI论文写作工具,为学术写作提供高效、便捷的解决方案。工具支持一键生成论文大纲、摘要和正文初稿,适用本科、硕士等不同层次的学术需求,覆盖理工科、文科和社科等多学科领域。最新AI资源1年前076.1K
剪影专业版6.0.x,新年快乐版无需会员就可以使用所有vip功能,解压即用,千万别升级!千万别升级!千万别升级! 链接:https://pan.quark.cn/s/a120ee707f47 提取码:jHDN最新AI资源2年前076K
Clawra - 基于OpenClaw框架开源的AI女友程序Clawra是一个基于OpenClaw框架开发的AI女友程序,由韩国开发者David Im制作,具有完整人设和交互功能。通过Persona Engineering技术赋予AI“18岁亚裔女性练习生”的...最新AI资源7个月前076K
Klic Studio - AI音视频翻译配音工具,一键部署全流程Klic Studio(原Krillin AI)是基于AI的视频翻译、配音和语音克隆工具,专为视频创作者和内容出海者设计。支持一键部署全流程,可将视频从下载到成品输出一键完成,适配抖音、小红书、B站...最新AI资源1年前076K
JoyHallo - 京东开源的AI数字人模型JoyHallo是京东开源的AI数字人模型,专为普通话设计,支持将音频转化为逼真的说话视频。JoyHallo基于wav2vec2模型嵌入音频特征,用半解耦结构,提升唇部运动预测准确性,支持生成英语视频...最新AI资源1年前076K
ArkClaw - 火山引擎推出的云端AI助手,零门槛部署OpenClawArkClaw是火山引擎推出的云端智能助手平台,基于OpenClaw架构构建,让用户无需繁琐配置可快速部署专属AI Agent。最新AI资源6个月前075.9K
企鹅读伴 - 腾讯推出的中小学生AI阅读助手企鹅读伴是腾讯推出的专为中小学生设计的AI阅读助手。企鹅读伴依托腾讯混元大模型和元器平台,结合《义务教育语文课程方案和课程标准(2022年版)》,为学生提供个性化阅读推荐、多种阅读模式(专注、朗读、听...最新AI资源1年前075.9K
Ming-Omni-tts - 蚂蚁联合Inclusion AI开源的多模态音频生成模型Ming-Omni-tts 是蚂蚁集团与Inclusion AI联合开源的多模态音频生成模型,包含0.5B和16.8B-A3B两个版本。模型首次实现了语音、环境音和音乐的统一自回归生成,支持语速、音量...最新AI资源7个月前075.9K
FactSnap - 新一代AI信息核查工具FactSnap是新一代AI信息核查工具,帮助用户快速验证网页信息的真实性。通过集成多种模型和搜索引擎,在用户浏览网页时对选中的文字进行实时核查。最新AI资源1年前075.8K
MiniMax Music 1.5 - MiniMax最新推出的AI音乐生成模型MiniMax Music 1.5 是先进的 AI 音乐生成工具,支持根据用户的自然语言描述,生成长达4分钟的音乐作品。模型支持多种音乐风格和情绪定制,生成的人声音色自然饱满,转音顺畅,编曲层次丰富...最新AI资源1年前075.7K
Squibler - AI小说辅助写作平台,助力构思到创作全过程Squibler 是强大的 AI 辅助写作平台,专为作家设计,能帮助用户从构思到创作再到出版的全过程。平台提供多种故事模板,涵盖小说、剧本、短篇故事等,用户只需输入初始概念,AI 能生成大纲、角色、场...最新AI资源1年前075.5K
Kimi K2.7 Code - 月之暗面Kimi开源的编程专用大模型Kimi K2.7 Code是月之暗面(Moonshot AI)发布并开源的编程专用大模型,属于Kimi K2系列的最新迭代版本。专为长上下文编程和复杂任务优化,聚焦代码生成、理解、调试及多文件项目架...最新AI资源3个月前075.4K
DeepSeek-V4 - 深度求索发布的新一代大语言模型系列DeepSeek-V4 是深度求索发布的新一代大语言模型系列预览版,已同步开源并开放 API。系列采用 MoE 架构,包含 V4-Pro(1.6T 参数 / 49B 激活)与 V4-Flash(284...最新AI资源4个月前075.4K
Goedel-Prover-V2 - 普林斯顿联合清华和英伟达等开源的定理证明模型Goedel-Prover-V2 是普林斯顿大学、清华大学和英伟达等顶尖机构联合推出的开源定理证明模型。模型基于创新技术如分层式数据合成、验证器引导的自我修正和模型平均等,显著提升自动形式化证明的性能...最新AI资源1年前075.4K
Z-Image - 阿里通义实验室开源的图像生成模型Z-Image是阿里通义实验室开源的图像生成模型,具有高效、快速和强大的图像生成能力。采用单流扩散Transformer架构(S3-DiT),将文本、视觉语义和图像VAE token整合为统一输入流...最新AI资源10个月前075.3K
MoE-TTS - 昆仑万维推出的最新语音生成框架MoE-TTS 是昆仑万维推出的语音合成框架,基于混合专家(MoE)架构,将预训练的大型语言模型(LLM)与语音专家模块结合。MoE-TTS 通过冻结文本模块参数、仅更新语音模块参数,保留强大的文本理...最新AI资源1年前075.3K
Nemotron 3 - 英伟达发布的开源 AI 模型系列Nemotron 3 是英伟达发布的开源 AI 模型系列,包含 Nano、Super 和 Ultra 三种规格。采用混合潜在专家混合(latent MoE)架构,显著提升推理效率并降低运行成本。其中...最新AI资源9个月前075.3K
Skywork-SWE-32B - 昆仑万维开源的自主代码智能体基座模型Skywork-SWE-32B是昆仑万维推出的开源的32B规模的软件工程(SWE)自主代码智能体基座模型。模型专注于软件工程任务,具备强大的仓库级代码修复能力,能在多轮交互和长文本处理的复杂场景中表现...最新AI资源1年前075.3K
Step-Audio-AQAA – StepFun推出的端到端大音频语言模型Step-Audio-AQAA 是 StepFun 团队推出的端到端大型音频语言模型,用于音频查询-音频回答(AQAA)任务。能直接处理音频输入生成自然、准确的语音回答,无需依赖传统的自动语音识别(A...最新AI资源1年前075.3K
Mureka V7.5 - 昆仑万维推出的先进AI音乐创作模型Mureka V7.5 是昆仑万维推出的先进 AI 音乐生成模型,专注于中文歌曲创作。模型能精准还原音色与演奏技法,生成自然流畅且富有情感的歌声。基于优化的自动语音识别(ASR)技术,Mureka V...最新AI资源1年前075.2K
Seed GR-3 - 字节跳动Seed团队推出的通用机器人模型Seed GR-3 是字节跳动推出的通用机器人模型,具有强大的泛化能力,能适应新环境和复杂指令。模型融合视觉、语言和动作信息,基于机器人数据、VR 人类轨迹数据和公开图文数据的三合一训练法,提升对新物...最新AI资源1年前075.2K
Lumina-DiMOO - 上海AI Lab联合华为昇腾开源的多模态大模型Lumina-DiMOO是上海人工智能实验室联合华为昇腾在2025年世界人工智能大会上推出的新一代多模态生成与理解统一模型。基于昇腾AI基础软硬件平台与MindSpeed MM多模态大模型套件,完成了...最新AI资源1年前075.2K
HunyuanImage 3.0 - 腾讯开源的免费多模态图像生成模型HunyuanImage 3.0(混元图像3.0)是腾讯发布并开源的原生多模态图像生成模型。模型参数规模达80B,是目前测评效果最好、参数量最大的开源生图模型。混元图像3.0支持实时生图功能,用户可边...最新AI资源12个月前075.2K
Ovis-U1 - 阿里推出的多模态统一AI模型Ovis-U1是阿里巴巴集团Ovis团队推出的多模态统一模型,参数规模达到30亿。模型具备多模态理解、文本到图像生成以及图像编辑等三大核心能力,凭借先进的架构设计和协同统一训练方法,支持实现高保真图像...最新AI资源1年前075.1K
EXAONE 4.0 - LG推出的混合推理模型EXAONE 4.0是韩国LG AI Research推出的混合推理大模型,融合通用自然语言处理和高级推理能力。模型支持韩语、英语和西班牙语,分为32B的专业版和1.2B的端侧版。专业版适用法律、会计...最新AI资源1年前075K
GLM-5.1-highspeed - 智谱AI发布的旗舰级高速推理APIGLM-5.1-highspeed 是智谱AI发布的旗舰级高速推理API,基于GLM-5.1打造,输出速度达到 400 tokens/s,刷新当前全球大模型厂商API的速度上限。最新AI资源4个月前074.9K
EmbodiChain - 跨维智能推出的开源具身智能开发平台EmbodiChain是跨维智能推出的开源具身智能开发平台,专注于解决具身智能模型训练中数据稀缺的问题。通过数据引擎实现大规模场景相关数据生成、Real2Sim 数据轨迹映射和多模态数据扩增,从根本上...最新AI资源8个月前074.9K
DeckSpeed - AI PPT制作工具,自然语言生成演示文稿DeckSpeed是AI演示文稿制作工具,基于对话式交互,用户基于自然语言表达需求,快速生成个性化幻灯片,无需依赖传统模板。工具支持实时反馈调整,用户能随时修改幻灯片的颜色、风格和内容,确保演示文稿完...最新AI资源1年前074.9K
XVERSE-Ent - 元象科技开源的泛娱乐领域中英大模型XVERSE-Ent是元象科技推出的专注于泛娱乐领域的开源大模型,包含中英文双版本,支持社交互动、游戏叙事和文化创作等场景。模型通过角色一致性强化、长剧情理解等技术优化,能在虚拟角色人设稳定性、复杂故...最新AI资源9个月前074.7K
New API - 开源的AI模型接口管理与分发系统,统一为标准化接口New API是基于Go语言开发的开源AI聚合网关工具,可统一管理30+种主流大模型(如OpenAI、Claude、Midjourney等),将不同模型接口转换为标准化OpenAI格式。最新AI资源9个月前074.7K
Kandinsky 5.0 - 俄罗斯AI团队开源的视频生成模型系列Kandinsky 5.0是俄罗斯AI团队开发的最新视频生成模型系列,主打轻量化设计与高性能表现。系列首款模型Kandinsky 5.0 Video Lite仅20亿参数却超越了同类14B大模型,尤其...最新AI资源11个月前074.7K
自动生成每日Product Hunt热门产品榜单综合介绍 Product Hunt 每日中文热榜是一个基于 GitHub Actions 的自动化工具,能够每天定时生成 Product Hunt 上的热门产品榜单,并以 Markdown 文件的形式...最新AI资源# AI开源项目2年前074.7K
UnifiedTTS - 一站式TTS API服务平台,实时性能监控UnifiedTTS 是一站式文本转语音(TTS)服务的平台。支持多种语言,包括中文、英文、日文和韩文等,能满足全球业务的需求。通过统一的 API 接口,整合多种主流的 TTS 服务,包括 Micro...最新AI资源1年前074.5K
Skywork UniPic 2.0 - 昆仑万维开源的高效多模态模型Skywork UniPic 2.0 是昆仑万维开源的高效多模态模型,专注于图像生成、编辑与理解。模型基于 2B 参数的 SD3.5-Medium 架构,通过预训练、渐进式双任务强化策略和联合训练,实...最新AI资源1年前074.4K
Confucius3-Math - 网易有道推出专注于数学教育的开源推理模型Confucius3-Math是网易有道开源的国内首个专注于数学教育的开源推理模型。具有140亿参数,专为K-12数学教育场景优化,可在单块消费级GPU(如RTX 4090D)上高效运行,推理性能约为...最新AI资源1年前074.4K
AudioFly - 科大讯飞开源的文本生成音效AI模型AudioFly是科大讯飞开源的文本生成音效的AI模型。基于潜在扩散模型架构,拥有10亿个参数,经过大规模、多样化的音频文本数据集训练,涵盖AudioSet、AudioCaps、TUT等公开数据集及内...最新AI资源12个月前074.3K
FLUX.1 Kontext - 黑森林推出的图像生成与编辑模型FLUX.1 Kontext是Black Forest Labs推出的图像生成与编辑模型,提供上下文感知的图像处理技术。模型能理解响应文本和图像提示,执行对象修改、风格转换、背景替换等任务,同时保持角...最新AI资源1年前074.2K
稿定AI社区 - AI创意内容设计平台,多种设计资源满足不同创作需求稿定AI社区是在线AI创意灵感平台,为用户提供丰富的创意设计资源和工具。平台涵盖多种设计领域,包括形象照、电商设计、节日主题、3D插画、头像设计、小红书素材、人像设计等,满足不同用户的需求。最新AI资源1年前074.1K
Mistral Code - Mistral AI推出面向企业的AI编程助手Mistral Code是Mistral AI推出的面向企业开发团队的AI编程助手,集成Codestral、Codestral Embed、Devstral 和Mistral Medium四大模型,支...最新AI资源1年前074.1K
CRIC深度智联 - 克而瑞推出的中国房地产首个AI AgentCRIC深度智联是克而瑞自主研发的中国房地产首个AI智能体,基于克而瑞20年房地产行业经验和数据积累与多模态大模型技术,打通数据整合、智能分析到内容生成全链路。最新AI资源1年前074K
ThinkSound - 阿里通义推出的音频生成模型ThinkSound是阿里通义语音团队推出的首个CoT(链式思考)音频生成模型。模型能为视频画面生成精准匹配的音效,基于引入CoT推理,解决传统技术难以捕捉画面动态细节和空间关系的问题。最新AI资源1年前074K
SAM Audio - Meta推出的开源多模态音频分割模型SAM Audio是Meta推出的开源多模态音频分割模型,从复杂的音频混合中精准分离出任意目标声音。通过结合文本、视觉和时间维度的提示,实现灵活、高效的音频处理,为音频编辑、去噪、声音提取等任务提供了...最新AI资源9个月前074K
AutoMV - M-A-P联合北邮、南大等开源的免费音乐视频生成系统AutoMV是M-A-P团队联合多所高校研发的开源音乐视频生成系统,能在无需训练的情况下根据完整歌曲自动生成连贯的MV。采用多智能体协作模式,包含音乐分析、编剧、导演和质检等模块,能精准解析歌词、节拍...最新AI资源9个月前074K
Genie Envisioner - 智元联合北航等开源的通用机器人操作平台Genie Envisioner(GE)是智元机器人团队联合新加坡国立大学、北京航空航天大学等机构开发的机器人操作统一平台。通过“先想象,后行动”的方式,让机器人更好地理解和执行任务。最新AI资源1年前073.9K
CWM - Meta FAIR开源的代码世界语言模型CWM(Code World Model)是Meta FAIR团队发布的一款320亿参数的开源代码世界语言模型,专为代码生成和推理设计。引入“世界模型”概念,能模拟代码执行过程,预测变量状态变化,提前...最新AI资源12个月前073.9K
Step-Audio-R1.1 - 阶跃星辰开源的全球首个原生语音推理模型Step-Audio-R1.1是阶跃星辰开源的全球首个原生语音推理模型,最新升级版本在权威评测榜单Artificial Analysis Speech Reasoning中以96.4%准确率登顶。模型...最新AI资源8个月前073.7K
Mureka V7 - 昆仑万维推出的AI音乐生成模型Mureka V7 是昆仑万维推出的先进 AI 音乐生成模型。模型基于 MusiCoT 技术,支持先规划音乐的整体结构,再填充细节,生成更具连贯性和艺术性的音乐作品。最新AI资源1年前073.6K
文心大模型 5.1 - 百度发布的新一代基础大模型文心大模型5.1(ERNIE 5.1)是百度发布的新一代基础大模型,采用创新的"多维弹性预训练"(Once-for-All)技术,实现"一次训练,生成多种规模模型"。通过弹性深度、弹性宽度与弹性稀疏度...最新AI资源4个月前073.6K
PersonaPlex - 英伟达开源的全双工语音对话模型PersonaPlex是英伟达开源的全双工语音对话模型,拥有70亿参数。摒弃了传统的语音识别→语言模型→文本到语音的级联流程,采用统一的Transformer架构,能同步处理语音理解与生成。模型支持全...最新AI资源8个月前073.6K
MinerU2.5 - 上海AI Lab联合北大开源的文档解析模型MinerU2.5是上海人工智能实验室与北京大学团队联合研发的解耦式视觉语言模型,专注于高效处理高分辨率文档图像解析。核心创新在于采用"先全局版面检测后局部内容识别"的两阶段设计:第一阶段通过低分辨率...最新AI资源11个月前073.5K
全球首个量子 AI 模型问世!SECQAI 发布 QLLM 即将进入 Beta 测试英国超安全软硬件公司 SECQAI 宣布推出全球首个量子大语言模型 (QLLM),将量子计算技术整合至传统 AI 模型中,以提升运算效率和问题解决能力。 量子力学 + AI = 更强大的 AI? ...最新AI资源2年前073.5K
MedASR - 谷歌开源的医疗语音识别模型MedASR是谷歌开源的1.05亿参数医疗语音识别模型,在5000小时脱敏临床语料上微调,针对药品、剂量、解剖术语优化,内置6-gram医学语言模型,在私有放射科数据集RAD-DICT上词错率仅4.6...最新AI资源9个月前073.4K
FLUX.2 [klein] - Black Forest Labs 开源的轻量级图像生成与编辑模型FLUX.2 [klein] 是 Black Forest Labs 推出的开源轻量级图像生成与编辑模型,专为快速推理和低延迟应用场景设计。支持文本生成图像、图像编辑以及多参考图像生成,能在不到1秒内...最新AI资源8个月前073.3K
UnifoLM-VLA-0 - 宇树科技开源的首款操作型大模型UnifoLM-VLA-0 是宇树科技 UnifoLM 系列的首款操作型大模型,突破传统视觉语言模型(VLM)仅能理解图像文字的局限,通过在机器人操作数据上的持续预训练,实现从"图文理解"向具备物理常...最新AI资源8个月前073.3K
AntSK FileChunk - 免费的AI语义文档切片工具,动态切片调整AntSK FileChunk 是免费的智能文档切片工具,专为 RAG(检索增强生成)应用设计。以语义为核心,将文档智能切分为语义完整、连贯的片段,支持多语言,可动态调整切片大小,确保上下文连贯性。最新AI资源1年前073.3K
悟能 - 商汤科技最新推出的具身智能平台悟能是商汤科技推出的具身智能平台,专为机器人和智能设备设计。悟能基于“开悟”世界模型与多模态大模型技术,整合视觉、语音、触觉等多传感器输入,具备强大的感知、决策和行动能力。最新AI资源1年前073.3K
日日新 V6.5 - 商汤科技推出的最新多模态推理大模型日日新 V6.5 是商汤科技推出的先进多模态推理大模型,专为处理图像与文本混合输入而设计,支持精准理解图像内容并结合文本生成描述或回答问题。最新AI资源1年前073.1K
Qwen-Image-Layered - 阿里团队开源的AI图像编辑模型Qwen-Image-Layered是阿里团队开源的AI图像编辑模型,能将普通图片智能分解为独立的透明图层,实现类似Photoshop的精准编辑。模型采用Apache 2.0协议开源,支持灵活控制图层...最新AI资源9个月前073.1K
Lucy Edit - 开源的AI视频编辑工具,自然语言描述编辑Lucy Edit 是开源的 AI 视频编辑工具,由 Decart AI 开发。允许用户通过简单的自然语言描述来编辑视频,例如“将人物换成北极熊”或“把场景变成2D卡通风格”,无需复杂的微调或使用遮罩...最新AI资源1年前073K
Midjourney V1- Midjourney推出的首个图生视频模型Midjourney V1 是Midjourney公司推出的首个 AI 视频生成模型,借助先进的AI技术,支持将静态图片转化为生动的动态视频。用户只需上传图片或用 Midjourney 生成的图像,点...最新AI资源1年前072.7K
Xiaomi-Robotics-0 - 小米开源的首代具身智能大模型Xiaomi-Robotics-0 是小米开源的首代具身智能大模型,拥有47亿参数,采用"大脑+小脑"混合架构设计。视觉语言大脑基于多模态大模型,负责理解人类模糊指令与空间推理;动作执行小脑则通过Di...最新AI资源7个月前072.7K
Step-Audio 2 mini - 阶跃星辰开源的语音大模型Step-Audio 2 mini 是阶跃星辰开源的端到端语音大模型。突破传统语音模型结构,采用真端到端多模态架构,直接将原始音频输入转化为语音响应输出,时延更低,能理解副语言信息与非人声信号。最新AI资源1年前072.6K
Vibe Kanban - 开源的免费AI编程代理任务管理工具Vibe Kanban是开源的AI编程代理任务管理工具,专为同时使用多个AI编程助手(如Claude Code、Gemini CLI、Codex等)的开发者设计。通过看板形式统一管理任务进度,支持并行...最新AI资源9个月前072.5K