мезо- (химия)Wan3.0 - 阿里云通义全网公测的新一代视频生成大模型
Wan3.0 是阿里云通义全网公测的新一代视频生成大模型,被称为"阿里最强视频模型"。在生成时长、万能创作、全能参考、真实感四大维度全面升级。单次可稳定生成最长30秒的一镜到底视频
мезо- (химия)SeedRealtime - 字节跳动 Seed 发布的原生音视频全双工大模型
SeedRealtime 是字节跳动 Seed 团队发布的原生音视频全双工大模型,首发落地于豆包 App 的「打电话」视频通话功能。与传统"语音识别→视觉理解→大模型推理→语音合成"的级联流水线不同...
мезо- (химия)Hy ASR 3.0 preview - 腾讯混元推出的新一代语音识别模型
Hy ASR 3.0 preview 是腾讯混元推出的新一代语音识别模型,深度融合最新大语言模型 Hy3 的语言理解能力与高精度语音识别技术,实现从"逐字转写"到"听懂语境"的跨越。模型采用 MoE ...
мезо- (химия)JoyAI-Video-Edit - 京东开源的实时流式视频编辑模型
JoyAI-Video-Edit 是京东开源的实时流式视频编辑模型,基于16B参数自回归扩散框架构建,在单张英伟达B200 GPU上即可实现720p分辨率约30FPS的实时处理,真正做到"边播边改"。
Qwen 3.8-Max - 阿里巴巴通义千问发布的旗舰级大模型
Qwen 3.8-Max 是阿里巴巴通义千问发布的旗舰级大模型,也是 Qwen 系列迄今规模最大、能力最强的模型。采用稀疏混合专家(MoE)架构,总参数达2.4万亿,推理时仅激活约950亿参数,在保持...
Qwen-Audio-3.0-ASR-Flash - 阿里通义千问发布的语音识别大模型
Qwen-Audio-3.0-ASR-Flash 是阿里巴巴通义千问团队发布的语音识别大模型,主打"长音频不丢词、行业词不用教"。模型在上下文一致性、行业词识别与热词定制化三大维度实现系统性升级,集成...
MiniMax H3 - 稀宇科技MiniMax发布的通用全模态生成模型
MiniMax H3是稀宇科技MiniMax发布的通用全模态生成模型,可在统一上下文中理解文本、图像、视频与声音,生成最高15秒、2K分辨率、带原生双声道音频的音视频。
Gemini 3.5 Flash-Lite - Google 发布的高吞吐低成本模型
Gemini 3.5 Flash-Lite 是 Google 发布的高吞吐低成本模型,官方定位为 3.5 系列中最快、最具成本效益的型号,面向 agentic search、文档处理与大规模生产流量...
Gemini 3.6 Flash - Google 发布的新一代主力模型
Gemini 3.6 Flash 是 Google 发布的新一代主力模型(Workhorse Model),是 Gemini 3.5 Flash 的升级版,主要面向生产级 AI 智能体(Agent)和...
TDream - 腾讯推出的 AI 内容创作平台
TDream是腾讯内测的AI内容创作平台,以"互动影游化创作"为核心定位,试图重构用户从内容生产到交互体验的全链路。区别于市面上仅输出单一线性视频的传统文生视频工具,TDream依托五大AI引擎,支持...









