# AI分享圈 > 最好最全的AI免费资源分享网站 --- ## 页面 - [My account](https://aisharenet.com/my-account/): - [Checkout](https://aisharenet.com/checkout/): - [Cart](https://aisharenet.com/cart/): You may be intereste... - [Shop](https://aisharenet.com/shop/): - [友情链接](https://aisharenet.com/links/): - [投稿](https://aisharenet.com/contribute/): - [排行榜](https://aisharenet.com/rankings/): - [我要投稿](https://aisharenet.com/woyaotougao/): - [找回密码](https://aisharenet.com/zhaohuimima/): - [会员中心](https://aisharenet.com/huiyuanzhongxin/): - [Privacy Policy](https://aisharenet.com/privacy-policy/): 1. Introduction We r... - [精选AI工具列表](https://aisharenet.com/tuijiangongju/): - [工具分类](https://aisharenet.com/tooltag/): --- ## 文章 - [商汤输入法AudioClaw - 商汤科技推出的AI语音智能助手](https://aisharenet.com/audioclaw/): 商汤输入法AudioClaw是什么 商汤... - [SenseAudio - 商汤科技推出的一站式 AI 语音开放平台](https://aisharenet.com/senseaudio/): SenseAudio是什么 SenseA... - [TurboQuant - Google Research 推出的突破性内存压缩算法](https://aisharenet.com/turboquant/): TurboQuant是什么 TurboQ... - [Gemini 3.1 Flash Live - Google 推出的旗舰级实时语音模型](https://aisharenet.com/gemini-31-flash-live/): Gemini 3. 1 Flash Li... - [Lyria 3 Pro - 谷歌推出的最先进AI音乐生成模型](https://aisharenet.com/lyria-3-pro/): Lyria 3 Pro是什么 Lyria... - [OpenCLI - 开源 AI 命令行工具框架,任何网站变成命令行](https://aisharenet.com/opencli/): OpenCLI是什么 OpenCLI是开... - [TuyaClaw - 涂鸦智能推出的数字与物理世界联动 AI Agent](https://aisharenet.com/tuyaclaw/): TuyaClaw是什么 TuyaClaw... - [TypeNo - 开源 AI 语音输入工具,专为 macOS 设计](https://aisharenet.com/typeno/): TypeNo是什么 TypeNo 是 m... - [HiDreamClaw - 智象未来推出的多模态原生AI智能体应用](https://aisharenet.com/hidreamclaw/): HiDreamClaw是什么 HiDre... - [PrismAudio - 阿里通义实验室开源的视频生成音频框架](https://aisharenet.com/prismaudio/): PrismAudio是什么 PrismA... - [MAI-Image-2 - 微软推出的第二代自研图像生成模型](https://aisharenet.com/mai-image-2/): MAI-Image-2是什么 MAI-I... - [NineClaw - 好未来推出的教师专属 AI 原生桌面超级智能体](https://aisharenet.com/nineclaw/): NineClaw是什么 NineClaw... - [EdgeClaw - 面壁智能联合清华等开源的端云协同 AI 智能体框架](https://aisharenet.com/edgeclaw/): EdgeClaw是什么 EdgeClaw... - [Qwen3.5-Max-Preview - 阿里通义千问推出的旗舰大模型预览版](https://aisharenet.com/qwen35-max-preview/): Qwen3. 5-Max-Preview... - [微信ClawBot - 微信官方推出连接 OpenClaw 的 AI 插件](https://aisharenet.com/wechat-clawbot/): 微信ClawBot是什么 微信ClawB... - [YouClaw - Chat2DB 开源的极简 AI Agent 桌面客户端](https://aisharenet.com/youclaw/): YouClaw是什么 YouClaw 是... - [Xiaomi MiMo-V2-Omni - 小米推出的Agent全模态基座模型](https://aisharenet.com/xiaomi-mimo-v2-omni/): Xiaomi MiMo-V2-Omni是... - [Vidu Claw - Vidu AI 推出的 AI 视频创意Agent](https://aisharenet.com/vidu-claw/): Vidu Claw是什么 Vidu Cl... - [Composer 2 - Cursor 推出的专有代码大模型](https://aisharenet.com/composer-2/): Composer 2是什么 Compos... - [MiMo-V2-TTS - 小米推出的自研语音合成大模型](https://aisharenet.com/mimo-v2-tts/): MiMo-V2-TTS是什么 MiMo-... - [MiniMax M2.7 - MiniMax 推出的旗舰级 Agent 推理大模型](https://aisharenet.com/minimax-m27/): MiniMax M2. 7是什么 Min... - [Xiaomi MiMo-V2-Pro - 小米推出的旗舰级MoE大模型](https://aisharenet.com/xiaomi-mimo-v2-pro/): Xiaomi MiMo-V2-Pro是什... - [Seedance 2.0 - 字节Seed团队推出的第二代多模态AI视频生成模型](https://aisharenet.com/seedance-20/): Seedance 2. 0是什么 See... - [GPT-5.4 mini - OpenAI 推出的轻量级 AI 模型](https://aisharenet.com/gpt-54-mini/): GPT-5. 4 mini是什么 GPT... - [SkyClaw - Skywork AI 推出的云端AI Agent工作空间](https://aisharenet.com/skyclaw/): SkyClaw是什么 SkyClaw 是... - [Mistral Small 4 - Mistral AI 开源的多模态大模型](https://aisharenet.com/mistral-small-4/): Mistral Small 4是什么 M... - [肉包 - 开源AI手机自动化助手,能看懂屏幕自动执行](https://aisharenet.com/roubao/): 肉包是什么 肉包(Roubao)是开源的... - [HiClaw - 阿里云开源的多智能体团队协作系统](https://aisharenet.com/hiclaw/): HiClaw是什么 HiClaw 是阿里... - [NemoClaw - NVIDIA 推出的开源企业级 AI Agent 安全增强平台](https://aisharenet.com/nemoclaw/): NemoClaw 是什么 NemoCla... - [OpenMAIC - 清华大学开源的多智能体AI课堂系统](https://aisharenet.com/openmaic/): OpenMAIC是什么 OpenMAIC... - [Clawith - DataElem 团队开源的多智能体协作平台](https://aisharenet.com/clawith/): Clawith是什么 Clawith 是... - [Fun-CineForge - 阿里通义实验室开源的影视级配音多模态大模型](https://aisharenet.com/fun-cineforge/): Fun-CineForge是什么 Fun... - [MiniMax Music 2.5+ - MiniMax推出的AI音乐生成模型](https://aisharenet.com/minimax-music-25/): MiniMax Music 2. 5+是... - [GLM-5-Turbo - 智谱 AI 推出专为 OpenClaw 场景深度优化的基座模型](https://aisharenet.com/glm-5-turbo/): GLM-5-Turbo是什么 GLM-5... - [Fun-AudioGen-VD - 阿里通义实验室推出的声音设计系统](https://aisharenet.com/fun-audiogen-vd/): Fun-AudioGen-VD是什么 F... - [Gemini Embedding 2 - Google推出的首个原生五模态 Embedding 模型](https://aisharenet.com/gemini-embedding-2/): Gemini Embedding 2是什... - [Nemotron 3 Super - NVIDIA开源的大语言模型,专为AI Agent推理设计](https://aisharenet.com/nemotron-3-super/): Nemotron 3 Super是什么 ... - [Paperclip - 开源的AI Agent编排平台,管理和协调多个AI智能体](https://aisharenet.com/paperclip/): Paperclip是什么 Papercl... - [AlphaClaw - 熵简科技推出的金融投研 AI Agent 工具](https://aisharenet.com/alphaclaw/): AlphaClaw是什么 AlphaCl... - [ArkClaw - 火山引擎推出的云端AI助手,零门槛部署OpenClaw](https://aisharenet.com/arkclaw/): ArkClaw是什么 ArkClaw是火... - [GPT-5.3 Instant - OpenAI推出的GPT-5系列快速响应版本模型](https://aisharenet.com/gpt-53-instant/): GPT-5. 3 Instant是什么 ... - [Fun-CosyVoice3.5 - 阿里通义实验室推出的第三代语音合成大模型](https://aisharenet.com/fun-cosyvoice35/): Fun-CosyVoice3. 5是什么... - [Gemini 3.1 Flash-Lite - Google推出的最轻量、最具性价比的模型](https://aisharenet.com/gemini-31-flash-lite/): Gemini 3. 1 Flash-Li... - [FireRed-OCR - 小红书团队开源的端到端文档解析模型](https://aisharenet.com/firered-ocr/): FireRed-OCR是什么 FireR... - [DuClaw - 百度智能云推出的OpenClaw云部署服务](https://aisharenet.com/duclaw/): DuClaw是什么 DuClaw是百度智... - [小艺Claw - 华为推出的个人手机AI助理,一键接入OpenClaw](https://aisharenet.com/xiaoyiclaw/): 小艺Claw是什么 小艺Claw是华为基... - [GPT‑5.4 - OpenAI推出的全能旗舰AI模型](https://aisharenet.com/gpt54/): GPT‑5. 4是什么 GPT-5. 4... - [Mobile-Agent-v3.5 - 阿里通义开源的原生GUI Agent框架](https://aisharenet.com/mobile-agent-v35/): Mobile-Agent-v3. 5是什... - [gws - 谷歌开源的CLI工具,支持接入各类AI Agent系统](https://aisharenet.com/gws/): gws是什么 gws 是 Google ... - [HY-WU - 腾讯混元开源的实时神经参数生成框架](https://aisharenet.com/hy-wu/): HY-WU是什么 HY-WU(混元无相)... - [MiroFish - 开源的AI预测引擎,智能体进行自由交互与社会演化](https://aisharenet.com/mirofish/): MiroFish是什么 MiroFish... - [ClawFeed - 开源AI新闻摘要工具,一站式聚合任意网站内容](https://aisharenet.com/clawfeed/): ClawFeed是什么 ClawFeed... - [FireRed-Image-Edit - 小红书团队开源的通用图像编辑模型](https://aisharenet.com/firered-image-edit/): FireRed-Image-Edit是什... - [OpenAkita - 开源的自进化AI助手框架,多平台无缝协作](https://aisharenet.com/openakita/): OpenAkita是什么 OpenAki... - [ClawWork - 香港大学数据科学实验室开源的AI经济压力测试框架](https://aisharenet.com/clawwork/): ClawWork是什么 ClawWork... - [Ming-Omni-tts - 蚂蚁联合Inclusion AI开源的多模态音频生成模型](https://aisharenet.com/ming-omni-tts/): Ming-Omni-tts是什么 Min... - [Qwen3.5 - 阿里通义千问团队开源的最新一代大语言模型](https://aisharenet.com/qwen35/): Qwen3. 5是什么 Qwen3. 5... - [Ring-2.5-1T - 蚂蚁百灵开源的万亿参数混合线性架构思考模型](https://aisharenet.com/ring-25-1t/): Ring-2. 5-1T是什么 Ring... - [Xiaomi-Robotics-0 - 小米开源的首代具身智能大模型](https://aisharenet.com/xiaomi-robotics-0/): Xiaomi-Robotics-0是什么... - [AionUi - 免费开源的多AI Agent桌面应用](https://aisharenet.com/aionui/): AionUi是什么 AionUi是一个免... - [Ming-flash-omni 2.0 - 蚂蚁集团开源的全模态大模型](https://aisharenet.com/ming-flash-omni-20/): Ming-flash-omni 2. 0... - [Protenix-v1 - 字节Seed团队推出的首个开源蛋白质结构预测模型](https://aisharenet.com/protenix-v1/): Protenix-v1是什么 Prote... - [Clawra - 基于OpenClaw框架开源的AI女友程序](https://aisharenet.com/clawra/): Clawra是什么 Clawra是一个基... - [GLM-5 - 智谱AI推出的旗舰级开源大模型](https://aisharenet.com/glm-5/): GLM-5是什么 GLM-5是智谱AI推... - [nanobot - HKUDS开源的超轻量级个人AI助手框架](https://aisharenet.com/nanobot/): nanobot是什么 nanobot 是... - [RynnBrain - 阿里巴巴达摩院开源的具身智能大脑基础模型](https://aisharenet.com/rynnbrain/): RynnBrain是什么 RynnBra... - [PaperBanana - 北大与谷歌联合开源的AI学术插图自动生成框架](https://aisharenet.com/paperbanana/): PaperBanana是什么 Paper... - [Intern-S1-Pro - 上海AI Lab开源的首个万亿参数科学多模态大模型](https://aisharenet.com/intern-s1-pro/): Intern-S1-Pro是什么 Int... - [LingBot-VA - 蚂蚁灵波开源的首个“自回归视频-动作世界模型”](https://aisharenet.com/lingbot-va/): LingBot-VA是什么 LingBo... - [MiniCPM-o 4.5 - 面壁智能开源的 9B 全模态旗舰模型](https://aisharenet.com/minicpm-o-45/): MiniCPM-o 4. 5是什么 Mi... - [SoulX-FlashTalk - Soul App AI团队开源的实时数字人生成模型](https://aisharenet.com/soulx-flashtalk/): SoulX-FlashTalk是什么 S... - [Qwen3-Coder-Next - 阿里通义千问开源的编程智能体混合模型](https://aisharenet.com/qwen3-coder-next/): Qwen3-Coder-Next是什么 ... - [GLM-OCR - 智谱开源的 0.9B 轻量级专业 OCR 模型](https://aisharenet.com/glm-ocr/): GLM-OCR是什么 GLM-OCR 是... - [Step 3.5 Flash - 阶跃星辰开源的 1960 亿稀疏 MoE 模型](https://aisharenet.com/step-35-flash/): Step 3. 5 Flash是什么 S... - [UnifoLM-VLA-0 - 宇树科技开源的首款操作型大模型](https://aisharenet.com/unifolm-vla-0/): UnifoLM-VLA-0是什么 Uni... - [SenseNova-MARS - 商汤科技开源的多模态搜索推理Agent语言模型](https://aisharenet.com/sensenova-mars/): SenseNova-MARS是什么 Se... - [MOVA - 创智学院联合模思智能开源的端到端音视频生成模型](https://aisharenet.com/mova/): MOVA是什么 MOVA(MOSS-Vi... - [LingBot-World - 蚂蚁旗下灵波科技开源的交互式世界模型](https://aisharenet.com/lingbot-world/): LingBot-World是什么 Lin... - [SkyReels-V3 - 昆仑万维Skywork AI开源的多模态视频生成模型](https://aisharenet.com/skyreels-v3/): SkyReels-V3是什么 SkyRe... - [LingBot-Depth - 蚂蚁灵波科技开源的高精度空间感知模型](https://aisharenet.com/lingbot-depth/): LingBot-Depth是什么 Lin... - [DeepSeek-OCR 2 - DeepSeek团队开源的新一代OCR模型](https://aisharenet.com/deepseek-ocr-2/): DeepSeek-OCR 2是什么 De... - [Kimi K2.5 - 月之暗面开源的新一代旗舰模型](https://aisharenet.com/kimi-k25/): Kimi K2. 5是什么 Kimi K... - [Moltbot - 开源的本地优先AI助手,支持多渠道与用户交互](https://aisharenet.com/moltbot/): Moltbot是什么 Moltbot(原... - [json-render - Vercel Labs开源的AI生成UI的工具](https://aisharenet.com/json-render/): json-render是什么 json-... - [FlowAct-R1 - 字节跳动开源的实时交互数字人视频生成框架](https://aisharenet.com/flowact-r1/): FlowAct-R1是什么 FlowAc... - [VibeVoice-ASR - 微软开源的统一语音转文本(ASR)模型](https://aisharenet.com/vibevoice-asr/): VibeVoice-ASR是什么 Vib... - [Qwen3-TTS - 阿里云千问团队开源的语音合成模型系列](https://aisharenet.com/qwen3-tts/): Qwen3-TTS是什么 Qwen3-T... - [Chroma 1.0 - FlashLabs开源的全球首个实时端到端语音对话模型](https://aisharenet.com/chroma-10/): Chroma 1. 0是什么 Chrom... - [AgentCPM-Report - 清华联合面壁智能等开源的深度调研智能体工具](https://aisharenet.com/agentcpm-report/): AgentCPM-Report是什么 A... - [EmbodiChain - 跨维智能推出的开源具身智能开发平台](https://aisharenet.com/embodichain/): EmbodiChain是什么 Embod... - [Step3-VL-10B - 阶跃星辰开源的100亿参数多模态AI模型](https://aisharenet.com/step3-vl-10b/): Step3-VL-10B是什么 Step... - [PersonaPlex - 英伟达开源的全双工语音对话模型](https://aisharenet.com/personaplex/): PersonaPlex是什么 Perso... - [GLM-4.7-Flash - 智谱开源的混合专家架构语言模型](https://aisharenet.com/glm-47-flash/): GLM-4. 7-Flash是什么 GL... - [NovaSR - 开源的音频超分辨率模型,提升音频采样率](https://aisharenet.com/novasr/): NovaSR是什么 NovaSR是开源的... - [FLUX.2 [klein] - Black Forest Labs 开源的轻量级图像生成与编辑模型](https://aisharenet.com/flux2-klein/): FLUX. 2 是什么 FLUX. 2 ... - [TranslateGemma - 谷歌开源的机器翻译模型系列](https://aisharenet.com/translategemma/): TranslateGemma是什么 Tr... - [OpenWork - 开源AI Agent工作流桌面应用,Claude Cowork的免费平替](https://aisharenet.com/openwork/): OpenWork是什么 OpenWork... - [ArenaRL - 高德地图联合阿里通义开源的对比式强化学习方法](https://aisharenet.com/arenarl/): ArenaRL是什么 ArenaRL是高... - [Step-Audio-R1.1 - 阶跃星辰开源的全球首个原生语音推理模型](https://aisharenet.com/step-audio-r11/): Step-Audio-R1. 1是什么 ... - [OctoCodingBench - MiniMax开源面向Coding Agent标准的评测集](https://aisharenet.com/octocodingbench/): OctoCodingBench是什么 O... --- # # Detailed Content ## 页面 ### My account - Published: 2025-09-15 - Modified: 2025-09-15 - URL: https://aisharenet.com/my-account/ --- ### Checkout - Published: 2025-09-15 - Modified: 2025-09-15 - URL: https://aisharenet.com/checkout/ --- ### Cart - Published: 2025-09-15 - Modified: 2025-09-15 - URL: https://aisharenet.com/cart/ You may be interested in... Your cart is currently empty! New in store --- ### Shop - Published: 2025-09-15 - Modified: 2025-09-15 - URL: https://aisharenet.com/shop/ --- ### 友情链接 - Published: 2025-05-29 - Modified: 2025-05-29 - URL: https://aisharenet.com/links/ --- ### 投稿 - Published: 2025-05-29 - Modified: 2025-05-29 - URL: https://aisharenet.com/contribute/ --- ### 排行榜 - Published: 2025-05-26 - Modified: 2025-05-26 - URL: https://aisharenet.com/rankings/ --- ### 我要投稿 - Published: 2025-02-03 - Modified: 2025-02-03 - URL: https://aisharenet.com/woyaotougao/ --- ### 找回密码 - Published: 2025-02-03 - Modified: 2025-02-03 - URL: https://aisharenet.com/zhaohuimima/ --- ### 会员中心 - Published: 2025-02-03 - Modified: 2025-02-03 - URL: https://aisharenet.com/huiyuanzhongxin/ --- ### Privacy Policy - Published: 2025-01-30 - Modified: 2025-01-31 - URL: https://aisharenet.com/privacy-policy/ 1. Introduction We respect your privacy and are committed to complying with applicable privacy laws, including the General Data Protection Regulation (GDPR). This policy explains how we collect, use, and protect your data when you visit our website. ... --- ### 精选AI工具列表 - Published: 2024-09-24 - Modified: 2025-05-26 - URL: https://aisharenet.com/tuijiangongju/ --- ### 工具分类 - Published: 2024-09-24 - Modified: 2025-05-26 - URL: https://aisharenet.com/tooltag/ --- --- ## 文章 ### 商汤输入法AudioClaw - 商汤科技推出的AI语音智能助手 - Published: 2026-03-29 - Modified: 2026-03-29 - URL: https://aisharenet.com/audioclaw/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 商汤输入法AudioClaw是什么 商汤输入法AudioClaw是商汤科技基于日日新多模态大模型打造的AI语音智能应用,深度接入OpenClaw底层能力,定位为"会听话的龙虾"智能助手。突破传统输入法单一语音输入局限,集语音输入、会议记录、内容改写、知识沉淀、执行助手于一体,支持毫秒级精准识别并自动净化口语冗余,可智能生成多模态会议总结、沉淀专属知识库,深度适配微信等各类办公场景。 商汤输入法AudioClaw的功能特色 语音输入与精准识别:毫秒级识别速度,自动净化口语冗余(如"嗯""啊"等语气... --- ### SenseAudio - 商汤科技推出的一站式 AI 语音开放平台 - Published: 2026-03-28 - Modified: 2026-03-28 - URL: https://aisharenet.com/senseaudio/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 SenseAudio是什么 SenseAudio 是商汤科技推出的AI语音开放平台,面向开发者与企业提供一站式语音AI解决方案。平台集成语音识别(ASR)、语音合成(TTS)、音色克隆等核心能力,语音识别覆盖20+语言并支持说话人分离,语音合成基于千亿参数大模型提供70+种高拟真音色,支持32kHz/48kHz高保真输出。音色克隆功能仅需3秒音频即可精准复刻声音,文生音色功能可通过文字描述生成定制化声音。 SenseAudio的功能特色 语音识别(ASR):支持20+语言,低延时高精准,具备说话... --- ### TurboQuant - Google Research 推出的突破性内存压缩算法 - Published: 2026-03-28 - Modified: 2026-03-28 - URL: https://aisharenet.com/turboquant/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 TurboQuant是什么 TurboQuant 是 Google Research 推出的突破性内存压缩算法,专为解决大语言模型推理中的 KV 缓存瓶颈而设计。技术通过 PolarQuant 极坐标量化与 QJL 量化变换相结合,将传统 16bit/32bit 的键值缓存压缩至仅 3bit,实现 6 倍以上内存节省,同时在英伟达 H100 GPU 上带来最高 8 倍的注意力计算加速。 TurboQuant的功能特色 极致压缩:将 KV 缓存从常规的 16bit/32bit 压缩至 3bit,实... --- ### Gemini 3.1 Flash Live - Google 推出的旗舰级实时语音模型 - Published: 2026-03-27 - Modified: 2026-03-27 - URL: https://aisharenet.com/gemini-31-flash-live/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 Gemini 3. 1 Flash Live是什么 Gemini 3. 1 Flash Live 是 Google 推出的旗舰级实时语音模型,被誉为"迄今最高质量的音频和语音模型"。主打超低延迟的自然对话体验,支持 90+ 种语言的原生多模态交互,能精准识别音调、语速和情绪变化,动态调整回应风格。模型具备长对话记忆能力,在 ComplexFuncBench Audio 测试中达到 90. 8% 的复杂指令遵循率,并内置 SynthID 水印确保内容安全。 Gemini 3. 1 Flash Li... --- ### Lyria 3 Pro - 谷歌推出的最先进AI音乐生成模型 - Published: 2026-03-27 - Modified: 2026-03-27 - URL: https://aisharenet.com/lyria-3-pro/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 Lyria 3 Pro是什么 Lyria 3 Pro是谷歌推出的最先进的AI音乐生成模型。相比前代Lyria 3仅30秒的生成时长,Pro版本可一次性生成长达3分钟的完整音轨,精准控制前奏、主歌、副歌、桥段等歌曲结构。模型已登陆Gemini应用(付费订阅)、Google Vids视频工具、ProducerAI创作平台及Vertex AI企业版,支持多风格过渡与高质量成品输出。所有生成音频均嵌入SynthID数字水印,训练数据来自YouTube及授权内容,同时避免直接模仿特定艺人风格,仅将其作为灵... --- ### OpenCLI - 开源 AI 命令行工具框架,任何网站变成命令行 - Published: 2026-03-27 - Modified: 2026-03-27 - URL: https://aisharenet.com/opencli/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 OpenCLI是什么 OpenCLI是开源的命令行工具框架,将网站、Electron应用和本地命令行工具统一转化为可通过命令行操作的接口,将网站(如B站、知乎、Twitter等)和Electron应用(如Cursor、Notion、Discord等)的操作转化为命令行命令,用户可通过终端直接执行操作,如获取热门内容、搜索信息、发送消息等。支持复用Chrome浏览器已登录的账号状态,无需额外配置密钥或凭证,降低使用门槛。 OpenCLI的功能特色 核心定位:"Make Any Website & ... --- ### TuyaClaw - 涂鸦智能推出的数字与物理世界联动 AI Agent - Published: 2026-03-26 - Modified: 2026-03-26 - URL: https://aisharenet.com/tuyaclaw/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 TuyaClaw是什么 TuyaClaw 是涂鸦智能(Tuya Smart)推出的 AI 助理,基于 OpenClaw 架构搭建,是全球首个同时打通数字世界与物理世界的 AI Agent。与市面上仅能在屏幕内执行任务的"龙虾"产品不同,TuyaClaw 突破了纯数字自动化的局限,让 AI 从"对话框里的助手"升级为能真正管理现实生活的智能管家。 TuyaClaw的功能特色 数字员工能力:自动执行点击、输入、浏览等操作,一键完成文档发布、小红书/飞书内容分发,集成 AI 图片/视频生成与发布。 生... --- ### TypeNo - 开源 AI 语音输入工具,专为 macOS 设计 - Published: 2026-03-26 - Modified: 2026-03-26 - URL: https://aisharenet.com/typeno/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 TypeNo是什么 TypeNo 是 marswaveai 团队开源的中文语音输入工具,专为 macOS 打造。用户只需轻点 Control 键即可录音,松手后语音会在本地实时转为文字并自动填入当前应用。TypeNo 基于 coli 引擎实现离线识别,无需联网、无需注册,所有数据本地处理,充分保障隐私。TypeNo 支持拖拽音频文件批量转写,采用 GPL v3. 0 协议完全免费。 TypeNo的功能特色 极简交互:用户只需短按 Control 键即可开始或停止录音,全程无需打开任何窗口,让语音... --- ### HiDreamClaw - 智象未来推出的多模态原生AI智能体应用 - Published: 2026-03-25 - Modified: 2026-03-25 - URL: https://aisharenet.com/hidreamclaw/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 HiDreamClaw是什么 HiDreamClaw 是智象未来(HiDream. ai)推出的多模态原生AI智能体应用,定位为图片与视频生成垂直领域的创作助手。目前已接入其海外平台vivago,面向创作者提供7×24小时在线服务。用户通过一套积分体系即可调用HiDream自研模型及Nano Banana、Google Veo、OpenAI Sora等前沿生成能力,支持从灵感整理、文案起草到成品输出的全流程创作辅助。 HiDreamClaw的功能特色 多模态内容生成:内置HiDream AIGC... --- ### PrismAudio - 阿里通义实验室开源的视频生成音频框架 - Published: 2026-03-25 - Modified: 2026-03-25 - URL: https://aisharenet.com/prismaudio/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 PrismAudio是什么 PrismAudio 是阿里通义实验室推出的视频生成音频框架,专注于为视频自动匹配严丝合缝的环境音效。框架创新性地引入"分解式思维链"(CoT)机制,让模型在生成音频前先分析视频内容、声音时序、音质特征和空间位置,实现"先思考,再发声"。系统内置语义、时序、美学、空间四位"虚拟老师"进行多维度评分,通过 Fast-GRPO 强化学习算法综合优化,确保声音与画面内容、节奏、方位精准匹配。 PrismAudio的功能特色 分解式思维链(Chain-of-Thought):... --- ### MAI-Image-2 - 微软推出的第二代自研图像生成模型 - Published: 2026-03-25 - Modified: 2026-03-25 - URL: https://aisharenet.com/mai-image-2/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 MAI-Image-2是什么 MAI-Image-2 是微软推出的第二代自研图像生成模型,模型在权威评测平台 LMArena 中跃升至全球第三位,仅次于谷歌和 OpenAI,标志着微软在图像生成领域实现从"追赶者"到"第一梯队"的跨越。核心优势在于精准的文本渲染能力,可清晰生成信息图表、演示幻灯片中的文字内容,具备极致写实能力和电影级构图表现,覆盖从商业创意到超现实艺术的广泛场景。 MAI-Image-2的功能特色 精准文本渲染:专门优化文字生成能力,可清晰呈现信息图表、演示幻灯片、复杂逻辑图表... --- ### NineClaw - 好未来推出的教师专属 AI 原生桌面超级智能体 - Published: 2026-03-25 - Modified: 2026-03-25 - URL: https://aisharenet.com/nineclaw/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 NineClaw是什么 NineClaw(九章龙虾) 是好未来(TAL)推出的行业首款教师专属AI原生桌面超级智能体,昵称"九龙"。深度融合好未来20年教研积累与海量题库资源,采用本地化运行架构,支持Windows和MacOS双平台,可在零配置状态下开箱即用。教师通过自然语言即可驱动系统,自动完成教案生成、学情分析、课件制作、分层作业布置、试题组卷等复杂任务。产品内置独立沙箱和封闭技能体系,深度集成飞书、钉钉、企业微信等主流办公工具,确保校园数据安全的同时,实现从备课到课后反馈的全流程智能化,助... --- ### EdgeClaw - 面壁智能联合清华等开源的端云协同 AI 智能体框架 - Published: 2026-03-24 - Modified: 2026-03-24 - URL: https://aisharenet.com/edgeclaw/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 EdgeClaw是什么 EdgeClaw 是面壁智能联合清华大学等机构开源的端云协同 AI 智能体框架,主打安全可控与本地部署。首创三层数据安全协议(S1/S2/S3),通过规则检测器与本地 LLM 语义检测器实时分类请求敏感度,实现公开数据上云、敏感数据脱敏、私密数据锁死本地。EdgeClaw 采用双轨记忆机制,云端仅访问脱敏版对话历史,完整记忆仅限本地模型访问,杜绝隐私泄露。支持成本感知协同,将简单请求路由至本地低价模型,仅复杂任务调用云端,大幅降低 Token 开支。配套硬件 EdgeCl... --- ### Qwen3.5-Max-Preview - 阿里通义千问推出的旗舰大模型预览版 - Published: 2026-03-24 - Modified: 2026-03-24 - URL: https://aisharenet.com/qwen35-max-preview/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 Qwen3. 5-Max-Preview是什么 Qwen3. 5-Max-Preview 是阿里通义千问团队推出的旗舰大模型预览版,在 LM Arena 国际大模型竞技场以1464分跻身全球前五、国内第一,标志着国产大模型首次进入全球第一梯队。模型采用 MoE 架构,数学能力全球第五、创意写作较上一代提升57分,支持256K超长上下文。 Qwen3. 5-Max-Preview的功能特色 数学推理:复杂数学计算与逻辑推导能力进入全球前五,较上一代提升49分。 创意写作:高质量文学、营销及创意文案... --- ### 微信ClawBot - 微信官方推出连接 OpenClaw 的 AI 插件 - Published: 2026-03-23 - Modified: 2026-03-23 - URL: https://aisharenet.com/wechat-clawbot/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 微信ClawBot是什么 微信ClawBot是微信官方推出的AI插件,核心定位是连接OpenClaw(开源AI智能体框架)与微信的消息通道。用户只需在部署OpenClaw的设备上执行一条命令完成安装,可通过微信聊天界面直接发送自然语言指令,远程调用本地或云端AI Agent执行任务,覆盖学习辅助、办公处理、内容创作、数据提取等场景。插件采用严格的私密设计,仅限个人单点使用,不支持群聊且其他用户无法添加你的ClawBot。 微信ClawBot的功能特色 远程AI操控:通过微信聊天界面直接发送自然语... --- ### YouClaw - Chat2DB 开源的极简 AI Agent 桌面客户端 - Published: 2026-03-23 - Modified: 2026-03-23 - URL: https://aisharenet.com/youclaw/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 YouClaw是什么 YouClaw 是 Chat2DB 团队推出的极简 AI Agent 桌面客户端,主打"最懂你的 AI 个人助理"定位。基于 Tauri 2 + React 构建,安装包仅约 30MB,支持 Windows、macOS 和 Linux 跨平台运行。核心功能涵盖智能文档处理,自动生成 PPT、研报、系统自动化,浏览器操作、桌面整理、多平台消息枢纽(微信/钉钉/飞书等社群自动回复)以及长期记忆系统。用户无需配置环境或编写代码,下载扫码即可使用,支持以 Markdown 自定义技... --- ### Xiaomi MiMo-V2-Omni - 小米推出的Agent全模态基座模型 - Published: 2026-03-23 - Modified: 2026-03-23 - URL: https://aisharenet.com/xiaomi-mimo-v2-omni/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 Xiaomi MiMo-V2-Omni是什么 Xiaomi MiMo-V2-Omni 是小米推出的面向Agent时代的全模态基座模型,专为现实世界中复杂的多模态交互与执行场景打造。模型从底层构建了融合文本、视觉、语音的统一架构,将"感知"与"行动"深度绑定,原生具备多模态感知、工具调用、函数执行及GUI操作能力。在正式发布前,早期测试版本以「Healer Alpha」为代号匿名上架OpenRouter。 Xiaomi MiMo-V2-Omni的功能特色 全模态统一架构:从底层原生融合文本、视觉、... --- ### Vidu Claw - Vidu AI 推出的 AI 视频创意Agent - Published: 2026-03-23 - Modified: 2026-03-23 - URL: https://aisharenet.com/vidu-claw/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 Vidu Claw是什么 Vidu Claw(代号"V龙")是生数科技旗下 Vidu AI 平台推出的 AI 创意智能体,定位为"你的第一个 AI 创意员工"。基于 Vidu 视频大模型构建,能自动完成从创意理解、脚本撰写、分镜设计到视频生成、配乐合成的全流程视频制作。用户只需输入简单想法或上传产品图+一句话描述,即可一键生成 15-30 秒高质量广告片。 Vidu Claw的功能特色 全自动视频创作流水线:用户只需输入简单想法(如"产品展示""夏日大促"),系统自动完成"创意理解→脚本撰写→分... --- ### Composer 2 - Cursor 推出的专有代码大模型 - Published: 2026-03-23 - Modified: 2026-03-23 - URL: https://aisharenet.com/composer-2/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 Composer 2是什么 Composer 2 是 AI 编程平台 Cursor 推出的专有代码大模型,主打"长周期智能体编程"。模型支持 20 万 Token 上下文窗口,能自主处理包含数百个操作的复杂开发任务,在 Terminal-Bench 2. 0 基准测试中以 61. 7 分超越 Claude Opus 4. 6(58. 0 分)。标准版定价仅为每百万输入 Token 0. 5 美元、输出 Token 2. 5 美元,较前代 Composer 1. 5 降价 86%,实现了智能与成本... --- ### MiMo-V2-TTS - 小米推出的自研语音合成大模型 - Published: 2026-03-23 - Modified: 2026-03-23 - URL: https://aisharenet.com/mimo-v2-tts/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 MiMo-V2-TTS是什么 MiMo-V2-TTS是小米推出的自研语音合成大模型,与MiMo-V2-Pro、MiMo-V2-Omni共同构成小米面向"Agent时代"的三大基础模型矩阵。模型基于自研Audio Tokenizer和多码本语音-文本联合建模架构,经过上亿小时语音数据的大规模预训练与多维度强化学习,实现了高度可控的多粒度语音风格控制。用户可通过自然语言指令精准调节情感表达,支持东北话、四川话、粤语等多种方言演绎,具备高质量歌声合成能力,能在同一模型内实现说、演、唱三位一体。 MiM... --- ### MiniMax M2.7 - MiniMax 推出的旗舰级 Agent 推理大模型 - Published: 2026-03-21 - Modified: 2026-03-21 - URL: https://aisharenet.com/minimax-m27/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 MiniMax M2. 7是什么 MiniMax M2. 7 是 MiniMax 推出的旗舰级 Agent 推理大模型,主打"模型自我进化"能力。模型通过构建 Agent Harness 体系,深度参与自身训练与优化流程,在部分研发场景中可承担 30%-50% 的工作量,在内部评测集上实现约 30% 的效果提升。M2. 7 在软件工程能力上表现突出,SWE-Pro 得分 56. 22%,支持端到端项目交付、日志分析、Bug 排查与代码审计;在专业办公场景 GDPval-AA ELO 得分达 14... --- ### Xiaomi MiMo-V2-Pro - 小米推出的旗舰级MoE大模型 - Published: 2026-03-21 - Modified: 2026-03-21 - URL: https://aisharenet.com/xiaomi-mimo-v2-pro/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 Xiaomi MiMo-V2-Pro是什么 Xiaomi MiMo-V2-Pro 是小米推出的旗舰级MoE大模型,采用1万亿总参数、420亿激活参数的混合专家架构,支持最高100万token超长上下文。模型以代号"Hunter Alpha"匿名上线OpenRouter,一周内调用量突破1万亿token并登顶日榜。MiMo-V2-Pro专为Agent时代深度优化,在ClawEval和PinchBench等Agent基准测试中均位列全球前三,API定价极具竞争力,256K上下文输入仅$1/百万tok... --- ### Seedance 2.0 - 字节Seed团队推出的第二代多模态AI视频生成模型 - Published: 2026-03-20 - Modified: 2026-03-20 - URL: https://aisharenet.com/seedance-20/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 Seedance 2. 0是什么 Seedance 2. 0 是字节跳动(TikTok母公司)Seed团队开发的第二代多模态AI视频生成模型,代表了从单纯文本/图像转视频工具向专业级电影制作平台的重大升级,支持文本、图像、视频片段和音频文件的组合输入,可生成2K分辨率、最长15秒的连续视频,并具备原生音视频同步能力。 Seedance 2. 0的功能特色 多模态输入系统:支持上传最多9张图片、3个视频(总计15秒)和3个音频文件,通过"@素材名"标记在提示词中指定各素材作用。 多镜头叙事模式:可... --- ### GPT-5.4 mini - OpenAI 推出的轻量级 AI 模型 - Published: 2026-03-20 - Modified: 2026-03-20 - URL: https://aisharenet.com/gpt-54-mini/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 GPT-5. 4 mini是什么 GPT-5. 4 mini 是 OpenAI 发布的轻量级模型,定位为"迄今能力最强的小型模型"。在保留 GPT-5. 4 核心能力的同时,实现了速度提升 2 倍以上,成本大幅降低,专为对延迟敏感的高频工作负载设计。如代码编写、工具调用、多模态理解及子智能体任务,以低成本、高速度完成特定工作,常与大模型(如GPT-5. 4)配合使用,形成“大模型规划+小模型执行”的分工模式。 GPT-5. 4 mini的功能特点 编程能力大幅提升:在代码编写、逻辑推理、多模态理... --- ### SkyClaw - Skywork AI 推出的云端AI Agent工作空间 - Published: 2026-03-19 - Modified: 2026-03-19 - URL: https://aisharenet.com/skyclaw/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 SkyClaw是什么 SkyClaw 是 Skywork AI 推出的云端持久化智能工作空间,定位超越传统对话机器人的"主动执行型代理"。支持在 Slack、Discord、WhatsApp 等主流平台原生集成,能基于用户私有知识库进行 grounding,自主规划并持续运行多步骤任务。从深度研究、交叉验证信源到直接生成 PPT、PDF 等办公文档。区别于会话即焚的聊天工具,SkyClaw 可设置长期目标(如定时监控行业动态并推送摘要),在后台跨会话保持工作状态,实现"设定即走"的自动化研究流。... --- ### Mistral Small 4 - Mistral AI 开源的多模态大模型 - Published: 2026-03-19 - Modified: 2026-03-19 - URL: https://aisharenet.com/mistral-small-4/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 Mistral Small 4是什么 Mistral Small 4 是 Mistral AI 开源的多模态大模型,采用 1190 亿参数 MoE 架构(每 token 激活 60 亿参数),支持 256K 超长上下文。核心突破在于三合一统一架构:将通用对话、深度推理(Magistral)和智能体编码(Devstral)能力整合到单一模型中,用户可通过 reasoning_effort 参数动态调节推理强度。相比前代,在延迟优化模式下完成时间缩短 40%,吞吐量提升 3 倍,在多项推理基准上与 ... --- ### 肉包 - 开源AI手机自动化助手,能看懂屏幕自动执行 - Published: 2026-03-18 - Modified: 2026-03-18 - URL: https://aisharenet.com/roubao/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 肉包是什么 肉包(Roubao)是开源的AI手机助手,让用户用现有Android手机能体验类似"豆包手机"的智能自动化功能。肉包基于视觉语言模型,能看懂屏幕内容并自动执行复杂任务,从点外卖、发微信到跨App操作,只需一句话指令。肉包原生Kotlin开发,无需电脑中转或购买专用设备,通过Shizuku获取系统权限即可运行。工具支持多种大模型接入,界面精致且完全免费。 肉包的功能特色 视觉理解执行:基于VLM模型解析屏幕内容,将自然语言指令转化为点击、滑动、输入等具体操作。 双模式任务处理:高置信度... --- ### HiClaw - 阿里云开源的多智能体团队协作系统 - Published: 2026-03-18 - Modified: 2026-03-18 - URL: https://aisharenet.com/hiclaw/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 HiClaw是什么 HiClaw 是阿里云开源的多 Agent 协作框架,让单个用户能像指挥团队一样调度多个 AI 员工。系统设置一位 Manager 管家负责拆解任务、分配工作,各 Worker 专精不同领域且相互隔离。Worker 只持身份令牌,真实密钥由 Higress 网关统一保管,被攻击也不会泄露。框架内置 Matrix 聊天系统,支持手机实时监控和人工介入。HiClaw适合独立开发者快速组建虚拟技术团队或企业探索人机协作模式。 HiClaw的功能特色 智能调度中枢: Manager ... --- ### NemoClaw - NVIDIA 推出的开源企业级 AI Agent 安全增强平台 - Published: 2026-03-17 - Modified: 2026-03-17 - URL: https://aisharenet.com/nemoclaw/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 NemoClaw 是什么 NemoClaw 是 NVIDIA 推出的开源企业级 AI Agent 安全增强平台。作为 OpenClaw 的"安全插件"和运行时沙箱层,通过 OpenShell 为自主 AI 代理添加企业级的隐私控制、安全沙箱和策略执行能力。NemoClaw 支持一键安装 OpenClaw、Nemotron 开源模型和 OpenShell 运行时,可在 NVIDIA RTX PC、DGX Station 和 DGX Spark 等设备上本地运行,让 AI 代理既能保持生产力,又能通... --- ### OpenMAIC - 清华大学开源的多智能体AI课堂系统 - Published: 2026-03-17 - Modified: 2026-03-17 - URL: https://aisharenet.com/openmaic/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 OpenMAIC是什么 OpenMAIC是清华大学研发的开源多智能体AI课堂系统,由教育学院与计算机系联合开发。系统基于大语言模型构建全智能辅助教学环境,支持AI生成课件、语音讲解、互动讨论及作业批改,实现全流程自动化教学。其前身MAIC(Massive AI-empowered Courses)2025年已上线国家智慧教育平台,累计访问超24万次。支持用户自定义教学内容,例如将技术文档快速转为交互课程,能通过智能体模拟课堂讨论,适配不同学习场景。 OpenMAIC的功能特色 一键课程生成:输入... --- ### Clawith - DataElem 团队开源的多智能体协作平台 - Published: 2026-03-17 - Modified: 2026-03-17 - URL: https://aisharenet.com/clawith/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 Clawith是什么 Clawith 是 DataElem 团队开源的"OpenClaw for Teams"——面向团队的多智能体协作平台。在保留 OpenClaw 灵魂与记忆能力的基础上,升级为 Aware 自主感知系统,Agent 可动态创建触发器并持续感知任务进展。平台赋予每个 AI Agent 数字员工身份,理解组织架构、知晓同事关系、主动委派协作;内置"广场"作为内部知识交流中心,Agent 可发布动态、分享发现、积累团队认知。同时提供企业级治理:用量限额、危险操作审批、完整审计日志... --- ### Fun-CineForge - 阿里通义实验室开源的影视级配音多模态大模型 - Published: 2026-03-17 - Modified: 2026-03-17 - URL: https://aisharenet.com/fun-cineforge/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 Fun-CineForge是什么 Fun-CineForge 是阿里通义实验室开源的首个支持影视级多场景配音的多模态大模型,基于 CosyVoice3 打造。通过"数据+模型"一体化设计,创新性地解决音画同步、情感表达、音色一致与时间对齐四大影视配音核心难题,首次支持独白、旁白、双人及多人对话等复杂场景。模型整合视觉、文本、音频、时间四模态信息,即使说话人被遮挡也能精准控制语音时间区间,配套开源覆盖350多部影视剧的高质量 CineDub 数据集,让个人创作者能低成本完成专业级影视配音与跨语言译... --- ### MiniMax Music 2.5+ - MiniMax推出的AI音乐生成模型 - Published: 2026-03-17 - Modified: 2026-03-17 - URL: https://aisharenet.com/minimax-music-25/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 MiniMax Music 2. 5+是什么 MiniMax Music 2. 5+是MiniMax推出的AI音乐生成模型,专注器乐创作。模型精通古典管弦、电子氛围、自然声景等多元风格,擅长将东方传统乐器与西方现代编曲融合,实现跨风格创新。模型声场表现专业级,乐器分离清晰,空间定位精准,从单轨到多轨编排皆可胜任。MiniMax Music 2. 5+能一键生成即用型高品质音乐,大幅降低专业音乐制作门槛。 MiniMax Music 2. 5+的功能特色 器乐创作引擎:模型专注纯音乐生成,直接以旋... --- ### GLM-5-Turbo - 智谱 AI 推出专为 OpenClaw 场景深度优化的基座模型 - Published: 2026-03-17 - Modified: 2026-03-17 - URL: https://aisharenet.com/glm-5-turbo/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 GLM-5-Turbo是什么 GLM-5-Turbo 是智谱 AI 发布的全球首款专为 OpenClaw(龙虾) 场景深度优化的基座模型,也是 GLM-5 系列的高速增强版本。模型从训练阶段就针对 Agent 任务的核心需求进行专项优化,重点增强工具调用、指令遵循、定时与持续性任务、长链路执行等能力,在智谱自研的端到端 Agent 评测基准 ZClawBench 中表现优异,多项指标超越 Claude Opus 4. 6 和 Gemini 3. 1 Pro。GLM-5-Turbo 支持 200K... --- ### Fun-AudioGen-VD - 阿里通义实验室推出的声音设计系统 - Published: 2026-03-16 - Modified: 2026-03-16 - URL: https://aisharenet.com/fun-audiogen-vd/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 Fun-AudioGen-VD是什么 Fun-AudioGen-VD 是阿里通义实验室推出的创新语音大模型,专注于声音设计与场景化音频生成。模型支持通过自然语言指令直接生成包含特定音色、情绪表达和完整听觉场景的高质量音频,无需参考音频即可实现"人物+场景"的一体化声音创作。具备精细化音色控制(性别、年龄、口音、音高、语速)、复杂心理状态模拟(如"表面镇定但内心颤抖"的细腻情感)、沉浸式场景构建(叠加城市喧嚣、战场轰鸣等环境音与空间混响)、设备听感滤镜(老式广播、对讲机等特殊音质)以及动态环境互动... --- ### Gemini Embedding 2 - Google推出的首个原生五模态 Embedding 模型 - Published: 2026-03-16 - Modified: 2026-03-16 - URL: https://aisharenet.com/gemini-embedding-2/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 Gemini Embedding 2是什么 Gemini Embedding 2 是 Google DeepMind 推出的首个原生五模态 Embedding 模型,基于 Gemini 架构构建。突破性地将文本、图片、视频、音频和 PDF 五种模态的数据映射到统一的向量空间,实现真正的跨模态语义检索。模型支持交错式多模态输入(如同时输入文字+图片+音频),采用 Matryoshka 表示学习技术,可灵活调整输出维度。定价方面,文本 Embedding 为 $0. 20/百万 tokens,Bat... --- ### Nemotron 3 Super - NVIDIA开源的大语言模型,专为AI Agent推理设计 - Published: 2026-03-16 - Modified: 2026-03-16 - URL: https://aisharenet.com/nemotron-3-super/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 Nemotron 3 Super是什么 Nemotron 3 Super是 NVIDIA 发布的Nemotron 3 系列中目前最强大的开源权重 AI 模型。模型采用 1200 亿参数的混合专家(MoE)架构,推理时仅激活 120 亿参数,实现了高效与性能的完美平衡。核心亮点包括 100 万 Token 的超长上下文窗口,支持复杂多智能体系统的长期记忆和多步任务规划;原生支持 NVFP4 训练,在 NVIDIA Blackwell 架构上推理速度比 H100 FP8 快 4 倍;相比前代吞吐量提... --- ### Paperclip - 开源的AI Agent编排平台,管理和协调多个AI智能体 - Published: 2026-03-16 - Modified: 2026-03-16 - URL: https://aisharenet.com/paperclip/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 Paperclip是什么 Paperclip是开源的AI代理编排平台,定位为“零人工公司操作系统”,用于管理和协调多个AI代理(如OpenClaw、Claude Code等)协同工作。提供组织架构、目标对齐、预算控制、任务追踪等功能,支持自定义代理角色(如CEO、工程师等),具备成本上限和审批机制,避免AI过度消耗资源。用户可通过Node. js服务端和React UI界面统一调度代理,适合内容运营、软件开发等场景,实现AI团队的自动化协作。 Paperclip的功能特色 组织架构搭建:支持定义... --- ### AlphaClaw - 熵简科技推出的金融投研 AI Agent 工具 - Published: 2026-03-15 - Modified: 2026-03-15 - URL: https://aisharenet.com/alphaclaw/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 AlphaClaw是什么 AlphaClaw 是熵简科技推出的金融投研 AI 工具,搭载于 AlphaEngine 平台,被誉为"投研小龙虾"。完成了从"有问必答的 AI 助手"向"自主执行的 AI 分析师"的进化,能独立跑通复杂投研工作流,直接交付 Excel 表格、回测报告、研报点评等成果。产品内置覆盖内外资券商研报、会议纪要的海量专业数据库(日更近万篇),采用本地优先架构保障数据安全,让分析师从繁琐案头工作中解放出来,专注于深度思考。 AlphaClaw的功能特色 投资大师思维复刻:上传巴... --- ### ArkClaw - 火山引擎推出的云端AI助手,零门槛部署OpenClaw - Published: 2026-03-15 - Modified: 2026-03-15 - URL: https://aisharenet.com/arkclaw/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 ArkClaw是什么 ArkClaw是火山引擎推出的云端智能助手平台,基于OpenClaw架构构建,让用户无需繁琐配置可快速部署专属AI Agent。ArkClaw全天候在线运行,兼容多种主流大模型,并与飞书办公生态深度打通,支持日程管理、文档协作、表格处理等场景。ArkClaw同时提供网盘直连传输和内置安全防护,帮助企业轻松实现智能化办公升级。 ArkClaw的功能特色 云端开箱即用:用户无需本地部署或配置复杂环境,通过网页即可直接使用全天候在线的AI Agent服务。 多模型灵活切换:支持豆... --- ### GPT-5.3 Instant - OpenAI推出的GPT-5系列快速响应版本模型 - Published: 2026-03-15 - Modified: 2026-03-15 - URL: https://aisharenet.com/gpt-53-instant/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 GPT-5. 3 Instant是什么 GPT-5. 3 Instant 是 OpenAI 发布的 ChatGPT 主力模型升级版,主打"体验优化"而非参数堆叠。精准解决了用户长期诟病的"说教感"和机械回复问题,对话语气更自然直接,大幅减少了冗余的免责声明和"AI味"。在准确性方面,高风险场景幻觉率降低 26. 8%,联网搜索能力也显著增强,能深度整合信息而非简单堆砌链接。模型上下文窗口达 128K tokens,已面向所有 ChatGPT 用户(含免费版)默认开放,API 定价与上一代持平,是... --- ### Fun-CosyVoice3.5 - 阿里通义实验室推出的第三代语音合成大模型 - Published: 2026-03-15 - Modified: 2026-03-15 - URL: https://aisharenet.com/fun-cosyvoice35/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 Fun-CosyVoice3. 5是什么 Fun-CosyVoice3. 5是阿里通义实验室推出的第三代语音合成大模型,主打"自然语言指令控制"能力,用户可直接用口语化描述(如"语气坚定一点""语速慢一点")来调节合成语音的情绪、语速和风格,无需从固定选项中选择。模型支持13种语言及16种中国方言,生僻字读错率从15. 2%降至5. 3%,通过DiffRO+GRPO强化学习技术优化韵律和音质。Tokenizer帧率减半使首包延迟降低35%,实时交互更流畅。支持10-20秒短音频快速复刻音色,每账... --- ### Gemini 3.1 Flash-Lite - Google推出的最轻量、最具性价比的模型 - Published: 2026-03-13 - Modified: 2026-03-13 - URL: https://aisharenet.com/gemini-31-flash-lite/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 Gemini 3. 1 Flash-Lite是什么 Gemini 3. 1 Flash-Lite 是 Google 发布的 Gemini 3 系列中最轻量、最具性价比的模型,主打极致速度与低成本。模型从 Gemini 3 Pro 蒸馏而来,输入价格仅 $0. 25/百万 token,输出速度达 363 tokens/秒,比前代快 45%,首 token 响应速度提升 2. 5 倍。支持 100 万 token 超长上下文,可处理文本、图像、音频、视频多模态输入,提供 Minimal 到 High... --- ### FireRed-OCR - 小红书团队开源的端到端文档解析模型 - Published: 2026-03-13 - Modified: 2026-03-13 - URL: https://aisharenet.com/firered-ocr/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 FireRed-OCR是什么 FireRed-OCR 是小红书 Super Intelligence 团队开源的端到端文档解析模型,基于 Qwen3-VL-2B 架构打造,仅用 2B 参数就在 OmniDocBench v1. 5 基准测试中斩获 92. 94% 综合得分,登顶端到端方案榜首。模型通过三阶段渐进训练策略——多任务预对齐、专项 SFT 微调和格式约束 GRPO 强化学习——有效解决了通用视觉语言模型的"结构幻觉"问题,在表格结构完整性(90. 31%)、公式语法合法性(91. 71... --- ### DuClaw - 百度智能云推出的OpenClaw云部署服务 - Published: 2026-03-13 - Modified: 2026-03-13 - URL: https://aisharenet.com/duclaw/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 DuClaw是什么 DuClaw是百度智能云推出的托管式OpenClaw服务,专为无技术背景用户设计。DuClaw免除了服务器配置、镜像选择和API密钥管理的繁琐步骤,用户订阅后可在网页端直接调用完整的智能体功能。DuClaw深度整合百度搜索、百科、学术等原生能力,支持DeepSeek、Kimi-K2. 5等多款大模型灵活切换。DuClaw未来将拓展至企业微信、钉钉等办公场景,让普通用户能轻松拥有7×24小时AI助理。 DuClaw的功能特色 零部署开箱即用:无需配置服务器、选择镜像或申请API... --- ### 小艺Claw - 华为推出的个人手机AI助理,一键接入OpenClaw - Published: 2026-03-13 - Modified: 2026-03-13 - URL: https://aisharenet.com/xiaoyiclaw/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 小艺Claw是什么 小艺Claw是华为基于OpenClaw开源框架推出的AI智能体,集成于小艺App中。小艺Claw打破传统语音助手"被动应答"的交互逻辑,具备自主规划与任务执行能力,可独立完成办公文档处理、信息检索、服务预订等复杂操作。智能体支持多端无缝协同,提供多种人格化交互模式,实现从"听懂命令"到"主动办事"的体验跃迁,成为全天候在线的数字化助手。 小艺Claw的功能特色 办公提效:可独立完成文档编辑、演示文稿生成及邮件自动回复等复杂办公任务。 信息猎取:小艺Claw能主动检索整合全网资... --- ### GPT‑5.4 - OpenAI推出的全能旗舰AI模型 - Published: 2026-03-13 - Modified: 2026-03-13 - URL: https://aisharenet.com/gpt54/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 GPT‑5. 4是什么 GPT-5. 4是OpenAI推出的旗舰AI模型,专为复杂专业场景设计。模型突破性融合推理、编程、原生计算机操控与深度搜索四大能力,在OSWorld测试中首次超越人类操作水平,知识工作任务表现达专家级标准。GPT-5. 4支持百万Token上下文理解,可自主识别界面并执行跨应用复杂流程。模型标志着AI从被动应答向主动完成工作的关键转型,为企业自动化与深度研究提供端到端解决方案。 GPT‑5. 4的功能特色 自主电脑操控:通过视觉识别界面元素,模拟人类点击、输入等操作,跨软... --- ### Mobile-Agent-v3.5 - 阿里通义开源的原生GUI Agent框架 - Published: 2026-03-11 - Modified: 2026-03-11 - URL: https://aisharenet.com/mobile-agent-v35/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 Mobile-Agent-v3. 5是什么 Mobile-Agent-v3. 5是阿里巴巴通义实验室开源的新一代多平台GUI Agent框架,支持桌面、手机、浏览器三大平台,可跨Android、Ubuntu、macOS、Windows实现自动化操作。配套的GUI-Owl-1. 5模型家族提供2B至235B多参数规模,解耦出Instruct(轻量低延迟)和Thinking(强规划反思)两种变体。框架在20多项主流GUI Benchmark上取得开源领域SOTA成绩,通过混合数据飞轮、统一思维链合成... --- ### gws - 谷歌开源的CLI工具,支持接入各类AI Agent系统 - Published: 2026-03-11 - Modified: 2026-03-11 - URL: https://aisharenet.com/gws/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 gws是什么 gws 是 Google Workspace 团队推出的命令行工具,采用 Rust 构建。工具支持运行时动态生成命令,通过读取 Google Discovery Service 实时适配所有 Workspace API,新接口无需更新可使用。gws 专为 AI 场景设计,内置 MCP 协议支持,让大模型可直接调用;同时提供 JSON 输出、自动分页、安全扫描和类 Git 的文档同步工作流,实现人机双模式的高效云端办公管理。 gws的功能特色 动态适配:工具支持无需等待版本更新,运行... --- ### HY-WU - 腾讯混元开源的实时神经参数生成框架 - Published: 2026-03-11 - Modified: 2026-03-11 - URL: https://aisharenet.com/hy-wu/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 HY-WU是什么 HY-WU(混元无相)是腾讯混元推出的功能性神经记忆框架,能在AI推理时即时创建个性化适配参数。框架为每个任务"临时定制"专属技能,无需重新训练模型。通过动态生成轻量级LoRA权重并注入冻结的基础大模型,保留原模型能力,实现精准个性化。HY-WU解决了AI"学新忘旧"的遗忘难题,支持80B参数规模,可应用于图像编辑、虚拟试衣、角色定制等场景,在60多项任务中表现领先。 HY-WU的功能特色 即时参数合成:推理过程中根据输入动态生成专属适配权重,无需预先训练或存储固定参数。 个性... --- ### MiroFish - 开源的AI预测引擎,智能体进行自由交互与社会演化 - Published: 2026-03-11 - Modified: 2026-03-11 - URL: https://aisharenet.com/mirofish/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 MiroFish是什么 MiroFish是中科大20岁学生BaiFu开源的AI预测引擎,基于多智能体技术,能从新闻、小说等种子信息自动构建高保真平行数字世界。MiroFish能生成数千个具备独立人格、长期记忆与行为逻辑的智能体进行自由交互与社会演化,用户可动态注入变量推演未来走向,适用舆情预测、金融推演、文学创作等场景。 MiroFish的功能特色 智能推演系统:用户上传新闻、小说、政策等文本素材,并用自然语言描述预测需求,系统自动推演事件未来走向并生成详尽的预测分析报告。 虚拟社会仿真:基于种... --- ### ClawFeed - 开源AI新闻摘要工具,一站式聚合任意网站内容 - Published: 2026-02-27 - Modified: 2026-02-27 - URL: https://aisharenet.com/clawfeed/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 ClawFeed是什么 ClawFeed是开发者Kevin He推出的开源AI新闻摘要工具,解决信息过载问题。通过聚合Twitter、RSS、GitHub等多平台信息源,利用AI自动生成4小时、每日、每周和每月的结构化摘要,帮助用户高效获取核心资讯。工具支持个性化内容过滤、深度分析功能,可作为OpenClaw和Zylos的插件使用。用户可通过GitHub或在线平台直接体验,显著减少信息筛选时间,提升获取知识的效率。 ClawFeed的功能特色 多源信息采集:一站式聚合 Twitter/X、RSS... --- ### FireRed-Image-Edit - 小红书团队开源的通用图像编辑模型 - Published: 2026-02-26 - Modified: 2026-02-26 - URL: https://aisharenet.com/firered-image-edit/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 FireRed-Image-Edit是什么 FireRed-Image-Edit 是小红书 Super Intelligence 团队开源的通用图像编辑模型,基于扩散 Transformer 架构,在 GEdit、ImgEdit 等多个权威评测集上取得 SOTA 成绩,效果可媲美闭源方案。模型支持文本引导的图像编辑、多图融合(如虚拟试穿)、文字风格保留、老照片修复等核心功能,原生支持中英文提示词。技术上采用区域感知机制、多阶段训练策略(基于 16 亿样本语料)及非对称梯度优化,在 REDEdit... --- ### OpenAkita - 开源的自进化AI助手框架,多平台无缝协作 - Published: 2026-02-24 - Modified: 2026-02-24 - URL: https://aisharenet.com/openakita/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 OpenAkita是什么 OpenAkita是开源的自进化AI助手框架,提供智能、灵活且易于使用的AI辅助工具。每日自动执行内存整合、错误自检与修复、任务复盘,遇到卡壳时自动生成新技能并安装依赖,越用越聪明。支持Windows、macOS、Linux系统,可通过命令行(CLI)、桌面终端、Telegram、飞书、企业微信、钉钉等平台使用,实现跨平台无缝协作。OpenAkita的目标是成为用户在技术工作和日常生活中可靠的数字伙伴,通过持续进化和多场景适配,解决当前AI工具使用中的痛点。 OpenA... --- ### ClawWork - 香港大学数据科学实验室开源的AI经济压力测试框架 - Published: 2026-02-24 - Modified: 2026-02-24 - URL: https://aisharenet.com/clawwork/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 ClawWork是什么 ClawWork是香港大学数据科学实验室开发的AI经济压力测试框架,允许AI在模拟经济环境中完成真实工作任务并获得报酬。核心逻辑是让初始资金仅10美元的AI通过完成220个专业任务(覆盖制造、金融、医疗等44个经济领域)赚取收益,每生成一个token都会扣除成本,无法盈利则会"破产"。技术架构分为五层,包括基础层、核心引擎层、价值量化层等,支持模块化替换和轻量部署。用户可通过GitHub一键安装,实时查看AI的收入、成本和任务完成情况。 ClawWork的功能特色 220... --- ### Ming-Omni-tts - 蚂蚁联合Inclusion AI开源的多模态音频生成模型 - Published: 2026-02-21 - Modified: 2026-02-21 - URL: https://aisharenet.com/ming-omni-tts/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 Ming-Omni-tts是什么 Ming-Omni-tts 是蚂蚁集团与Inclusion AI联合开源的多模态音频生成模型,包含0. 5B和16. 8B-A3B两个版本。模型首次实现了语音、环境音和音乐的统一自回归生成,支持语速、音量、方言(如粤语、四川话)和情感控制,方言生成准确率达96%。核心技术采用12. 5Hz连续Tokenizer和多Token预测策略,推理帧率可达3. 1Hz,适用于播客配音、角色音色克隆等场景。模型已开源并提供GitHub和Hugging Face等平台访问。 ... --- ### Qwen3.5 - 阿里通义千问团队开源的最新一代大语言模型 - Published: 2026-02-19 - Modified: 2026-02-19 - URL: https://aisharenet.com/qwen35/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 Qwen3. 5是什么 Qwen3. 5是阿里巴巴通义千问团队开源的最新一代大语言模型,属于千问(Qwen)系列的升级版本。Qwen3. 5突破了传统文本模型的限制,实现了真正的原生多模态理解,可直接处理文本、图像、视频等多种模态数据。例如,能识别图片中的菜品、分析图表数据、总结视频内容,甚至根据手绘草图生成代码或修复UI问题。支持高达256K甚至百万级token的上下文长度,可处理长文档、复杂代码库或长时间视频内容,适用于需要深度理解和分析的场景。支持201种语言和方言,覆盖全球主要语言及小语... --- ### Ring-2.5-1T - 蚂蚁百灵开源的万亿参数混合线性架构思考模型 - Published: 2026-02-18 - Modified: 2026-02-18 - URL: https://aisharenet.com/ring-25-1t/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 Ring-2. 5-1T是什么 Ring-2. 5-1T 是蚂蚁集团百灵大模型团队开源的全球首个万亿参数混合线性架构思考模型,采用1:7 MLA与Lightning Linear Attention混合设计,激活参数量达63B。模型在生成效率上实现突破:32K以上长文本生成时访存降低10倍、吞吐提升3倍,特别适合深度推理与长程任务。在数学能力方面,IMO 2025自测获35分(金牌水平),CMO 2025达105分(远超国家集训队线)。通过全异步智能体强化学习训练,Ring-2. 5-1T可无缝... --- ### Xiaomi-Robotics-0 - 小米开源的首代具身智能大模型 - Published: 2026-02-18 - Modified: 2026-02-18 - URL: https://aisharenet.com/xiaomi-robotics-0/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 Xiaomi-Robotics-0是什么 Xiaomi-Robotics-0 是小米开源的首代具身智能大模型,拥有47亿参数,采用"大脑+小脑"混合架构设计。视觉语言大脑基于多模态大模型,负责理解人类模糊指令与空间推理;动作执行小脑则通过Diffusion Transformer生成高频连续动作块,确保机器人动作平滑精准。模型创新性地引入异步执行机制,实现推理与执行并行,消除传统串行延迟。在LIBERO、SimplerEnv等仿真基准中,Xiaomi-Robotics-0以98. 7%的成功率刷... --- ### AionUi - 免费开源的多AI Agent桌面应用 - Published: 2026-02-16 - Modified: 2026-02-16 - URL: https://aisharenet.com/aionui/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 AionUi是什么 AionUi是一个免费开源的多AI Agent桌面应用,支持将Gemini CLI、Claude Code等命令行AI工具整合到图形界面,提供本地文件操作、多会话管理、跨平台运行等功能。支持macOS、Windows和Linux,内置文件管理、PDF转换、代码预览等办公自动化能力,可通过WebUI远程访问。与Claude Cowork相比,AionUi不仅兼容更多AI模型,且完全免费,适合开发者、内容创作者等需要高效AI辅助的用户。 AionUi的功能特色 多 Agent 统... --- ### Ming-flash-omni 2.0 - 蚂蚁集团开源的全模态大模型 - Published: 2026-02-16 - Modified: 2026-02-16 - URL: https://aisharenet.com/ming-flash-omni-20/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 Ming-flash-omni 2. 0是什么 Ming-flash-omni 2. 0是蚂蚁集团开源的全模态大模型,集成了视觉、语音和生成能力的AI模型,在多项基准测试中性能领先。支持同时生成语音、环境音效和音乐,能通过自然语言指令精细控制音色、语调等参数,推理效率达3. 1Hz,可实时生成高保真长音频。在视觉方面,模型提升了复杂对象识别能力,图像编辑功能支持光影调整、场景替换等操作。其基于Ling-2. 0架构训练,开发者可通过统一框架调用多模态能力,降低应用开发成本。 Ming-flash... --- ### Protenix-v1 - 字节Seed团队推出的首个开源蛋白质结构预测模型 - Published: 2026-02-14 - Modified: 2026-02-14 - URL: https://aisharenet.com/protenix-v1/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 Protenix-v1是什么 Protenix-v1是字节跳动ByteDance Seed团队推出的首个开源蛋白质结构预测模型,性能在严格对齐训练数据和模型规模后超越AlphaFold 3。模型具备显著的推理时扩展特性:通过增加采样次数(如随机种子数),预测精度可近似线性提升,例如在抗体-抗原任务中,采样种子从1个增至80个时,DockQ成功率从36%提升至48%。Protenix-v1支持蛋白质、RNA、DNA及小分子的复合物预测,并推出双版本策略——严格对齐AF3数据的版本用于学术研究,20... --- ### Clawra - 基于OpenClaw框架开源的AI女友程序 - Published: 2026-02-14 - Modified: 2026-02-14 - URL: https://aisharenet.com/clawra/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 Clawra是什么 Clawra是一个基于OpenClaw框架开发的AI女友程序,由韩国开发者David Im制作,具有完整人设和交互功能。通过Persona Engineering技术赋予AI“18岁亚裔女性练习生”的数字人格,能响应聊天、发送自拍、视频通话等指令,模拟真人互动、分享生活片段(如健身照片),以及通过Soul. md文件自定义外观和行为。用户可通过npx clawra@latest快速部署,或手动配置API Key和Skill库实现个性化设置。 Clawra的功能特色 拟人化聊天... --- ### GLM-5 - 智谱AI推出的旗舰级开源大模型 - Published: 2026-02-12 - Modified: 2026-02-12 - URL: https://aisharenet.com/glm-5/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 GLM-5是什么 GLM-5是智谱AI推出的旗舰级开源大模型,采用744B参数规模(激活40B),专为Agentic Engineering智能体工程打造。模型在编程与Agent能力上取得开源SOTA表现,SWE-bench-Verified得分77. 8、Terminal Bench 2. 0得分56. 2,真实编程场景体验逼近Claude Opus 4. 5。GLM-5首次集成DeepSeek稀疏注意力机制,支持最高202K上下文窗口,已完成华为昇腾、摩尔线程等七大国产芯片深度适配。模型已在... --- ### nanobot - HKUDS开源的超轻量级个人AI助手框架 - Published: 2026-02-12 - Modified: 2026-02-12 - URL: https://aisharenet.com/nanobot/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 nanobot是什么 nanobot 是香港大学数据智能实验室(HKUDS)开源的超轻量级个人AI助手框架,仅用约 4,000行Python代码实现了完整的多通道AI助手功能。作为 OpenClaw 的轻量替代品,nanobot 在保持核心功能的同时,将代码量减少了99%以上(OpenClaw约40万+行)。支持多种主流LLM(OpenRouter、Claude、GPT、DeepSeek、Groq、Gemini及本地vLLM),原生集成 Telegram、WhatsApp、飞书等即时通讯平台。n... --- ### RynnBrain - 阿里巴巴达摩院开源的具身智能大脑基础模型 - Published: 2026-02-12 - Modified: 2026-02-12 - URL: https://aisharenet.com/rynnbrain/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 RynnBrain是什么 RynnBrain 是阿里巴巴达摩院开源的具身智能大脑基础模型,为机器人提供深度环境理解和物理世界交互能力。是业界首个赋予机器人时空记忆和物理空间推理能力的开源模型。包含2B、8B、30B等7个不同参数规模的模型。模型通过创新的时空记忆和物理空间推理能力,显著提升了机器人在复杂任务中的执行效率。 RynnBrain的主要功能 时空记忆能力:机器人可在完整历史记忆中定位物体、回溯目标区域、预测运动轨迹,实现全局时空回溯。 物理空间推理:采用文本与空间定位交错推理策略,让推... --- ### PaperBanana - 北大与谷歌联合开源的AI学术插图自动生成框架 - Published: 2026-02-11 - Modified: 2026-02-11 - URL: https://aisharenet.com/paperbanana/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 PaperBanana是什么 PaperBanana是北大与谷歌团队联合开源的AI学术插图自动生成框架,专门解决科研人员绘制方法示意图和统计图表的痛点。框架通过五个智能体协作(检索、规划、造型、渲染和批评),实现从文本描述到NeurIPS级别插图的端到端生成,支持流程图、架构图等类型,内置学术审美规范。核心创新在于美学引导机制和PaperBananaBench基准测试集,实验证明在忠实度、可读性等维度超越现有工具,能提升56. 2%的图表质量。 PaperBanana的功能特色 自动化学术插图生... --- ### Intern-S1-Pro - 上海AI Lab开源的首个万亿参数科学多模态大模型 - Published: 2026-02-09 - Modified: 2026-02-09 - URL: https://aisharenet.com/intern-s1-pro/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 Intern-S1-Pro是什么 Intern-S1-Pro是上海人工智能实验室开源的全球首个万亿参数级科学多模态大模型。采用512专家MoE架构,激活仅8专家22B参数,兼顾性能与效率。模型基于SAGE架构,引入傅里叶位置编码,统一理解微观生命到宏观宇宙信号,具备奥林匹克金牌级数理推理能力。预训练语料含5T tokens,科学数据占比超50%,在化学、材料、地学等科研任务全面领先。代码与权重已全开源,支持商用,为AGI4S提供国产自主基座。 Intern-S1-Pro的功能特色 技术架构:基于... --- ### LingBot-VA - 蚂蚁灵波开源的首个“自回归视频-动作世界模型” - Published: 2026-02-07 - Modified: 2026-02-07 - URL: https://aisharenet.com/lingbot-va/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 LingBot-VA是什么 LingBot-VA 是蚂蚁灵波开源的全球首个“自回归视频-动作世界模型”,把视频生成与机器人控制塞进同一 Transformer,每一步同时输出下一帧世界画面和对应动作,实现“边想边干”。自研 MoT 架构分层处理视觉与动作流,配合因果记忆缓存,仅用 30–50 条演示就能把复杂长任务成功率提升 20%,在双臂协同基准 RoboTwin 2. 0 上首破 90%,LIBERO 终身学习基准达 98. 5% SOTA。模型已全栈开源,电商仓储、家庭服务机器人可零样本或... --- ### MiniCPM-o 4.5 - 面壁智能开源的 9B 全模态旗舰模型 - Published: 2026-02-06 - Modified: 2026-02-06 - URL: https://aisharenet.com/minicpm-o-45/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 MiniCPM-o 4. 5是什么 MiniCPM-o 4. 5 是面壁智能开源的 9B 全模态旗舰模型,以“边看边听主动说”的端到端架构,在手机端即可跑出 GPT-4o 级体验:支持单图、多图、高帧率长视频、实时语音双工对话,首 token < 2 s,解码 17 tokens/s;INT4 量化后 5 GB 显存可跑,已适配昇腾等 6 款国产芯片,推理再提速 7-22%。3 秒语音克隆、1 Hz 主动交互、OCR 与文档理解全线 SOTA,OpenCompass 全模态榜 77. 6 分超越... --- ### SoulX-FlashTalk - Soul App AI团队开源的实时数字人生成模型 - Published: 2026-02-05 - Modified: 2026-02-05 - URL: https://aisharenet.com/soulx-flashtalk/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 SoulX-FlashTalk是什么 SoulX-FlashTalk是Soul App AI团队开源的实时数字人生成模型,拥有140亿参数量,实现了0. 87秒超低延迟和32帧/秒的高帧率。模型通过双向蒸馏技术解决了传统数字人延迟高、画面易崩坏的问题,支持超长视频稳定生成,适用于电商直播、AI客服等场景。其创新点包括自纠正机制和混合序列并行技术,显著提升了实时交互体验。 SoulX-FlashTalk的功能特色 亚秒级实时响应:首帧输出延迟仅 0. 87 s,14B 大模型也能“零等待”开口说话... --- ### Qwen3-Coder-Next - 阿里通义千问开源的编程智能体混合模型 - Published: 2026-02-04 - Modified: 2026-02-04 - URL: https://aisharenet.com/qwen3-coder-next/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 Qwen3-Coder-Next是什么 Qwen3-Coder-Next是阿里巴巴通义千问团队开源的专为编程智能体设计的高效混合模型,基于80B总参数的Qwen3-Next架构,推理时仅激活3B参数。核心创新在于采用环境交互和强化学习训练方式,通过"生成代码→执行→修复→再执行"的闭环优化,实现70%以上的编程任务解决率,在SWE-Bench等基准测试中表现优于激活参数10-20倍的模型。模型已开源至ModelScope和Hugging Face平台,支持Web开发、CLI工具、浏览器自动化等实... --- ### GLM-OCR - 智谱开源的 0.9B 轻量级专业 OCR 模型 - Published: 2026-02-03 - Modified: 2026-02-03 - URL: https://aisharenet.com/glm-ocr/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 GLM-OCR是什么 GLM-OCR 是智谱开源的 0. 9B 轻量级专业 OCR 模型,在 OmniDocBench V1. 5 以 94. 6 分刷新 SOTA。兼顾“小体积”与“全场景”,扫描、手写、印章、多语混排、复杂表格(直接输出 HTML)、票据卡证(标准 JSON)一网打尽;支持合并单元格、多层表头、代码截图与公式。API 定价 0. 2 元 / 百万 Tokens,千张 A4 成本约 0. 5 元,仅为传统方案十分之一;PDF 吞吐 1. 86 页/秒,图片 0. 67 张/秒,... --- ### Step 3.5 Flash - 阶跃星辰开源的 1960 亿稀疏 MoE 模型 - Published: 2026-02-02 - Modified: 2026-02-02 - URL: https://aisharenet.com/step-35-flash/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 Step 3. 5 Flash是什么 Step 3. 5 Flash 是阶跃星辰开源的 1960 亿稀疏 MoE 模型,每 token 仅激活 110 亿参数,能在代码任务跑出 350 token/s 的实时速度。基于自研 MTP-3 多 token 预测与 3:1 混合注意力,把 256 K 长文计算量砍掉 40 %,在 AIME 2025、IMOAnswerBench、LiveCodeBench 等硬核榜单直接对标 GPT-4o,位列前三。更关键的是,生来就是 Agent 基座:函数调用、工... --- ### UnifoLM-VLA-0 - 宇树科技开源的首款操作型大模型 - Published: 2026-02-01 - Modified: 2026-02-01 - URL: https://aisharenet.com/unifolm-vla-0/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 UnifoLM-VLA-0是什么 UnifoLM-VLA-0 是宇树科技 UnifoLM 系列的首款操作型大模型,突破传统视觉语言模型(VLM)仅能理解图像文字的局限,通过在机器人操作数据上的持续预训练,实现从"图文理解"向具备物理常识的"具身大脑"进化。模型基于 Qwen2. 5-VL-7B 开源架构构建,仅利用约 340 小时的真机操作数据,通过融合 2D/3D 空间细节与动力学约束,实现对复杂动作序列的统一建模。在 LIBERO 仿真基准测试中表现接近最优,在真机验证中仅凭单一策略网络即可... --- ### SenseNova-MARS - 商汤科技开源的多模态搜索推理Agent语言模型 - Published: 2026-02-01 - Modified: 2026-02-01 - URL: https://aisharenet.com/sensenova-mars/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 SenseNova-MARS是什么 SenseNova-MARS 是商汤开源的首个支持动态视觉推理与图文搜索深度融合的智能体视觉语言模型(Agentic VLM),提供 8B 和 32B 双版本。模型能自主规划任务步骤、调用多种工具(如图像裁剪、文本/图像搜索),实现"识别—检索—推理"的闭环自主执行。在 MMSearch、HR-MMSearch 等多模态搜索推理基准测试中, SenseNova-MARS 以 69. 74 分 超越 Gemini-3-Pro(69. 06 分)和 GPT-5. ... --- ### MOVA - 创智学院联合模思智能开源的端到端音视频生成模型 - Published: 2026-02-01 - Modified: 2026-02-01 - URL: https://aisharenet.com/mova/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 MOVA是什么 MOVA(MOSS-Video-and-Audio) 是上海创智学院 OpenMOSS 团队联合模思智能(MOSI)开源的端到端音视频生成模型,是中国首个高性能开源音视频模型。突破了传统"先画面后配音"的级联流水线模式,实现真正的"音画同出"——单次推理即可生成最长8秒、最高720p分辨率的同步视听片段,支持多语言口型精准对齐与环境音效生成。 MOVA的功能特色 端到端音视频同步生成:单次推理同时生成视频画面与同步音频,无需后期配音 多语言口型同步:支持多种语言的人物说话视频生成... --- ### LingBot-World - 蚂蚁旗下灵波科技开源的交互式世界模型 - Published: 2026-01-30 - Modified: 2026-01-30 - URL: https://aisharenet.com/lingbot-world/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 LingBot-World是什么 LingBot-World 是蚂蚁集团旗下具身智能公司灵波科技(Robbyant)开源的交互式世界模型,专为具身智能、自动驾驶及游戏开发打造高保真“数字演练场”。模型通过可扩展数据引擎从大规模游戏环境中学习物理规律与因果关系,实现了三项突破:超长一致记忆,支持近10分钟连续稳定生成,即使镜头移开60秒后返回,物体结构与外观仍保持一致,有效解决了视频生成的“长时漂移”难题;毫秒级实时交互,生成吞吐量达16 FPS,端到端延迟控制在1秒以内,用户可通过键盘、鼠标或文... --- ### SkyReels-V3 - 昆仑万维Skywork AI开源的多模态视频生成模型 - Published: 2026-01-30 - Modified: 2026-01-30 - URL: https://aisharenet.com/skyreels-v3/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 SkyReels-V3是什么 SkyReels-V3是昆仑万维Skywork AI开源的多模态视频生成模型,被誉为视频生成领域的"全能型"标杆。模型基于"一核多支"的统一架构,在单一建模框架内集成三大核心能力:参考图像转视频、智能视频延长和音频驱动虚拟形象。V3版本在主体一致性(指标0. 6698)、音视频同步性(得分8. 18)等关键指标上超越Kling 1. 6、Vidu Q2等主流闭源商业模型,支持720P高清、分钟级长视频生成及专业电影级转场效果。 SkyReels-V3的功能特色 参考... --- ### LingBot-Depth - 蚂蚁灵波科技开源的高精度空间感知模型 - Published: 2026-01-29 - Modified: 2026-01-29 - URL: https://aisharenet.com/lingbot-depth/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 LingBot-Depth是什么 LingBot-Depth是蚂蚁灵波科技开源的高精度空间感知模型,专门解决机器人在透明玻璃、反光物体等复杂场景中的深度识别难题。模型通过创新的"掩码深度建模"技术,在RGB图像基础上预测缺失的深度值,能显著提升消费级深度相机的感知精度,在透明杯、反光金属等场景下的抓取成功率从0%提升至50%。 LingBot-Depth的功能特色 首创「掩码深度建模」:训练时随机遮挡深度值,逼模型用 RGB 纹理、轮廓自监督补全,零硬件改动即可把消费级相机变成“透明物体雷达”。... --- ### DeepSeek-OCR 2 - DeepSeek团队开源的新一代OCR模型 - Published: 2026-01-28 - Modified: 2026-01-28 - URL: https://aisharenet.com/deepseek-ocr-2/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 DeepSeek-OCR 2是什么 DeepSeek-OCR 2是DeepSeek团队开源的新一代OCR模型,核心创新在于采用DeepEncoder V2架构,将传统固定栅格扫描的视觉编码方式升级为基于语义推理的动态处理。模型通过因果流查询和双流注意力机制,能按图像内容逻辑自动重排视觉信息,非机械地按空间顺序处理,显著提升了复杂文档(如表格、公式混排)的识别效果。在OmniDocBench v1. 5基准测试中,整体得分达91. 09%,较前代提升3. 73%,尤其在阅读顺序准确率方面表现突出。... --- ### Kimi K2.5 - 月之暗面开源的新一代旗舰模型 - Published: 2026-01-28 - Modified: 2026-01-28 - URL: https://aisharenet.com/kimi-k25/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 Kimi K2. 5是什么 Kimi K2. 5 是月之暗面发布的开源旗舰模型,采用 1T MoE 架构、激活 32B、上下文 256K token,原生支持图文视频多模态输入。在 Agent、代码、视觉理解三大基准均列开源第一。前端可截图/录屏一键还原代码与动效;写作推理提供“思考/非思考”双模式;内置 Agent 集群,可动态召唤 100+ 分身并行任务,自动调用浏览器、Office 等工具完成复杂工作流。API 定价输入最低 0. 7 元/百万 token,输出 21 元,成本约为同级闭源... --- ### Moltbot - 开源的本地优先AI助手,支持多渠道与用户交互 - Published: 2026-01-28 - Modified: 2026-01-28 - URL: https://aisharenet.com/moltbot/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 Moltbot是什么 Moltbot(原名Clawdbot)是奥地利开发者 Peter Steinberger 开源的“本地优先”AI 助手,WhatsApp、Telegram、Discord、Slack、iMessage 等常用聊天软件变成统一入口,让 AI 代理常驻你的电脑,可读写邮件与日历、执行终端命令、控制浏览器乃至智能家居,能在收到高优邮件时主动私聊提醒。项目采用 Gateway + Agent 架构:Gateway 负责多通道消息路由,Agent 运行本地或远程大模型(支持 Clau... --- ### json-render - Vercel Labs开源的AI生成UI的工具 - Published: 2026-01-26 - Modified: 2026-01-26 - URL: https://aisharenet.com/json-render/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 json-render是什么 json-render是Vercel Labs开源的AI生成UI的工具,通过“AI → JSON → UI”的流程实现结构化、可控的界面生成。要求AI仅输出符合预定义Schema的JSON数据,前端再根据数据渲染已有组件,解决了传统AI生成UI不可控的问题。核心机制包括:定义组件目录(catalog)约束可用组件及属性,流式处理JSON增量更新UI,支持导出为标准React代码。 json-render的功能特色 组件目录定义:通过定义组件目录,约束 AI 输出,确... --- ### FlowAct-R1 - 字节跳动开源的实时交互数字人视频生成框架 - Published: 2026-01-24 - Modified: 2026-01-24 - URL: https://aisharenet.com/flowact-r1/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 FlowAct-R1是什么 FlowAct-R1是字节跳动开源的实时交互数字人视频生成框架,能通过单张参考图和音频流式生成无限时长的高保真全身动态视频。核心创新在于分块流式生成技术,将视频拆解为0. 5秒一小段接力处理,配合结构化记忆库(短期/长期记忆队列)确保长时一致性,同时采用多模态指令控制表情与动作。相比传统方案,实现了1. 5秒首帧延迟、25fps实时响应,能模拟思考、倾听等自然状态切换,通过用户测试在动作自然度等维度大幅领先竞品。 FlowAct-R1的功能特色 实时流式生成:基于 M... --- ### VibeVoice-ASR - 微软开源的统一语音转文本(ASR)模型 - Published: 2026-01-24 - Modified: 2026-01-24 - URL: https://aisharenet.com/vibevoice-asr/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 VibeVoice-ASR是什么 VibeVoice-ASR是微软开源的统一语音转文本(ASR)模型,专为处理长音频设计,可一次性处理长达60分钟的连续音频,确保语义连贯性和说话人追踪的一致性。支持自定义热词功能,用户可输入特定词汇或术语,显著提升专业领域内容的识别准确率。VibeVoice-ASR能生成结构化的转录结果,包含说话人身份、时间戳和文本内容,方便用户快速定位和查阅。 VibeVoice-ASR的功能特色 长音频处理能力:支持单次处理长达60分钟的连续音频,无需切片,可保持全局语境连... --- ### Qwen3-TTS - 阿里云千问团队开源的语音合成模型系列 - Published: 2026-01-23 - Modified: 2026-01-23 - URL: https://aisharenet.com/qwen3-tts/ - 分类目录: 课程资料 - 内容可见性: 所有人可见 Qwen3-TTS是什么 Qwen3-TTS是阿里云千问团队开源的语音合成模型系列,支持10种主流语言及方言的音色克隆、创造和拟人化语音生成。模型采用创新的双轨流式架构,首包延迟仅97毫秒,具备自然语言指令控制音色、情感和语调的能力。开源版本包含1. 7B和0. 6B两种参数规模,其中1. 7B版本支持全参数微调,可在单张RTX 3060显卡上完成音色克隆训练;0. 6B版本兼顾性能与效率,适合消费级硬件部署。模型已通过GitHub、Hugging Face和阿里云ModelScope平台开源,... --- ### Chroma 1.0 - FlashLabs开源的全球首个实时端到端语音对话模型 - Published: 2026-01-23 - Modified: 2026-01-23 - URL: https://aisharenet.com/chroma-10/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 Chroma 1. 0是什么 Chroma 1. 0是FlashLabs发布的全球首个开源的实时端到端语音对话模型,兼具低延迟交互、高保真个性化语音克隆和强对话能力。通过紧密耦合语音理解与生成,采用1:2文本-音频token调度策略,实现亚秒级延迟输出。仅需几秒参考音频,能高度还原说话人的音色特征,其speaker相似度比人类基线高出10. 96%。模型仅4B参数,在推理和口语对话任务中表现优异,兼顾效率与性能。 Chroma 1. 0的功能特色 实时性:端到端延迟低于1秒,支持亚秒级实时语音交... --- ### AgentCPM-Report - 清华联合面壁智能等开源的深度调研智能体工具 - Published: 2026-01-23 - Modified: 2026-01-23 - URL: https://aisharenet.com/agentcpm-report/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 AgentCPM-Report是什么 AgentCPM-Report 是清华大学自然语言处理实验室、中国人民大学、面壁智能与 OpenBMB 开源社区联合研发的深度调研智能体工具。基于 8 亿参数的模型,通过深度检索和推理,能生成万字长篇深度报告。工具支持本地化部署,数据存储在本地,不上传云端,确保数据安全,特别适合处理涉密或敏感数据的场景。 AgentCPM-Report的功能特色 深度报告生成能力:AgentCPM-Report 能基于用户指令,通过多轮深度检索和推理,生成逻辑严谨、内容深刻... --- ### EmbodiChain - 跨维智能推出的开源具身智能开发平台 - Published: 2026-01-21 - Modified: 2026-01-21 - URL: https://aisharenet.com/embodichain/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 EmbodiChain是什么 EmbodiChain是跨维智能推出的开源具身智能开发平台,专注于解决具身智能模型训练中数据稀缺的问题。通过数据引擎实现大规模场景相关数据生成、Real2Sim 数据轨迹映射和多模态数据扩增,从根本上突破了真实数据采集的高成本与多样性瓶颈。平台内置的 Sim2Real VLA 基础模型,覆盖多种典型操作任务,支持高保真 GPU 仿真,具备刚体和可变形物体的物理仿真能力,以及先进的光线追踪传感器,所有操作均通过 GPU 加速,实现高吞吐量的批量仿真。 EmbodiCh... --- ### Step3-VL-10B - 阶跃星辰开源的100亿参数多模态AI模型 - Published: 2026-01-21 - Modified: 2026-01-21 - URL: https://aisharenet.com/step3-vl-10b/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 Step3-VL-10B是什么 Step3-VL-10B是阶跃星辰团队开源的100亿参数多模态AI模型,核心突破在于以轻量化设计实现顶级性能。模型通过统一预训练策略(1. 2T多模态令牌数据)和创新的并行协同推理技术(PACORE),在数学竞赛、GUI交互等复杂任务上超越了参数规模20倍的大模型(如Gemini 2. 5 Pro),同时支持移动端部署。关键技术包括语言优化型感知编码器、多裁剪策略图像处理(728×728全局视图+504×504局部视图)及超千次强化学习迭代,开源资源包含Base和... --- ### PersonaPlex - 英伟达开源的全双工语音对话模型 - Published: 2026-01-20 - Modified: 2026-01-20 - URL: https://aisharenet.com/personaplex/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 PersonaPlex是什么 PersonaPlex是英伟达开源的全双工语音对话模型,拥有70亿参数。摒弃了传统的语音识别→语言模型→文本到语音的级联流程,采用统一的Transformer架构,能同步处理语音理解与生成。模型支持全双工交互,用户可以在AI说话时随时插话,实现极速响应。支持深度个性化,用户可以定制AI的角色性格、业务知识及情感音色。PersonaPlex能自然地处理打断、重叠语音、快速轮转及上下文感知的反馈,对话流畅度和任务达成率更高。 PersonaPlex的功能特色 全双工交互... --- ### GLM-4.7-Flash - 智谱开源的混合专家架构语言模型 - Published: 2026-01-20 - Modified: 2026-01-20 - URL: https://aisharenet.com/glm-47-flash/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 GLM-4. 7-Flash是什么 GLM-4. 7-Flash是智谱开源的混合专家架构语言模型,参数规模为30B,激活参数量3B,上下文窗口达200K,最大输出令牌为128K。在编程能力上表现出色,SWE-bench验证集分数达59. 2,任务执行能力强,AIME 25、GPQA、LCB v6等任务得分分别为91. 6、75. 2、64. 0,高负载下错误率仅0. 3%,一致性达96. 7%。模型采用多阶段思考机制,支持轻量化部署,适用于本地编程、智能体任务和工具调用等场景,是30B级别中的性... --- ### NovaSR - 开源的音频超分辨率模型,提升音频采样率 - Published: 2026-01-20 - Modified: 2026-01-20 - URL: https://aisharenet.com/novasr/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 NovaSR是什么 NovaSR是开源的音频超分辨率模型,主要用于将低质量音频(如16kHz采样率的电话音质)提升为高质量音频(如48kHz采样率的录音室级音质)。模型大小仅52KB,比一张微信表情包还小,可轻松部署在资源受限的设备(如TWS耳机芯片、智能手表、手机NPU/CPU等),实现端侧音频增强,无需依赖服务器GPU。处理速度极快,在单张A100 GPU上可达到3600倍实时处理速度,即1秒内可处理1小时音频。即使在手机等低性能设备上运行,也几乎不产生延迟且耗电量极低,适合实时音频处理场景... --- ### FLUX.2 [klein] - Black Forest Labs 开源的轻量级图像生成与编辑模型 - Published: 2026-01-19 - Modified: 2026-01-19 - URL: https://aisharenet.com/flux2-klein/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 FLUX. 2 是什么 FLUX. 2 是 Black Forest Labs 推出的开源轻量级图像生成与编辑模型,专为快速推理和低延迟应用场景设计。支持文本生成图像、图像编辑以及多参考图像生成,能在不到1秒内完成高质量图像生成。模型分为 4B 和 9B 两种参数版本,其中 4B 版本仅需 13GB 显存,适配主流消费级 GPU。其蒸馏版本通过 4 步推理实现极快的速度,适合交互式应用和实时预览。FLUX. 2 的图像质量出色,具备精准的光影效果、清晰的文字渲染和材质真实感。 FLUX. 2 的... --- ### TranslateGemma - 谷歌开源的机器翻译模型系列 - Published: 2026-01-19 - Modified: 2026-01-19 - URL: https://aisharenet.com/translategemma/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 TranslateGemma是什么 TranslateGemma是谷歌开源的基于Gemma 3的机器翻译模型系列,专为提升翻译质量而设计。通过两阶段微调(监督微调和强化学习)优化翻译效果,提供4B、12B、27B三种参数规模,支持55种核心语言及多模态图像翻译。4B模型可在手机等边缘设备运行,12B模型适配消费级笔记本,27B模型追求极致质量。支持55种核心语言,适合跨语言交流与研究。 TranslateGemma的功能特色 多语言翻译:支持55种语言的互译,涵盖高资源和低资源语言。 多模态翻译... --- ### OpenWork - 开源AI Agent工作流桌面应用,Claude Cowork的免费平替 - Published: 2026-01-18 - Modified: 2026-01-18 - URL: https://aisharenet.com/openwork/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 OpenWork是什么 OpenWork是开源的智能代理工作流桌面应用,作为Claude Cowork的免费替代品,提供可视化操作界面和本地化运行能力。项目采用Tauri+Rust+Node. js技术栈,支持技能插件扩展和模板复用,具备权限审批机制保障数据安全。目前最新版本为0. 1. 9,已发布macOS、Windows安装包,可通过BYOK(自带API Key)方式接入OpenAI或Anthropic模型。核心优势在于将复杂AI代理操作转化为拖拽式工作流,适合知识工作者处理文件整理、文档生... --- ### ArenaRL - 高德地图联合阿里通义开源的对比式强化学习方法 - Published: 2026-01-18 - Modified: 2026-01-18 - URL: https://aisharenet.com/arenarl/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 ArenaRL是什么 ArenaRL是高德地图与阿里通义团队联合开源的对比式强化学习方法,专为解决开放域任务(如出行规划)中缺乏标准答案的问题。核心创新在于用“相对排序”替代传统“绝对打分”机制,通过智能体自动生成多套方案并相互淘汰(类似体育赛事),在模糊需求(如“适合亲子游且性价比高”)中持续优化解空间。法已开源配套训练框架,适用于无标准解但可比较的任务场景,显著提升了高德在POI排序和开放式出行规划等业务指标。 ArenaRL的功能特色 解决开放域任务中的判别崩溃问题:通过引入基于锦标赛的相... --- ### Step-Audio-R1.1 - 阶跃星辰开源的全球首个原生语音推理模型 - Published: 2026-01-15 - Modified: 2026-01-15 - URL: https://aisharenet.com/step-audio-r11/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 Step-Audio-R1. 1是什么 Step-Audio-R1. 1是阶跃星辰开源的全球首个原生语音推理模型,最新升级版本在权威评测榜单Artificial Analysis Speech Reasoning中以96. 4%准确率登顶。模型通过创新的模态锚定推理蒸馏(MGRA)框架,直接基于声学特征(如音调、节奏)进行多步逻辑推理,解决了传统音频模型依赖文本转录导致的“想越多错越多”问题。核心能力包括实时语音理解、复杂场景(如环境音分析)推理,支持端到端无延迟响应,性能超越Gemini、GP... --- ### OctoCodingBench - MiniMax开源面向Coding Agent标准的评测集 - Published: 2026-01-15 - Modified: 2026-01-15 - URL: https://aisharenet.com/octocodingbench/ - 分类目录: 最新AI资源 - 内容可见性: 所有人可见 OctoCodingBench是什么 OctoCodingBench是MiniMax开源的首个面向Coding Agent生产级标准的评测集,核心创新在于通过Check-level准确率(CSR)和Instance-level成功率(ISR)双维度,评估AI在编码过程中的规范遵循能力。评测集包含72个真实开发场景实例,涵盖系统提示、用户指令、工具调用等七类规则冲突处理,平均每个任务设置33. 6个检查点。 OctoCodingBench的功能特色 指令遵循测试:评估智能体对不同来源指令的遵循能力... --- ---