Wan2.2-S2V - Ali Tongyi オープンソース音声駆動ビデオ生成モデル
Wan2.2-S2VはAli Tongyiのオープンソースのマルチモーダルビデオ生成モデルであり、静止画像と音声のみで、高品質のデジタルヒューマンビデオを生成することができ、様々な画像タイプとフレームをサポートしています。
アーネスト・ンによる開発者のためのChatGPTチップエンジニアリング無料コース
ChatGPT Tip Engineering for Developersは、開発者向けにデザインされたDeepLearning.AIとOpenAIの共同コースで、Isa Fulford、Andrew Ngを講師に迎え、大規模言語モデル(LLM)の使い方を学びます。
Ask o4 - Ask o4が導入した、8つの思考経路を同時に開くパラレル思考モデル
Ask White o4は、8つの思考経路を同時に開き、問題を多角的に分析し、最適解を自動的にフィルタリングする革新的な並列思考モデルです。このモデルには、高度なLong-CoT強化学習とプロセス報酬学習技術が組み込まれており、強力な深層推論機能を持ち、複雑なタスクで優れたパフォーマンスを発揮します。
VibeVoice - マイクロソフトの音声合成モデリング
バイブボイスは、マイクロソフトの新しい音声合成(TTS)モデルである。このモデルは、最大4つの異なるスピーカーから会話音声を生成し、最大90分の連続音声出力をサポートしており、従来のTTSシステムの長さの制限を打ち破っている。
SpatialGen - Qunar Technologiesのオープンソース3Dシーン生成モデル
SpatialGenはQunar Technologyのオープンソース3Dシーン生成モデルであり、拡散モデルアーキテクチャに基づき、テキスト記述、参照画像、3D空間レイアウトに基づいて時空間的に一貫性のあるマルチビュー画像の生成をサポートし、さらに3Dガウスシーンの生成とローミングビデオのレンダリングを行う。
EchoMimicV3 - Ant オープンソースマルチモーダルデジタルヒューマンアニメーション生成モデル
EchoMimicV3は、Ant Groupが発表したマルチモーダルデジタル人体動画生成モデルで、13億のパラメータを持ち、音声、テキスト、画像などの複数の入力を扱うことができ、高品質のデジタル人体アニメーションを生成することができます。
おすすめのAI小論文作成ツールとは?おすすめの無料AIアカデミック小論文アシスタント15選
人工知能ブームの時代、AIツールは私たちの生活を変え、学術研究や論文執筆を大いに助けてきた。ユーザーがより効率的に仕事や勉強ができるように、このまとめでは、最先端の無料のAI学術論文アシスタントを15個厳選して紹介する。
Fun-ASR - ネイルとTongyiが共同で発表した新世代の音声認識モデル
Fun-ASRはNailとTongyi Labsが共同で発表した音声認識の大型モデルです。このモデルは膨大な音声データで学習され、インターネット、テクノロジー、家庭装飾などの多業種の専門用語を正確に識別することができ、認識精度が大幅に向上している。このモデルは推論最適化のためにNailの企業情報と組み合わされ、ファントム...
Squibler - アイデアから創作までの全プロセスを支援するAI小説執筆プラットフォーム
Squiblerは、作家のために設計された強力なAI支援ライティング・プラットフォームで、構想から創作、出版までの全プロセスを支援します。このプラットフォームは、小説、脚本、短編小説などをカバーするさまざまなストーリー・テンプレートを提供します。ユーザーは最初のコンセプトを入力するだけで、AIがアウトライン、キャラクター、シーンを生成します。
91Writing - オープンソースAIインテリジェント小説作成プラットフォーム
91Writingは、Vue 3とElement Plusをベースに開発された完全オープンソースのAI小説作成ツールで、GPT、Claude、Geminiなどの様々な高度なAIモデルを統合しています。このツールは、プロジェクトの作成を含む、アイデアからテキストまでの完全な作成ツールチェーンをクリエイターに提供します...









