最終更新:ID:XW7yHyv3Wg 2025年01月13日(月) 19:08:29履歴
ある程度原理を知ってるとヒントになるかもしれない
読んだほうがいい論文が出たら気軽に追加していってや
読んだほうがいい論文が出たら気軽に追加していってや
Stable Diffusionの元論文
解説記事
【論文メモ】High-Resolution Image Synthesis with Latent Diffusion Models (Stable Diffusion)
解説記事
【論文メモ】High-Resolution Image Synthesis with Latent Diffusion Models (Stable Diffusion)
概要(日本語訳)
最近の動画生成における進展は、個人や産業の両方において日常生活を深く変革してきました。しかし、主要なビデオ生成モデルは依然としてクローズドソースであり、業界と一般コミュニティ間で動画生成能力における大きな性能格差を生じさせています。本報告書では、新しいオープンソースの動画基盤モデル(video foundation model)である「HunyuanVideo」を紹介します。このモデルは、動画生成において、主要なクローズドソースモデルと同等か、それを上回る性能を示します。
HunyuanVideoは、以下を統合した包括的なフレームワークを特徴としています:データキュレーション(data curation), 高度なアーキテクチャ設計(advanced architecture design), プログレッシブなモデルのスケーリングとトレーニング(progressive model scaling and training), 大規模なモデルのトレーニングと推論を可能にする効率的なインフラストラクチャ(efficient infrastructure)。
これらを基盤に、13億以上のパラメータを持つ動画生成モデルを成功裏にトレーニングしました。これは、すべてのオープンソースモデルの中で最大規模のものです。広範な実験を実施し、次のような特定の設計を実装しました:高い視覚品質(visual quality)の確保, 動作のダイナミクス(motion dynamics)の実現, テキストとビデオの整合性(text-video alignment)の向上, 高度な撮影技術(advanced filming techniques)の適用。
専門家による人間評価の結果によれば、HunyuanVideoは、Runway Gen-3、Luma 1.6、および中国の動画生成モデルの中で最高性能を持つ3つのモデルを含む、これまでの最先端モデルを上回る性能を発揮しました。本モデルのコードとその応用を公開することで、クローズドソースとオープンソースのコミュニティ間のギャップを埋めることを目指しています。この取り組みにより、コミュニティの誰もが自身のアイデアを実験できるようになり、より動的で活気のある動画生成体制の促進が期待されます。コードは以下のURLで公開されています:https://github.com/Tencent/HunyuanVideo
最近の動画生成における進展は、個人や産業の両方において日常生活を深く変革してきました。しかし、主要なビデオ生成モデルは依然としてクローズドソースであり、業界と一般コミュニティ間で動画生成能力における大きな性能格差を生じさせています。本報告書では、新しいオープンソースの動画基盤モデル(video foundation model)である「HunyuanVideo」を紹介します。このモデルは、動画生成において、主要なクローズドソースモデルと同等か、それを上回る性能を示します。
HunyuanVideoは、以下を統合した包括的なフレームワークを特徴としています:データキュレーション(data curation), 高度なアーキテクチャ設計(advanced architecture design), プログレッシブなモデルのスケーリングとトレーニング(progressive model scaling and training), 大規模なモデルのトレーニングと推論を可能にする効率的なインフラストラクチャ(efficient infrastructure)。
これらを基盤に、13億以上のパラメータを持つ動画生成モデルを成功裏にトレーニングしました。これは、すべてのオープンソースモデルの中で最大規模のものです。広範な実験を実施し、次のような特定の設計を実装しました:高い視覚品質(visual quality)の確保, 動作のダイナミクス(motion dynamics)の実現, テキストとビデオの整合性(text-video alignment)の向上, 高度な撮影技術(advanced filming techniques)の適用。
専門家による人間評価の結果によれば、HunyuanVideoは、Runway Gen-3、Luma 1.6、および中国の動画生成モデルの中で最高性能を持つ3つのモデルを含む、これまでの最先端モデルを上回る性能を発揮しました。本モデルのコードとその応用を公開することで、クローズドソースとオープンソースのコミュニティ間のギャップを埋めることを目指しています。この取り組みにより、コミュニティの誰もが自身のアイデアを実験できるようになり、より動的で活気のある動画生成体制の促進が期待されます。コードは以下のURLで公開されています:https://github.com/Tencent/HunyuanVideo
コメントをかく