テキストと参照素材の組み合わせ
入力方法はサービスごとに違います。Seedance 2.5とSeedance 3.0はテキストに加えて画像、クリップ、音声を参照にでき、SeeVidはテキストや参照画像からモーション、音、複数ショットを作れます。Gemini Omniはテキスト・画像・クリップから一貫した動画を生成し、Loova AIやAlav AIは動画や画像も同じ作業画面で扱います。文章だけで始めるか、人物・商品・画面の見た目を参照素材で寄せたいかを先に決めると選びやすくなります。
384 件のツール · 2026年10月6日 更新
文章や台本から短い動画を作り、画像やクリップを参照素材として動き・画面構成・音を加えられます。歌詞映像、商品キャンペーン、短尺SNS、顔出しなしの投稿など、用途と素材に合う生成先をここで選べます。
入力方法はサービスごとに違います。Seedance 2.5とSeedance 3.0はテキストに加えて画像、クリップ、音声を参照にでき、SeeVidはテキストや参照画像からモーション、音、複数ショットを作れます。Gemini Omniはテキスト・画像・クリップから一貫した動画を生成し、Loova AIやAlav AIは動画や画像も同じ作業画面で扱います。文章だけで始めるか、人物・商品・画面の見た目を参照素材で寄せたいかを先に決めると選びやすくなります。
出力の長さと解像度は確認が必要です。Seedance 3.0は最大30秒のシーン、最大4K出力を掲げ、別のSeedance 3.0の掲載情報も最大30秒と4Kを示しています。Seedance 2.5とAny Video Converter AI Video Generatorは1080p出力に対応し、前者はシーン拡張、後者は数分でのクリップ生成を案内しています。音の要件も、同期した声・環境音・効果音が必要なのか、元の楽曲を使うのかで変わります。
完成形から逆算すると候補を絞れます。Freebeat AIは既存の曲を使い、文字をシーンに組み込んだ歌詞フィルムを作る用途です。Rennoise AIは商品ビジュアル、動画、音声をキャンペーン向けにまとめ、4K補正とショット計画を備えます。FacelessReels Appはトピック、台本、プロンプト、画像から短尺の顔出しなし動画を作り、ダウンロード、公開、予約投稿まで進められます。商品紹介、音楽投稿、定期的なSNS運用のどこに置くかで選択が変わります。
同じ文章生成でも、選べる補助機能に差があります。AIReelは20以上のモデル、スマートルーティング、プロンプト支援、1,000以上のテンプレートを備えた無料の画像・動画作成サービスです。SeeVidは商用利用向けの出力を掲げ、FacelessReels Appは公開や予約投稿まで含みます。料金を比較するときは、無料の範囲だけでなく、必要なモデル、テンプレート、商用利用、ダウンロード先、投稿連携が含まれるかを確認してください。掲載情報だけでは各サービスの料金額や生成枠までは判断できません。
このカテゴリの中心は、文章や参照素材をもとに新しい動画フレームを生成することです。文字起こしだけを行うサービス、字幕を既存映像に焼き込むだけのサービス、素材を切り貼りして再利用するだけの編集ソフトは対象外です。一方、Loova AIは生成に加えて動画・画像・広告・トーキングフォトを扱い、Gemini Omniは会話でシーンを修正できます。Alav AIもシーン編集や画像生成、出力設定に対応しますが、元映像の単純な編集先を探している場合は目的が異なります。
テキスト、写真、参照素材、バイラルテンプレートから、フォーマット、長さ、解像度、音声を調整できる共有用動画を作成します。
テキストと画像から、自然な動き、リアルなインタラクション、表現力豊かなカメラワークを備えたシネマティックな動画を作成します。
テキストまたは画像から5~30秒の動画を作成し、終了フレーム、音声、解像度調整、プレビュー、ダウンロードに対応します。
キャラクターの外見を固定し、多彩なスタイル、商用利用権、縦型または横型フォーマットに対応した、スクリプトからのナレーション付きカートゥーン動画を作成します。
テキスト、画像、音声、動画から動画を作成し、会話を通じてシーン、キャラクター、カメラの動き、サウンドを調整できます。
テキスト、画像、参照素材、キーフレームから映画のような広告やストーリー動画を作成し、キャラクターや製品の認識性を保ちます。
テキストや参照画像から映画のような動画を生成し、プロンプトで指示するカメラモーション、一貫したシーン、ネイティブ音声に対応します。
動き、カメラワーク、雰囲気を説明して静止画に命を吹き込み、クリエイティブプロジェクト向けの短い動画を作成します。
1つのブラウザー作業スペースで、アスペクト比、解像度、モデルを選びながら、テキストや参照画像から3〜30秒の動画を作成できます。
テキストプロンプトや静止画像から、マルチショットのストーリーテリングと選択可能な尺・アスペクト比で1080p動画を作成できます。
テキスト、画像、クリップ、音声から、同期したサウンド、マルチショットシーン、ターゲットを絞った編集付きの動画を生成します。
参考制御、シーン拡張、サウンド、最大 1080p 出力を使って、テキスト、画像、クリップ、音声からシネマティック動画を作成します。
テキストとマルチモーダル参照から、同期した音声・環境音・効果音付きで最大30秒の動画を作成します。
既存の曲を、文字をシーンに組み込んだリリックフィルムに変換し、任意の参考人物とオリジナルサウンドトラックを付けます。
4K強化とガイド付きショット計画で、キャンペーン向けの一貫した商品ビジュアル、動画、音声を作成できます。
テキストまたは画像から1080p動画を生成。自然な動き、多様なビジュアルスタイル、そして数分で作成されるクリップを提供します。
1つのブラウザワークスペースで、テキスト、画像、動画から動画、画像、広告、会話する写真を作成・編集できます。
テキストや参照画像から、動き・音声・マルチショットシーン・商用利用可能な出力を備えた動画と画像を作成します。
20以上のモデル、スマートルーティング、プロンプト補助、AI動画・画像ツール、1,000以上のテンプレートを備えた無料のAI画像・動画作成ツール。
テキスト、画像、動画、音声の参照からシネマティックな動画を生成。最長30秒のシーンと4K出力に対応。
テキスト、画像、またはクリップから一貫した動画を作成し、再開せずに会話形式の編集でシーンを洗練します。
トピック、スクリプト、プロンプト、画像から短尺動画を作成し、顔出しなしのソーシャルコンテンツを準備、ダウンロード、公開、または予約投稿します。
プロンプト、画像、参照から動画を作成し、同じワークスペースでシーン編集、画像生成、出力設定の調整まで行えます。
テキストプロンプト、選択可能なモデル、SNS・広告・商品ページ向けのサイズでのエクスポートを使って、写真をHD動画クリップにアニメーション化します。
テキスト、画像、ドキュメントを、調整可能なアスペクト比のナレーション付き共有可能動画に、ブラウザ上で直接変換します。
テキスト、画像、または参照クリップから、ネイティブステレオ音声付きで最大15秒の2K動画を作成します。
1つのワークスペースで動画、画像、ナレーション、音楽を作成し、事前のクレジット見積もりと失敗した生成の自動返金を利用できます。
テキスト、画像、参照から、同期オーディオ、3Dプレビュー、領域単位の再描画編集付きの完全な30秒動画を作成します。
テキストと画像からHD動画を作成し、モーションを指示し、モデルの出力を比較し、ブラウザ上で直接映像を編集できます。
テキストプロンプト、画像、参考ビジュアル、または開始フレームと終了フレームから動画を作成し、その後スタイル、長さ、品質をカスタマイズできます。
テキストプロンプトや画像から短い動画を生成し、開始・終了フレームの制御と最大 1080p のダウンロードに対応します。
トラック、プロンプト、スタイル、キャラクター参照、生成された視覚効果を組み合わせて、音楽をビート同期ビデオに変換します。
脚本、ナレーション、イラスト風ビジュアル、字幕、音楽、そしてSNS全体への自動投稿を備えた、スケジュール可能な顔出しなし動画エピソードを作成できます。
編集、ウォーターマーク削除、毎月の無料クレジット付きで、テキストや画像から商用利用可能な画像と動画を作成します。
最大9枚の画像、3本の動画、音声、テキストを精密な素材参照と組み合わせて、4〜15秒の動画を作成します。
画像とプロンプトから短い動画を作成し、再生時間、滑らかさ、カメラの動き、スタイル、解像度を調整できます。
プロンプトと最大9枚の参照画像から720pまたは1080pの動画を、同期音声とWebhook配信付きで生成します。
1つのREST APIを通じて、プロンプト、画像、または既存のクリップから同期オーディオ付きの最大20秒の1080p動画を作成します。
プロンプトと参照メディアから、同期ステレオ音声付きのネイティブ2K動画クリップを1つのAPIで生成します。
1つのAPIで、テキスト、画像、動画、音声から、同期音声付きの最大15秒のネイティブ4K動画を生成します。
1つのREST APIで、同期音声と最大50件のマルチモーダル参照を使って、最大30秒のシネマティック動画クリップを生成します。
テキストプロンプトや写真から短い動画を作成し、ブラウザ内で直接ダウンロード、保存、再利用できます。
トピックから、スクリプト、ナレーション、字幕、ビジュアル、音楽、編集を含む投稿可能な顔出しなしの短い動画を作成します。
モーション、カメラの方向、参照、シーンの一貫性をガイドしながら、プロンプトや画像から動画を作成します。
テキストプロンプト、参考画像、サウンドテンプレートから、睡眠、ウェルネス、商品、SNS向けの心地よいASMR動画を作成します。
プロンプトや画像から、同期ステレオサウンドと6種類のアスペクト比を備えた、ネイティブ2Kの4〜15秒動画を作成できます。
テキスト、画像、動画、音声を組み合わせ、同期したステレオサウンド付きで、最大 15 秒の一貫したネイティブ 2K 動画を作成します。
プロンプトと最大50件のマルチモーダル参照から30秒のAI動画クリップを生成し、ローカルな詳細を調整します。
プロンプト、画像、参照クリップを、演出されたカメラワークと失敗レンダーの自動返金付きで、一貫性のあるシネマティック動画に変換します。