メインコンテンツへスキップ
このドキュメントは AI によって生成されました。誤りを発見した場合や改善に関するご提案があれば、ぜひご貢献ください! GitHub で編集する
WanInfiniteTalkToVideo ノードは、音声入力から動画シーケンスを生成します。このノードでは、1人または2人の話者から抽出された音声特徴を条件として用いる動画拡散モデルを活用し、話者(トーキングヘッド)動画の潜在表現を生成します。また、既存の動画シーケンスを前フレームを運動コンテキストとして利用して拡張することも可能です。

入力

パラメーター制約:
  • mode"two_speakers" に設定した場合、パラメーター audio_encoder_output_2mask_1mask_2 は必須となります。
  • audio_encoder_output_2 を指定した場合は、mask_1 および mask_2 も必ず指定する必要があります。
  • mask_1 および mask_2 を指定した場合は、audio_encoder_output_2 も必ず指定する必要があります。
  • previous_frames を指定した場合、そのフレーム数は motion_frame_count で指定された数以上である必要があります。

出力