このドキュメントは AI によって生成されました。誤りを発見した場合や改善に関するご提案があれば、ぜひご貢献ください! GitHub で編集するWanInfiniteTalkToVideo ノードは、音声入力から動画シーケンスを生成します。このノードでは、1人または2人の話者から抽出された音声特徴を条件として用いる動画拡散モデルを活用し、話者(トーキングヘッド)動画の潜在表現を生成します。また、既存の動画シーケンスを前フレームを運動コンテキストとして利用して拡張することも可能です。
入力
パラメーター制約:
modeを"two_speakers"に設定した場合、パラメーターaudio_encoder_output_2、mask_1、mask_2は必須となります。audio_encoder_output_2を指定した場合は、mask_1およびmask_2も必ず指定する必要があります。mask_1およびmask_2を指定した場合は、audio_encoder_output_2も必ず指定する必要があります。previous_framesを指定した場合、そのフレーム数はmotion_frame_countで指定された数以上である必要があります。