古い写真を話させる:5つのAIツールを比較(2026年)
古い写真を「話させる」5つのAIツールをテストしました:D-ID、ElevenLabs、HeyGen、Edimakor、Filmora。リップシンクの品質、1930〜1970年代の写真での結果、無料オプションについて正直な評価をお届けします。
Thomas Moreau
AI & Technology Writer, Incarn
要点
古い写真を「話させる」5つのツールを30時間以上テストした結果:D-ID Creative Reality Studioが古い肖像写真で最も自然な結果を出します(月5.90ユーロから、5クレジット無料)。ElevenLabs(AI音声)+D-ID(口の動き)の組み合わせが品質の標準です。注意:1930〜1960年代の白黒写真を正しく処理できる無料ツールはありません―口が歪みます。音声なしのアニメーション(リップシンクなしの自然な動き)には、Incarnが古い肖像写真で優れており、1枚1.99ユーロです。
TL;DR
古い写真を「話させる」5つのツールを30時間以上テストした結果:D-ID Creative Reality Studioが古い肖像写真で最も自然な結果を出します(月5.90ユーロから、5クレジットの無料トライアル)。ElevenLabs(AI音声)+D-ID(口元アニメーション)の組み合わせが2026年の品質基準です。1930〜1960年代の白黒写真を正しく処理できる無料ツールはありません―口が歪みます。音声なしのアニメーション(リップシンクなしの自然な顔の動き)には、Incarnが古い肖像写真で優れており、1枚1.99ユーロです。
曾祖父の写真は9×12センチ、絵葉書サイズ、1930年代の銀塩プリントです。彼は硬い襟を着け、当時の写真家が顧客に求めていた真剣さでカメラを見つめています。彼に何かを言わせたいと思いました。
ディープフェイクではありません。ただその声が言ったかもしれないことを聞きたかった―または聞いたと想像したかった。こんにちは、perhaps。あるいは何も。ただその唇が動くのを見たかった。
そうして私は1920年から1975年の家族写真で口元アニメーションツールをテストする5週間を過ごしました。
AIツールで古い写真にできること(できないこと)
「話す写真」(talking photo)とは、静止画像を音声ファイルに合わせて唇を同期させることでアニメーション化した短い動画です。結果:写真の中の人物がテキスト、フレーズ、スピーチを話しているように見えます。
この技術は2つのコンポーネントに基づいています:顔をアニメーション化するビデオ生成モデルと、唇の動きを音声の音声形状に合わせるリップシンクシステムです。2026年には、複数のツールが両方を一つのパイプラインに組み合わせています。
これらのツールが行わないこと:写真の欠陥を修正すること。写真がぼやけていれば、動画もぼやけます。顔が横向きなら、リップシンクは悪くなります。顔を横切るひっかき傷があれば、ひっかき傷もアニメーション化されます。
写真の修復は、したがって交渉の余地のない前提条件です。オプションではありません。前提条件です。
古い写真を話させるためにテストした5つのツール
同じコーパスで各ツールをテストしました:家族写真(1920〜1975年)から12枚の肖像、白黒とカラー、品質は様々。すべてに同じ15秒の音声ファイルを使用。
| ツール | 無料トライアル | 価格 | 白黒品質 | 自然さ | 推奨 |
|---|---|---|---|---|---|
| D-ID Creative Reality | 5クレジット | 月5.90ユーロから | 良い | 優秀 | ✓ はい |
| HeyGen | 1分試用 | 月29ドルから | 普通 | 良い | 部分的 |
| ElevenLabs+D-ID | ElevenLabs無料 | 月約6ユーロ(D-ID) | 良い | 優秀 | ✓ はい(コンボ) |
| Edimakor HitPaw | 透かしあり | 年49ドルから | 低い | 白黒で低い | いいえ |
| Filmora AIトーキング | 透かしあり | 年49.99ユーロから | 低い | 低い | いいえ |
D-ID Creative Reality Studioは古い肖像写真に最も適したツールです。「話すアバター」を使ったビジネスプレゼンテーション向けに設計されましたが、そのアルゴリズムは銀塩写真を正しく処理します。唇が異常に歪みません。1935〜1955年の写真のシワや強いコントラストが生成を妨げません。
HeyGenは高解像度の最近の写真で良い結果を出します。1960年以前の白黒写真では、アーティファクトが見えます:一部の音節で口の周辺が少しピクセル化します。使用可能ですが、最適ではありません。
EdimakorとFilmoraは2024〜2025年に「話す写真」機能を追加したビデオ編集ソフトウェアです。高解像度の最近の写真では結果は許容範囲内です。古い白黒写真では、生成された唇が人工的で顔から目に見えて飛び出します。これらのツールは家族のアーカイブ向けに設計されていません。
どのタイプの写真が最良の結果を出すか?
リップシンクは非常に厳しいスペクトルで機能します。うまく機能するもの:
- 正面または軽い斜め向きの肖像(横向き30度以下)
- スキャンまたは修復後、最低600×800ピクセルの解像度
- 顔が画像の表面の少なくとも40%を占める
- 口を横切る強い影のない均一な照明
一貫して失敗するもの:
- 純粋な横向き(顔の50%未満が見える)
- 元の写真で各顔が2センチ未満のグループ写真
- 口の部分にひっかき傷や汚れがある大きく傷んだ写真
- 顔のぼかし、わずかでも(生成がぼかしを増幅させます)
12枚の肖像のコーパスから、7枚が使用可能な結果を出しました。5枚は横向きが強すぎ、小さすぎ、または傷みすぎでした。これは許容できる比率ですが、音声なしのシンプルなアニメーション(品質が低い写真を許容する)で得られるものより低いです。
私が従ったルール:話す写真に対して顔が十分に鮮明で正面を向いていない場合、Incarnで音声なしでアニメーション化します―古い肖像での結果が良く、1枚1.99ユーロです。
無料で写真を話させる:2026年に存在するもの
誰もが最初に聞く質問です。正直な答え:実際の制限がある無料です。
D-IDは登録時にクレジットカードなしで5つのトライアルクレジットを提供します。各クレジットは最大15秒の動画に対応します。5枚の異なる写真で真剣にテストするのに十分です。
HeyGenは1分間の無料生成を提供します。試用には十分以上ですが、複数の写真を比較したい場合はすぐに割り当てが尽きます。
ElevenLabs(音声用)は月10,000文字のテキスト読み上げを含む無料プランを提供しており、短いフレーズを生成するのに十分です。D-IDの5つの無料クレジットと組み合わせて、1ユーロも使わずに最大5つの話す写真を作成できます。
無料でできないこと:EdimakorやFilmoraのトライアル版は動画全体に目に見える透かしを追加します。家族での共有やソーシャルメディアでは使用できません。
1930〜1960年代の白黒写真では、どの無料ツールも良い結果を出しません。より多くの計算能力が必要で、無料モデルは制限されています。その場合、D-IDの有料版(月5.90ユーロ)が唯一の真剣な選択肢です。
チュートリアル:古い家族写真を6ステップで話させる
私のテスト後に採用した方法―ElevenLabs+D-IDの組み合わせです。
ステップ1―写真を準備する。 写真は高解像度でスキャンする必要があります(フラットベッドスキャナーで最低1200 DPI、または自然光のスマートフォンで同等のもの)。続ける前にReminiやAdobe Photoshop Expressでひっかき傷や汚れを修復します。傷んだ写真は傷んだ動画を生成します。
ステップ2―ElevenLabsで音声を作成する。 elevenlabs.ioにアクセスします。ライブラリから音声を選択します(年齢、性別、言語で選択)。人物に言わせたいテキストを入力します。MP3またはWAVでエクスポートします。
ステップ3―D-IDにインポートする。 studio.d-id.comで「プレゼンター」を作成し、写真をアバターとしてインポートします。ElevenLabsの音声ファイルをインポートします。生成を開始します。
ステップ4―リップシンクを確認する。 生成された動画は音声の長さ分続きます。口の周辺を注意深く見てください。正面を向いた良い写真では、最初の生成でシンクが自然です。部分的な横向き写真では、トリミング角度を調整する必要があるかもしれません。
ステップ5―MP4でダウンロードする。 D-IDはMP4で直接エクスポートします。品質はWhatsApp、Instagram、または葬儀のスライドショーやデジタル家族アルバムへの組み込みに十分です。
ステップ6―オリジナルを保存する。 スキャンしたオリジナルの写真を上書きしないでください。生成された動画は派生作品であり、代替品ではありません。
故人の写真を話させることは合法か?
この疑問が生じます。そして明確な答えが必要です。
ほとんどの国では、故人の肖像権は死後一定期間、相続人に帰属します。厳密に私的かつ家族的な使用―自分の子供と動画を共有すること、家族の集まりでそれを投影すること、追悼の献辞に使用すること―については、法的リスクは実質的にゼロです。
明らかに禁止されていること:亡くなった人に商業的、政治的な発言をさせるため、または生前におそらく拒否したであろう内容のために話す写真を使用すること。
生きている人の写真については、使用前に明示的な同意が必要です。生きている人の同意のない話す写真は、使用したツールにかかわらず、肖像権の侵害にあたります。
数十年前に亡くなった先祖の私的な家族への追悼について:法的懸念なくこれらのツールを使用できます。制限は良識のみです。
無音のアニメーションで十分なとき(そしてなぜ違うのか)
写真を話させることと写真をアニメーション化することは2つの異なることです。
標準的なアニメーション―IncarnやRunwayのようなツールで得られるもの―は自然な顔の動きを作成します:まばたき、わずかな頭の回転、シミュレートされた呼吸。音声は不要です。写真は言葉を発することなく生き生きとします。
リップシンクつきのアニメーションは複雑さの層を追加します:動きを正確な音素に合わせることを強制し、写真の品質と角度に対して厳しい要件を課します。
結果:非常に古い、または品質が低い肖像では、シンプルなアニメーションの方が話す写真よりも良い結果を出すことが多いです。なぜなら、モデルが正確な唇の形を再現することを強制されないからです。
私が採用した実用的なルール:写真が正面を向いており、鮮明で良い解像度の場合、話す写真を試みます。写真が横向き、小さい、または傷んでいる場合、シンプルなアニメーションの方が信頼性が高いです。Incarnは家族の肖像写真に最適化されており、1930〜1970年代の白黒写真も含まれます―汎用ツールが失敗するところで。登録時に最初のアニメーション無料、その後1枚1.99ユーロです。
両方のアプローチは互いを補完します。話す写真はスピーチと感情のため。無音のアニメーションは存在感と記憶のため。
Thomas Moreau
AI & Technology Writer, Incarn
Thomas covers AI and machine learning applications for creative tools. Former research engineer with a focus on computer vision and video generation.
LinkedIn