Mis à jour le 15 août 20269 min de lecture

Faire parler une photo ancienne : 5 outils IA testés (2026)

J'ai testé 5 outils IA pour faire parler une photo ancienne en 2026 : D-ID, ElevenLabs, HeyGen, Edimakor, Filmora. Verdict sur la synchro labiale, la qualité sur photos des années 1930-1970 et les options gratuites.

photo parlanteIAanimationphoto ancienne2026d-idheyGentutoriel
Thomas Moreau
Thomas Moreau

AI & Technology Writer, Incarn

L'essentiel

Après 30+ heures à tester 5 outils pour faire « parler » de vieilles photos : D-ID Creative Reality Studio donne les résultats les plus naturels sur les portraits anciens (5,90€/mois, 5 crédits gratuits). La combinaison ElevenLabs (voix IA) + D-ID (animation lèvres) est le standard de qualité. Attention : aucun outil gratuit ne gère correctement les photos en noir et blanc des années 1930-1960, les lèvres se déforment. Pour l'animation sans audio (mouvement naturel sans synchronisation), Incarn reste supérieur sur les portraits anciens à 1,99€ par photo.

TL;DR

Après 30+ heures à tester 5 outils pour faire « parler » de vieilles photos : D-ID Creative Reality Studio donne les résultats les plus naturels sur les portraits anciens (5,90€/mois, 5 crédits d'essai gratuits). La combinaison ElevenLabs (voix IA) + D-ID (animation lèvres) est le standard de qualité en 2026. Aucun outil gratuit ne gère correctement les photos en noir et blanc des années 1930-1960, les lèvres se déforment. Pour l'animation sans audio (mouvement naturel du visage sans synchronisation), Incarn reste supérieur sur les portraits anciens à 1,99€ par photo.

La photo de mon arrière-grand-père fait 9 × 12 cm, format carte postale, tirage argentique des années 1935. Il porte un col dur et regarde l'objectif avec ce sérieux que les photographes de l'époque imposaient à leurs clients. J'ai voulu lui faire dire quelque chose.

Pas un deepfake. Juste entendre, ou imaginer entendre, ce que cette voix aurait pu dire. Bonjour, peut-être. Ou rien. Juste voir ces lèvres bouger.

Voilà comment j'ai passé cinq semaines à tester des outils d'animation labiale sur des photos de famille des années 1920-1975.

Ce que les outils IA peuvent faire (et ne pas faire) avec vos vieilles photos

Une "photo parlante" (ou talking photo en anglais) est une vidéo courte dans laquelle une photo fixe est animée en synchronisant les lèvres avec un fichier audio. Le résultat : la personne sur la photo semble prononcer un texte, une phrase, un discours.

La technologie repose sur deux briques : un modèle de génération vidéo qui anime le visage, et un système de lip sync (synchronisation labiale) qui aligne le mouvement des lèvres avec la forme phonétique de l'audio. En 2026, plusieurs outils combinent les deux en un seul pipeline.

Ce que ces outils ne font pas, en revanche : corriger les défauts d'une photo. Si la photo est floue, la vidéo sera floue. Si le visage est de profil, la synchronisation labiale sera mauvaise. Si la photo a des rayures traversant le visage, elles s'animeront avec les rayures.

La restauration de la photo est donc une étape préalable non négociable. Pas optionnelle. Préalable.

Les 5 outils testés pour faire parler une photo ancienne

J'ai testé chaque outil sur le même corpus : 12 portraits issus de photos de famille (1920-1975), noir et blanc et couleur, qualité variable. Le même fichier audio de 15 secondes pour tous.

Outil Essai gratuit Tarif Qualité N&B Naturalisme visage Recommandé
D-ID Creative Reality 5 crédits Dès 5,90€/mois Bon Excellent ✓ Oui
HeyGen 1 min d'essai Dès 29 USD/mois Moyen Bon Partiel
ElevenLabs + D-ID ElevenLabs gratuit ~6€/mois (D-ID) Bon Excellent ✓ Oui (combo)
Edimakor HitPaw Watermark Dès 49 USD/an Faible Faible sur N&B Non
Filmora IA Parlante Watermark Dès 49,99€/an Faible Faible Non

D-ID Creative Reality Studio est l'outil le mieux adapté aux portraits anciens. Il a été conçu pour les présentations d'entreprise avec des "avatars parlants", mais son algorithme gère correctement les photographies argentiques. Les lèvres ne se déforment pas anormalement. Les rides et les contrastes forts des photos de 1935-1955 ne perturbent pas la génération.

HeyGen donne de bons résultats sur des photos récentes avec bonne résolution. Sur les photos en noir et blanc avant 1960, les artefacts sont visibles : la zone de la bouche se pixelise légèrement à certaines syllabes. Utilisable, mais pas optimal.

Edimakor et Filmora sont des logiciels de montage vidéo qui ont ajouté une fonction "photo parlante" en 2024-2025. Sur les photos récentes en haute définition, les résultats sont corrects. Sur les photos anciennes en noir et blanc, les lèvres générées sont artificielles et sortent du visage de façon visible. Ces outils ne sont pas conçus pour les archives de famille.

Quel type de photo obtient les meilleurs résultats ?

La synchronisation labiale fonctionne sur un spectre très strict. Ce qui marche bien :

  • Portrait de face ou léger trois quarts (moins de 30° de côté)
  • Résolution minimale de 600 × 800 pixels après numérisation ou restauration
  • Visage occupant au moins 40% de la surface de l'image
  • Éclairage homogène sans ombre dure traversant la bouche

Ce qui échoue systématiquement :

  • Profil pur (moins de 50% du visage visible)
  • Photo de groupe où chaque visage fait moins de 2 cm sur l'original
  • Photo très dégradée avec rayures ou taches sur la zone de la bouche
  • Flou sur le visage, même léger (la génération accentue le flou)

Sur mon corpus de 12 portraits, 7 ont donné des résultats utilisables. 5 étaient trop de profil, trop petits ou trop endommagés. C'est un ratio correct mais inférieur à ce qu'on obtient avec l'animation simple (mouvement naturel sans audio), qui tolère des photos de moins bonne qualité.

La règle que j'ai suivie : si le visage n'est pas suffisamment net et frontal pour la photo parlante, j'anime sans audio avec Incarn, les résultats sur portraits anciens sont meilleurs, à 1,99€ par photo.

Faire parler une photo gratuitement : ce qui existe en 2026

La question que tout le monde pose en premier. La réponse honnête : gratuit avec des vraies limites.

D-ID offre 5 crédits d'essai à l'inscription, sans carte bancaire. Chaque crédit correspond à une vidéo de 15 secondes maximum. C'est suffisant pour tester sérieusement sur 5 photos différentes.

HeyGen donne 1 minute de génération gratuite. Largement suffisant pour un essai, mais le quota s'épuise vite si vous voulez comparer plusieurs photos.

ElevenLabs (pour la voix) propose un plan gratuit avec 10 000 caractères de synthèse vocale par mois, suffisant pour générer des phrases courtes. Couplé aux 5 crédits gratuits de D-ID, vous pouvez créer jusqu'à 5 photos parlantes sans débourser un euro.

Ce que le gratuit ne fait pas : les outils comme Edimakor ou Filmora en version d'essai ajoutent un watermark visible sur toute la vidéo. Inutilisable pour un partage en famille ou sur les réseaux sociaux.

Aucun outil gratuit ne donne de bons résultats sur les photos en noir et blanc des années 1930-1960. Elles nécessitent plus de puissance de calcul et les modèles gratuits sont bridés. Si c'est votre cas, D-ID en version payante (5,90€/mois) reste la seule option sérieuse.

Tutoriel : faire parler une vieille photo de famille en 6 étapes

Voici la méthode que j'ai retenue après mes tests, la combinaison ElevenLabs + D-ID.

Étape 1, Préparer la photo. La photo doit être numérisée à haute résolution (1200 DPI minimum pour un scanner à plat, ou l'équivalent au smartphone en lumière naturelle). Restaurez les rayures et taches avec Remini ou Adobe Photoshop Express avant de continuer. Une photo dégradée donnera une vidéo dégradée.

Étape 2, Créer la voix sur ElevenLabs. Rendez-vous sur elevenlabs.io. Sélectionnez une voix dans la bibliothèque (choisissez par âge, genre, langue). Tapez le texte que vous souhaitez faire dire à la personne. Exportez en MP3 ou WAV.

Étape 3, Importer sur D-ID. Sur studio.d-id.com, créez un "presenter" et importez votre photo comme avatar. Importez le fichier audio d'ElevenLabs. Lancez la génération.

Étape 4, Vérifier la synchronisation labiale. La vidéo générée dure le temps de l'audio. Regardez attentivement la zone de la bouche. Sur les bonnes photos frontales, la synchro est naturelle à la première génération. Sur les photos de profil partiel, vous devrez peut-être ajuster l'angle de recadrage.

Étape 5, Télécharger en MP4. D-ID exporte en MP4 directement. La qualité est suffisante pour WhatsApp, Instagram ou l'intégration dans un diaporama d'obsèques ou un album de famille numérique.

Étape 6, Garder l'original. Ne jamais écraser la photo originale numérisée. La vidéo générée est une création dérivée, pas un remplacement.

Est-ce légal de faire parler la photo d'un proche décédé ?

La question se pose, et elle mérite une réponse claire.

En France, le droit à l'image des personnes décédées appartient à leurs héritiers pendant 70 ans après le décès. Pour un usage strictement privé et familial, partager la vidéo avec ses propres enfants, la projeter lors d'une réunion de famille, l'utiliser dans un hommage mémoriel, le risque juridique est quasi nul.

Ce qui est clairement interdit : utiliser une photo parlante pour faire dire à une personne décédée des propos commerciaux, politiques, ou tout contenu qu'elle aurait vraisemblablement refusé de son vivant.

Pour les photos de personnes vivantes, le consentement explicite est requis avant toute utilisation. Une photo parlante non consentie d'une personne vivante constitue une atteinte à son image, indépendamment de l'outil utilisé.

Les outils comme D-ID et HeyGen précisent dans leurs conditions d'utilisation que l'utilisateur est responsable du respect des droits des tiers. Aucune plateforme ne filtre le contenu créé, mais les vidéos qui circulent publiquement exposent leur auteur.

Pour un hommage familial privé d'un ancêtre disparu depuis plusieurs décennies : utilisez ces outils sans crainte légale, avec la seule limite du bon goût.

Quand l'animation sans paroles suffit (et pourquoi c'est différent)

Faire parler une photo et animer une photo sont deux choses distinctes.

L'animation standard, celle qu'on obtient avec des outils comme Incarn ou Runway, crée un mouvement naturel du visage : clignement des yeux, légère rotation de la tête, respiration simulée. Aucun audio requis. La photo prend vie sans prononcer de mots.

L'animation avec synchronisation labiale ajoute une couche de complexité : elle contraint le mouvement à coller à des phonèmes précis, ce qui impose des exigences strictes sur la qualité et l'angle de la photo.

Résultat : sur les portraits très anciens ou de mauvaise qualité, l'animation simple donne souvent un meilleur résultat que la photo parlante, parce que le modèle n'est pas contraint à reproduire des formes labiales précises.

La règle pratique que j'ai adoptée : si la photo est de face, nette et à bonne résolution, tentez la photo parlante. Si la photo est de profil, petite, ou abimée, l'animation simple est plus fiable. Incarn est optimisé pour les portraits de famille, y compris les photos en noir et blanc des années 1930-1970, là où les outils généralistes décrochent. Première animation offerte à l'inscription, 1,99€ par photo ensuite.

Les deux approches se complètent. La photo parlante pour le discours et l'émotion. L'animation simple pour la présence et le souvenir.

Thomas Moreau
Thomas Moreau

AI & Technology Writer, Incarn

Thomas covers AI and machine learning applications for creative tools. Former research engineer with a focus on computer vision and video generation.

À lire ensuite