Actualizado el 26 jul 20269 min de lectura

Hacer hablar una foto antigua: 5 herramientas IA probadas (2026)

Probé 5 herramientas IA para hacer hablar una foto antigua en 2026: D-ID, ElevenLabs, HeyGen, Edimakor, Filmora. Veredicto sobre la sincronización labial, calidad en fotos de 1930-1970 y opciones gratuitas.

foto hablanteIAanimaciónfoto antigua2026d-idheyGentutorial
T

Thomas Moreau

AI & Technology Writer, Incarn

Lo esencial

Después de 30+ horas probando 5 herramientas para hacer 'hablar' fotos antiguas: D-ID Creative Reality Studio da los resultados más naturales en retratos antiguos (desde 5,90€/mes, 5 créditos gratis). La combinación ElevenLabs (voz IA) + D-ID (animación de labios) es el estándar de calidad. Atención: ninguna herramienta gratuita maneja correctamente las fotos en blanco y negro de los años 1930-1960 — los labios se deforman. Para la animación sin audio (movimiento natural sin sincronización labial), Incarn sigue siendo superior en retratos antiguos a 1,99€ por foto.

TL;DR

Después de 30+ horas probando 5 herramientas para hacer "hablar" fotos antiguas: D-ID Creative Reality Studio da los resultados más naturales en retratos antiguos (desde 5,90€/mes, 5 créditos de prueba gratis). La combinación ElevenLabs (voz IA) + D-ID (animación de labios) es el estándar de calidad en 2026. Ninguna herramienta gratuita maneja correctamente las fotos en blanco y negro de los años 1930-1960 — los labios se deforman. Para la animación sin audio (movimiento natural del rostro sin sincronización), Incarn sigue siendo superior en retratos antiguos a 1,99€ por foto.

La foto de mi bisabuelo mide 9 × 12 cm, formato postal, impresión en gelatina de plata de los años 1930. Lleva un cuello rígido y mira al objetivo con esa seriedad que los fotógrafos de la época imponían a sus clientes. Quería hacerle decir algo.

No un deepfake. Solo escuchar, o imaginar escuchar, lo que esa voz podría haber dicho. Hola, quizás. O nada. Solo ver esos labios moverse.

Así pasé cinco semanas probando herramientas de animación labial en fotos de familia de los años 1920 a 1975.

Lo que las herramientas IA pueden (y no pueden) hacer con tus fotos antiguas

Una "foto hablante" (talking photo) es un vídeo corto en el que una foto fija se anima sincronizando los labios con un archivo de audio. El resultado: la persona en la foto parece pronunciar un texto, una frase, un discurso.

La tecnología se basa en dos componentes: un modelo de generación de vídeo que anima el rostro, y un sistema de lip sync (sincronización labial) que alinea el movimiento de los labios con la forma fonética del audio. En 2026, varias herramientas combinan ambos en un solo pipeline.

Lo que estas herramientas no hacen: corregir los defectos de una foto. Si la foto está borrosa, el vídeo estará borroso. Si el rostro está de perfil, la sincronización labial será mala. Si la foto tiene rayaduras que cruzan el rostro, se animarán con las rayaduras.

La restauración de la foto es por tanto un paso previo no negociable. No opcional. Previo.

Las 5 herramientas probadas para hacer hablar una foto antigua

Probé cada herramienta en el mismo corpus: 12 retratos de fotos de familia (1920-1975), en blanco y negro y color, calidad variable. El mismo archivo de audio de 15 segundos para todas.

Herramienta Prueba gratuita Precio Calidad B&N Naturalismo Recomendado
D-ID Creative Reality 5 créditos Desde 5,90€/mes Bueno Excelente ✓ Sí
HeyGen 1 min de prueba Desde 29 USD/mes Regular Bueno Parcial
ElevenLabs + D-ID ElevenLabs gratis ~6€/mes (D-ID) Bueno Excelente ✓ Sí (combo)
Edimakor HitPaw Marca de agua Desde 49 USD/año Bajo Bajo en B&N No
Filmora IA Hablante Marca de agua Desde 49,99€/año Bajo Bajo No

D-ID Creative Reality Studio es la herramienta mejor adaptada a los retratos antiguos. Fue diseñada para presentaciones empresariales con "avatares parlantes", pero su algoritmo maneja correctamente las fotografías en gelatina de plata. Los labios no se deforman anormalmente. Las arrugas y los fuertes contrastes de las fotos de 1935-1955 no perturban la generación.

HeyGen da buenos resultados en fotos recientes con buena resolución. En fotos en blanco y negro anteriores a 1960, los artefactos son visibles: la zona de la boca se pixela ligeramente en ciertas sílabas. Utilizable, pero no óptimo.

Edimakor y Filmora son programas de edición de vídeo que añadieron una función de "foto hablante" en 2024-2025. En fotos recientes en alta definición, los resultados son correctos. En fotos antiguas en blanco y negro, los labios generados son artificiales y salen del rostro de manera visible. Estas herramientas no están diseñadas para archivos familiares.

¿Qué tipo de foto obtiene los mejores resultados?

La sincronización labial funciona en un espectro muy estricto. Lo que funciona bien:

  • Retrato de frente o ligero tres cuartos (menos de 30° de lado)
  • Resolución mínima de 600 × 800 píxeles tras escaneado o restauración
  • Rostro ocupando al menos el 40% de la superficie de la imagen
  • Iluminación homogénea sin sombras duras cruzando la boca

Lo que falla sistemáticamente:

  • Perfil puro (menos del 50% del rostro visible)
  • Foto de grupo donde cada rostro mide menos de 2 cm en el original
  • Foto muy deteriorada con rayaduras o manchas en la zona de la boca
  • Desenfoque en el rostro, incluso leve (la generación acentúa el desenfoque)

De mi corpus de 12 retratos, 7 dieron resultados utilizables. 5 estaban demasiado de perfil, demasiado pequeños o demasiado deteriorados. Es un ratio correcto pero inferior al que se obtiene con la animación simple (movimiento natural sin audio), que tolera fotos de menor calidad.

La regla que seguí: si el rostro no es suficientemente nítido y frontal para la foto hablante, animo sin audio con Incarn — los resultados en retratos antiguos son mejores, a 1,99€ por foto.

Hacer hablar una foto gratis: lo que existe en 2026

La pregunta que todos hacen primero. La respuesta honesta: gratis con límites reales.

D-ID ofrece 5 créditos de prueba al registrarse, sin tarjeta bancaria. Cada crédito corresponde a un vídeo de 15 segundos máximo. Es suficiente para probar seriamente en 5 fotos diferentes.

HeyGen ofrece 1 minuto de generación gratuita. Más que suficiente para una prueba, pero el cupo se agota rápido si quieres comparar varias fotos.

ElevenLabs (para la voz) ofrece un plan gratuito con 10.000 caracteres de síntesis de voz al mes, suficiente para generar frases cortas. Combinado con los 5 créditos gratuitos de D-ID, puedes crear hasta 5 fotos hablantes sin gastar un euro.

Lo que lo gratuito no hace: herramientas como Edimakor o Filmora en versión de prueba añaden una marca de agua visible en todo el vídeo. Inutilizable para compartir en familia o en redes sociales.

Ninguna herramienta gratuita da buenos resultados en fotos en blanco y negro de los años 1930-1960. Requieren más potencia de cálculo y los modelos gratuitos están limitados. Si es tu caso, D-ID en versión de pago (5,90€/mes) sigue siendo la única opción seria.

Tutorial: hacer hablar una foto familiar antigua en 6 pasos

Aquí está el método que adopté tras mis pruebas — la combinación ElevenLabs + D-ID.

Paso 1 — Preparar la foto. La foto debe estar escaneada a alta resolución (mínimo 1200 DPI para un escáner plano, o el equivalente con smartphone con luz natural). Restaura las rayaduras y manchas con Remini o Adobe Photoshop Express antes de continuar. Una foto deteriorada producirá un vídeo deteriorado.

Paso 2 — Crear la voz en ElevenLabs. Ve a elevenlabs.io. Selecciona una voz de la biblioteca (elige por edad, género, idioma). Escribe el texto que quieres que diga la persona. Exporta en MP3 o WAV.

Paso 3 — Importar en D-ID. En studio.d-id.com, crea un "presentador" e importa tu foto como avatar. Importa el archivo de audio de ElevenLabs. Lanza la generación.

Paso 4 — Verificar la sincronización labial. El vídeo generado dura lo que dura el audio. Observa atentamente la zona de la boca. En las buenas fotos frontales, la sincronización es natural desde la primera generación. En fotos de perfil parcial, puede ser necesario ajustar el ángulo de recorte.

Paso 5 — Descargar en MP4. D-ID exporta directamente en MP4. La calidad es suficiente para WhatsApp, Instagram o para integrar en un diaporama de entierro o un álbum familiar digital.

Paso 6 — Conservar el original. Nunca sobrescribir la foto original escaneada. El vídeo generado es una creación derivada, no un sustituto.

La pregunta surge, y merece una respuesta clara.

En la mayoría de los países, los derechos de imagen de las personas fallecidas pertenecen a sus herederos durante un período determinado tras el fallecimiento. Para un uso estrictamente privado y familiar — compartir el vídeo con tus propios hijos, proyectarlo en una reunión familiar, usarlo en un homenaje memorial — el riesgo legal es prácticamente nulo.

Lo que está claramente prohibido: usar una foto hablante para hacer decir a una persona fallecida declaraciones comerciales, políticas, o cualquier contenido que probablemente habría rechazado en vida.

Para las fotos de personas vivas, se requiere el consentimiento explícito antes de cualquier uso. Una foto hablante no consentida de una persona viva constituye una violación de su derecho a la imagen, independientemente de la herramienta utilizada.

Para un homenaje familiar privado de un antepasado fallecido hace varias décadas: usa estas herramientas sin preocupación legal, con el único límite del buen gusto.

Cuando la animación sin palabras es suficiente (y por qué es diferente)

Hacer hablar una foto y animar una foto son dos cosas distintas.

La animación estándar — la que se obtiene con herramientas como Incarn o Runway — crea un movimiento natural del rostro: parpadeo de ojos, ligera rotación de cabeza, respiración simulada. No se requiere audio. La foto cobra vida sin pronunciar palabras.

La animación con sincronización labial añade una capa de complejidad: obliga al movimiento a coincidir con fonemas precisos, lo que impone requisitos estrictos sobre la calidad y el ángulo de la foto.

Resultado: en retratos muy antiguos o de mala calidad, la animación simple suele dar mejores resultados que la foto hablante, porque el modelo no está restringido a reproducir formas labiales precisas.

La regla práctica que adopté: si la foto es de frente, nítida y de buena resolución, intenta la foto hablante. Si la foto es de perfil, pequeña o deteriorada, la animación simple es más fiable. Incarn está optimizado para los retratos de familia, incluidas las fotos en blanco y negro de los años 1930-1970 — donde las herramientas generalistas fallan. Primera animación gratis al registrarse, 1,99€ por foto después.

Ambos enfoques se complementan. La foto hablante para el discurso y la emoción. La animación simple para la presencia y el recuerdo.

T

Thomas Moreau

AI & Technology Writer, Incarn

Thomas covers AI and machine learning applications for creative tools. Former research engineer with a focus on computer vision and video generation.

LinkedIn

¿Listo para probarlo usted mismo?

Anime su primera foto gratis, en unos instantes.

Pruebe Incarn gratis →

Para seguir leyendo