opción
Hogar
Noticias
Presentación de modificaciones de IA sutiles pero impactantes en el contenido de video auténtico

Presentación de modificaciones de IA sutiles pero impactantes en el contenido de video auténtico

12 de abril de 2025
362

En 2019, un video engañoso de Nancy Pelosi, entonces presidenta de la Cámara de Representantes de EE. UU., circuló ampliamente. El video, que fue editado para hacerla parecer intoxicada, fue un recordatorio claro de cuán fácilmente los medios manipulados pueden engañar al público. A pesar de su simplicidad, este incidente destacó el daño potencial de incluso ediciones audiovisuales básicas.

En ese momento, el panorama de los deepfakes estaba dominado en gran medida por tecnologías de reemplazo de rostros basadas en autoencoders, que existían desde finales de 2017. Estos sistemas iniciales tenían dificultades para realizar los cambios matizados vistos en el video de Pelosi, enfocándose en cambio en intercambios de rostros más evidentes.

El reciente marco 'Neural Emotion Director' cambia el estado de ánimo de un rostro famoso. Fuente: https://www.youtube.com/watch?v=Li6W8pRDMJQEl marco 'Neural Emotion Director' de 2022 cambia el estado de ánimo de un rostro famoso. Fuente: https://www.youtube.com/watch?v=Li6W8pRDMJQ

Avanzando hasta hoy, la industria del cine y la televisión está explorando cada vez más ediciones de posproducción impulsadas por IA. Esta tendencia ha generado tanto interés como críticas, ya que la IA permite un nivel de perfeccionismo que antes era inalcanzable. En respuesta, la comunidad de investigación ha desarrollado varios proyectos enfocados en 'ediciones locales' de capturas faciales, como Diffusion Video Autoencoders, Stitch it in Time, ChatFace, MagicFace y DISCO.

Edición de expresiones con el proyecto MagicFace de enero de 2025. Fuente: https://arxiv.org/pdf/2501.02260Edición de expresiones con el proyecto MagicFace de enero de 2025. Fuente: https://arxiv.org/pdf/2501.02260

Nuevos Rostros, Nuevas Arrugas

Sin embargo, la tecnología para crear estas ediciones sutiles está avanzando mucho más rápido que nuestra capacidad para detectarlas. La mayoría de los métodos de detección de deepfakes están obsoletos, enfocándose en técnicas y conjuntos de datos más antiguos. Esto fue así hasta un reciente avance de investigadores en India.

Detección de Ediciones Locales Sutiles en Deepfakes: Un video real es alterado para producir falsificaciones con cambios matizados como cejas levantadas, rasgos de género modificados y cambios en la expresión hacia el disgusto (ilustrado aquí con un solo fotograma). Fuente: https://arxiv.org/pdf/2503.22121Detección de Ediciones Locales Sutiles en Deepfakes: Un video real es alterado para producir falsificaciones con cambios matizados como cejas levantadas, rasgos de género modificados y cambios en la expresión hacia el disgusto (ilustrado aquí con un solo fotograma). Fuente: https://arxiv.org/pdf/2503.22121

Esta nueva investigación se centra en la detección de manipulaciones faciales sutiles y localizadas, un tipo de falsificación que a menudo se pasa por alto. En lugar de buscar inconsistencias amplias o discrepancias de identidad, el método se enfoca en detalles finos como cambios leves en la expresión o ediciones menores en características faciales específicas. Utiliza el Sistema de Codificación de Acción Facial (FACS), que descompone las expresiones faciales en 64 áreas mutables.

Algunas de las 64 partes de expresión constituyentes en FACS. Fuente: https://www.cs.cmu.edu/~face/facs.htmAlgunas de las 64 partes de expresión constituyentes en FACS. Fuente: https://www.cs.cmu.edu/~face/facs.htm

Los investigadores probaron su enfoque contra varios métodos de edición recientes y encontraron que superaba consistentemente las soluciones existentes, incluso con conjuntos de datos más antiguos y nuevos vectores de ataque.

‘Al usar características basadas en AU para guiar representaciones de video aprendidas a través de Autoencoders Enmascarados (MAE), nuestro método captura eficazmente cambios localizados cruciales para detectar ediciones faciales sutiles.

‘Este enfoque nos permite construir una representación latente unificada que codifica tanto ediciones localizadas como alteraciones más amplias en videos centrados en rostros, proporcionando una solución integral y adaptable para la detección de deepfakes.'

El artículo, titulado Detección de Manipulaciones Deepfake Localizadas Usando Representaciones de Video Guiadas por Unidades de Acción, fue escrito por investigadores del Instituto Indio de Tecnología en Madras.

Método

El método comienza detectando rostros en un video y muestreando fotogramas espaciados uniformemente centrados en estos rostros. Estos fotogramas luego se dividen en pequeños parches 3D, capturando detalles espaciales y temporales locales.

Esquema para el nuevo método. El video de entrada se procesa con detección de rostros para extraer fotogramas espaciados uniformemente y centrados en rostros, que luego se dividen en parches tubulares y se pasan a través de un codificador que fusiona representaciones latentes de dos tareas de pretexto preentrenadas. El vector resultante es luego usado por un clasificador para determinar si el video es real o falso.Esquema para el nuevo método. El video de entrada se procesa con detección de rostros para extraer fotogramas espaciados uniformemente y centrados en rostros, que luego se dividen en parches ‘tubulares’ y se pasan a través de un codificador que fusiona representaciones latentes de dos tareas de pretexto preentrenadas. El vector resultante es luego usado por un clasificador para determinar si el video es real o falso.

Cada parche contiene una pequeña ventana de píxeles de unos pocos fotogramas sucesivos, permitiendo al modelo aprender movimientos y cambios de expresión a corto plazo. Estos parches se incrustan y codifican posicionalmente antes de ser alimentados a un codificador diseñado para distinguir videos reales de falsos.

El desafío de detectar manipulaciones sutiles se aborda utilizando un codificador que combina dos tipos de representaciones aprendidas a través de un mecanismo de atención cruzada, con el objetivo de crear un espacio de características más sensible y generalizable.

Tareas de Pretexto

La primera representación proviene de un codificador entrenado con una tarea de autoencodificación enmascarada. Al ocultar la mayoría de los parches 3D del video, el codificador aprende a reconstruir las partes faltantes, capturando patrones espacio-temporales importantes como el movimiento facial.

El entrenamiento de tareas de pretexto implica enmascarar partes de la entrada de video y usar una configuración de codificador-decodificador para reconstruir ya sea los fotogramas originales o mapas de unidades de acción por fotograma, dependiendo de la tarea.El entrenamiento de tareas de pretexto implica enmascarar partes de la entrada de video y usar una configuración de codificador-decodificador para reconstruir ya sea los fotogramas originales o mapas de unidades de acción por fotograma, dependiendo de la tarea.

Sin embargo, esto por sí solo no es suficiente para detectar ediciones de grano fino. Los investigadores introdujeron un segundo codificador entrenado para detectar unidades de acción facial (AUs), animándolo a enfocarse en la actividad muscular localizada donde a menudo ocurren ediciones deepfake sutiles.

Ejemplos adicionales de Unidades de Acción Facial (FAUs, o AUs). Fuente: https://www.eiagroup.com/the-facial-action-coding-system/Ejemplos adicionales de Unidades de Acción Facial (FAUs, o AUs). Fuente: https://www.eiagroup.com/the-facial-action-coding-system/

Tras el preentrenamiento, las salidas de ambos codificadores se combinan usando atención cruzada, con las características basadas en AU guiando la atención sobre las características espacio-temporales. Esto resulta en una representación latente fusionada que captura tanto el contexto de movimiento más amplio como los detalles de expresión localizados, utilizada para la tarea de clasificación final.

Datos y Pruebas

Implementación

El sistema fue implementado usando el marco de detección de rostros basado en PyTorch FaceXZoo, extrayendo 16 fotogramas centrados en rostros de cada clip de video. Las tareas de pretexto fueron entrenadas en el conjunto de datos CelebV-HQ, que incluye 35,000 videos faciales de alta calidad.

Del artículo fuente, ejemplos del conjunto de datos CelebV-HQ usado en el nuevo proyecto. Fuente: https://arxiv.org/pdf/2207.12393Del artículo fuente, ejemplos del conjunto de datos CelebV-HQ usado en el nuevo proyecto. Fuente: https://arxiv.org/pdf/2207.12393

La mitad de los datos fue enmascarada para prevenir el sobreajuste. Para la tarea de reconstrucción de fotogramas enmascarados, el modelo fue entrenado para predecir regiones faltantes usando la pérdida L1. Para la segunda tarea, se entrenó para generar mapas para 16 unidades de acción facial, supervisado por la pérdida L1.

Tras el preentrenamiento, los codificadores fueron fusionados y ajustados para la detección de deepfakes usando el conjunto de datos FaceForensics++, que incluye videos reales y manipulados.

El conjunto de datos FaceForensics++ ha sido la piedra angular de la detección de deepfakes desde 2017, aunque ahora está considerablemente desactualizado con respecto a las últimas técnicas de síntesis facial. Fuente: https://www.youtube.com/watch?v=x2g48Q2I2ZQEl conjunto de datos FaceForensics++ ha sido la piedra angular de la detección de deepfakes desde 2017, aunque ahora está considerablemente desactualizado con respecto a las últimas técnicas de síntesis facial. Fuente: https://www.youtube.com/watch?v=x2g48Q2I2ZQ

Para abordar el desequilibrio de clases, los autores usaron la Pérdida Focal, enfatizando ejemplos más desafiantes durante el entrenamiento. Todo el entrenamiento se realizó en una sola GPU RTX 4090 con 24Gb de VRAM, usando puntos de control preentrenados de VideoMAE.

Pruebas

El método fue evaluado contra varias técnicas de detección de deepfakes, enfocándose en deepfakes editados localmente. Las pruebas incluyeron una gama de métodos de edición y conjuntos de datos de deepfakes más antiguos, usando métricas como Área Bajo la Curva (AUC), Precisión Promedio y Puntaje F1 Medio.

Del artículo: la comparación en deepfakes localizados recientes muestra que el método propuesto superó a todos los demás, con una ganancia de 15 a 20 por ciento en AUC y precisión promedio sobre el siguiente mejor enfoque.Del artículo: la comparación en deepfakes localizados recientes muestra que el método propuesto superó a todos los demás, con una ganancia de 15 a 20 por ciento en AUC y precisión promedio sobre el siguiente mejor enfoque.

Los autores proporcionaron comparaciones visuales de videos manipulados localmente, mostrando la sensibilidad superior de su método a ediciones sutiles.

Un video real fue alterado usando tres manipulaciones localizadas diferentes para producir falsificaciones que permanecían visualmente similares al original. Se muestran aquí fotogramas representativos junto con los puntajes promedio de detección de falsificaciones para cada método. Mientras que los detectores existentes tuvieron dificultades con estas ediciones sutiles, el modelo propuesto asignó consistentemente altas probabilidades de falsificación, indicando mayor sensibilidad a cambios localizados.Un video real fue alterado usando tres manipulaciones localizadas diferentes para producir falsificaciones que permanecían visualmente similares al original. Se muestran aquí fotogramas representativos junto con los puntajes promedio de detección de falsificaciones para cada método. Mientras que los detectores existentes tuvieron dificultades con estas ediciones sutiles, el modelo propuesto asignó consistentemente altas probabilidades de falsificación, indicando mayor sensibilidad a cambios localizados.

Los investigadores notaron que los métodos de detección de vanguardia existentes tuvieron dificultades con las últimas técnicas de generación de deepfakes, mientras que su método mostró una generalización robusta, logrando altos puntajes de AUC y precisión promedio.

El rendimiento en conjuntos de datos de deepfakes tradicionales muestra que el método propuesto permaneció competitivo con los enfoques líderes, indicando una fuerte generalización en una gama de tipos de manipulación.El rendimiento en conjuntos de datos de deepfakes tradicionales muestra que el método propuesto permaneció competitivo con los enfoques líderes, indicando una fuerte generalización en una gama de tipos de manipulación.

Los autores también probaron la confiabilidad del modelo bajo condiciones del mundo real, encontrando que era resistente a distorsiones de video comunes como ajustes de saturación, desenfoque gaussiano y pixelación.

Una ilustración de cómo cambia la precisión de detección bajo diferentes distorsiones de video. El nuevo método permaneció resistente en la mayoría de los casos, con solo una pequeña disminución en AUC. La caída más significativa ocurrió cuando se introdujo ruido gaussiano.Una ilustración de cómo cambia la precisión de detección bajo diferentes distorsiones de video. El nuevo método permaneció resistente en la mayoría de los casos, con solo una pequeña disminución en AUC. La caída más significativa ocurrió cuando se introdujo ruido gaussiano.

Conclusión

Mientras que el público a menudo piensa en los deepfakes como intercambios de identidad, la realidad de la manipulación de IA es más matizada y potencialmente más insidiosa. El tipo de edición local discutido en esta nueva investigación podría no captar la atención pública hasta que ocurra otro incidente de alto perfil. Sin embargo, como ha señalado el actor Nic Cage, el potencial de las ediciones de posproducción para alterar actuaciones es una preocupación de la que todos deberíamos estar conscientes. Somos naturalmente sensibles incluso a los cambios más leves en las expresiones faciales, y el contexto puede alterar drásticamente su impacto.

Publicado por primera vez el miércoles, 2 de abril de 2025

Artículo relacionado
OpenAI facilita la verificación de imágenes generadas por IA OpenAI facilita la verificación de imágenes generadas por IA A medida que los generadores de imágenes basados en IA se generalizan y se vuelven cada vez más sofisticados en Internet, distinguir las imágenes reales de las falsas nunca ha sido tan complicado. El
YouTube amplía la detección de deepfakes mediante IA a políticos, funcionarios públicos y periodistas YouTube amplía la detección de deepfakes mediante IA a políticos, funcionarios públicos y periodistas El martes, YouTube anunció que va a ampliar su tecnología de detección de deepfakes a un grupo selecto de funcionarios públicos, candidatos políticos y periodistas. La herramienta identifica las imáge
YouTube refuerza las medidas de protección contra los deepfakes generados por IA para políticos, funcionarios y periodistas YouTube refuerza las medidas de protección contra los deepfakes generados por IA para políticos, funcionarios y periodistas YouTube está ampliando el acceso a su tecnología de detección de imágenes generadas por IA, diseñada para identificar «deepfakes», a un programa piloto dirigido a funcionarios públicos, candidatos pol
Recomendaciones de temas especiales relacionados
escribiendo Los mejores generadores de esquemas basados en IA para artículos largos optimizados para SEO
Los mejores generadores de esquemas basados en IA para artículos largos optimizados para SEO

Los mejores generadores de esquemas con IA mejor valorados de 2026 para artículos largos optimizados para SEO, seleccionados minuciosamente por XIX.AI. Estas potentes herramientas ofrecen una ayuda revolucionaria a la hora de crear contenido de alta calidad rápidamente, lo que aumenta considerablemente la eficiencia a la hora de escribir. Consigue una comparación entre las versiones gratuitas y de pago, junto con pruebas en condiciones reales y clasificaciones detalladas, que te ayudarán a encontrar la opción imprescindible que mejor se adapte a tus necesidades. Explora ahora para descubrir las ventajas que te ofrece la IA.

8 herramientas
xix.ai
Educación y aprendizaje Herramientas de estudio basadas en IA para los deberes y la preparación de exámenes
Herramientas de estudio basadas en IA para los deberes y la preparación de exámenes

¡Las mejores herramientas de IA de 2026 para hacer los deberes y prepararse para los exámenes! XIX.AI ha elaborado una lista con las herramientas mejor valoradas, potentes y revolucionarias que ayudan a los estudiantes a aumentar su productividad, agilizar la realización de los deberes y sacar sobresaliente en los exámenes gracias a pruebas reales. Consigue una comparación entre versiones gratuitas y de pago, clasificaciones detalladas y opciones imprescindibles para sacar el máximo partido a la IA. ¡Explora ahora!

10 herramientas
xix.ai
composicion musical Herramientas de demostración vocal con IA para compositores, ganchos, melodías principales y sesiones de borrador multilingüe
Herramientas de demostración vocal con IA para compositores, ganchos, melodías principales y sesiones de borrador multilingüe

¡Las mejores herramientas de demostración vocal con IA de 2026 para compositores, creadores de ganchos y equipos de contenido multilingüe! XIX.AI ha recopilado una lista de herramientas poderosas y transformadoras, rigurosamente probadas en el mundo real. Encontrarás datos detallados de comparación entre versiones gratuitas y de pago, clasificaciones completas y opciones imprescindibles para ayudarte a aumentar tu eficiencia de escritura y desbloquear todo tu potencial creativo. ¡Explora ahora para descubrir la herramienta perfecta para todas tus necesidades de contenido!

9 herramientas
xix.ai
Negocio Las mejores herramientas de investigación competitiva basadas en IA para pequeñas empresas
Las mejores herramientas de investigación competitiva basadas en IA para pequeñas empresas

¡Las mejores herramientas de investigación competitiva basadas en IA mejor valoradas de 2026 para pequeñas empresas! XIX.AI ha seleccionado una colección revolucionaria y muy potente, que se actualiza semanalmente con rigurosas pruebas en el mundo real y clasificaciones detalladas. Encontrarás una comparación exhaustiva entre las opciones gratuitas y las de pago que te ayudará a identificar las herramientas imprescindibles que impulsarán tu productividad y te proporcionarán una ventaja competitiva. ¡Explora ahora mismo y descubre la herramienta perfecta para ti!

9 herramientas
xix.ai
Edición de imágenes Herramientas de retoque con IA de Photoshop para ropa de comercio electrónico, limpieza de piel y consistencia del color
Herramientas de retoque con IA de Photoshop para ropa de comercio electrónico, limpieza de piel y consistencia del color

¡Las mejores herramientas de retoque con IA de Photoshop de 2026 para ropa de comercio electrónico, limpieza de piel y consistencia de color! Esta lista curada de alta calificación presenta soluciones poderosas que cambian las reglas del juego, que ayudan a aumentar la eficiencia de redacción, optimizar la creación de contenido y lograr resultados visuales perfectos sin esfuerzo. Cada herramienta ha pasado por pruebas en el mundo real a través de clasificaciones actualizadas semanalmente, con detalles completos de comparación entre versiones gratuitas y de pago. Respaldado por XIX.AI, es la guía imprescindible para cualquier persona que aspire a desbloquear su ventaja con IA. ¡Explora ahora!

10 herramientas
xix.ai
Inmediato Las mejores bibliotecas de indicaciones de IA para los flujos de trabajo de ChatGPT
Las mejores bibliotecas de indicaciones de IA para los flujos de trabajo de ChatGPT

Las mejores bibliotecas de prompts de IA de 2026, con las más valoradas, para optimizar todo tipo de flujos de trabajo de ChatGPT. XIX.AI ha seleccionado una colección potente y revolucionaria que se somete a rigurosas pruebas en condiciones reales para garantizar el máximo rendimiento. Encontrarás comparativas detalladas entre opciones gratuitas y de pago, así como clasificaciones de expertos, que te ayudarán a elegir las herramientas imprescindibles para potenciar tu productividad y sacar el máximo partido a la IA. ¡Explora ahora!

11 herramientas
xix.ai
comentario (47)
0/500
CarlPerez
CarlPerez 22 de julio de 2026 20:00:14 GMT+02:00

Honestly, the Pelosi incident still gives me chills. It's not just deepfakes; even simple speed changes can distort reality. We need better tools to detect these manipulations. 🧐

RalphMitchell
RalphMitchell 23 de mayo de 2026 14:00:21 GMT+02:00

この記事を読んで、AIによる映像改ざんがこんなに簡単にできるなんて怖いですね。ペロシ議長の例は氷山の一角で、もっと巧妙な偽動画がSNSで拡散される可能性があります。一般ユーザーとして、どうやって本物と偽物を見分ければいいのか悩みます。技術の進歩は素晴らしいけど、悪用されないための規制も必要じゃないかな🤔

JustinHarris
JustinHarris 18 de mayo de 2026 10:00:14 GMT+02:00

Honestly, this Pelosi video case is a perfect example of how 'low-tech' AI manipulation can be the most dangerous. It doesn't need deepfakes; just slowing down footage creates a narrative. Makes you wonder what subtle edits we're already consuming daily without a second thought. The real battle for truth is in these tiny, almost invisible tweaks. 😳

DavidRodriguez
DavidRodriguez 23 de abril de 2026 16:00:49 GMT+02:00

Dieser Artikel erinnert mich daran, wie wichtig Medienkompetenz heute ist. Die Pelosi-Video-Manipulation war ja noch relativ plump, aber mit aktueller KI wird das bestimmt viel subtiler. Macht mir schon etwas Sorgen, vor Wahlen oder so. Wie soll man da noch zwischen echt und fake unterscheiden? 😕

WilliamCarter
WilliamCarter 19 de agosto de 2025 23:01:13 GMT+02:00

That Pelosi video from 2019 is wild! It’s scary how a few tweaks can make someone look totally drunk. AI’s power to mess with videos is both cool and creepy—makes you wonder what’s real anymore. 😬

JuanMartínez
JuanMartínez 19 de agosto de 2025 19:01:10 GMT+02:00

This Pelosi video incident is wild! 🤯 It’s scary how a few tweaks can make someone look totally out of it. Makes me wonder how much of what we see online is real anymore. AI’s cool, but this kind of stuff could mess with trust big time.

OR