Обнаружение дипфейков: методы OSINT-проверки видео и фото в 2025–2026

Как фактчекеры и OSINT-исследователи проверяют видео и фото на признаки синтеза в 2025–2026 году: визуальные и звуковые артефакты, пределы C2PA, реальные инструменты и их слабые места.

Редакция Infohunt 11 мин чтения

Обложка статьи «Обнаружение дипфейков: методы OSINT-проверки видео и фото в 2025–2026»

Дипфейк в почтовом ящике фактчекера сегодня выглядит не как ролик с приклеенным чужим лицом, а как обычное видео с созвона, голосовое сообщение от «начальника» или архивное фото политика, которого никогда не существовало. Разница между подделкой и оригиналом на глаз почти стёрлась. Работающая методика проверки в 2025–2026 году строится не на одном признаке и не на одном инструменте, а на слоях: визуальная и звуковая экспертиза, анализ провенанса файла и перепроверка источника независимо от того, что показал любой детектор.

Масштаб проблемы

По данным, которые приводит правительство Великобритании и на которые ссылаются отраслевые отчёты, число дипфейков в обороте выросло с примерно 500 тысяч в 2023 году до порядка 8 миллионов в 2025-м - рост более чем в 15 раз за два года. В отчёте Sumsub Identity Fraud Report 2025–2026 дипфейки указаны как часть 11% схем мошенничества «первого лица», а в Великобритании число попыток атак с дипфейками за 2025 год выросло на 94%.

Схема с голосовым клоном директора и переводом денег бухгалтерией - уже не гипотетический случай, а рутина: в Гонконге в 2024 году сотрудник финансового отдела компании перевёл 25 млн долларов после видеоконференции, где «коллеги» оказались дипфейками с подменой лица в реальном времени. В России сообщалось о переводе 47 млн рублей бухгалтерией после звонка с клонированным голосом директора, находившегося в этот момент за границей. По данным «МегаФона» на апрель 2026 года, звонки с использованием дипфейков составляют уже около 10% всего мошеннического трафика в стране.

Подделок стало больше, и заодно они стали убедительнее: модели на диффузии дают меньше типичных артефактов GAN-эпохи, а детекторы, обученные на старых датасетах, теряют точность именно там, где нужны больше всего.

Первичная проверка без инструментов

Прежде чем открывать любой детектор, отработайте базовую верификацию источника: сохраните исходный файл, ссылку на публикацию, дату и подпись. Это касается дипфейков так же, как и обычного фотомонтажа - подделку часто выдаёт не пиксель, а контекст: кто выложил, когда, с какой подписью, есть ли более ранние публикации того же кадра.

Дальше - визуальный осмотр. Набор признаков, который остаётся рабочим на 2025–2026 год:

  • Моргание. Либо пропадает на длинных отрезках речи, либо идёт с неестественно ровным метрономом; блики в зрачках отсутствуют, отличаются между глазами или задваиваются.
  • Свет и тени. Тени от лица и от фона падают в разные стороны при одном источнике освещения; при повороте головы возможны резкие провалы или вспышки яркости на долю секунды; блики на очках не совпадают с позой и направлением света.
  • Швы по контуру лица. Размытие, мерцание пикселей или смена резкости у линии волос, висков, ушей и воротника - типичный след замены лица.
  • Текстура кожи. Лицо выглядит подозрительно гладким и «восковым» на фоне зернистых волос, одежды и фона - след локальной, а не общей обработки кадра.
  • Мимика. Улыбка «приклеена», нет естественных морщинок у глаз при эмоции, выражение лица переключается без промежуточных фаз.
  • Фон и руки. Задний план неестественно статичен; руки «плывут» при резких движениях или частично проходят сквозь предметы.
  • Ракурс. При повороте головы примерно на 90 градусов изображение может исказиться или «развалиться» - многие модели генерации всё ещё слабы на крайних углах.
  • Рассинхронизация губ и звука. Задержка от 100 миллисекунд между фонемой и движением губ; губы не смыкаются на звуках «м», «п», «б», где смыкание обязательно.

Ни один из этих признаков не доказателен сам по себе - сжатие видео в мессенджере или соцсети способно сымитировать часть артефактов на подлинном ролике. Вывод делается по совокупности, а не по одному кадру.

Аудио отдельно от видео

Голосовые дипфейки часто выдают не слова, а ритмика речи: синтетический голос держит подозрительно ровный темп, одинаковую длину пауз и слишком правильную интонационную структуру фразы - там, где живая речь спотыкается, ускоряется, сбивается. У клонированных голосов на спектрограмме видны повторяющиеся гармоники, нехарактерный спад высоких частот и следы нейронного вокодера. Отдельный сигнал - фоновый шум и реверберация: если акустика помещения резко меняется в середине фразы, это след склейки или вставки синтетического фрагмента в подлинную запись.

По данным исследования, представленного на NeurIPS 2024, методы анализа рассинхронизации аудио и видео показывали среднюю точность выше 95% на тестовых датасетах, но точность падала до около 90% на реальных видеозвонках - разрыв между лабораторными условиями и практикой типичен для всей области.

Провенанс: что может и чего не может C2PA

Content Credentials по стандарту C2PA (Coalition for Content Provenance and Authenticity) - это криптографически подписанные метаданные, прикрепляемые к файлу в момент создания: кто снял или сгенерировал, какими инструментами, какие правки внесены. Стандарт уже поддерживают камеры Nikon, Sony и Leica, с февраля 2025 года - смартфоны Samsung Galaxy S25, а из софта - Adobe Creative Cloud, генеративные модели OpenAI и Google.

Ключевое ограничение стандарта описано прямо в его логике: C2PA фиксирует заявление о происхождении контента, а не факт правдивости этого заявления. Технически исправный манифест может быть прикреплён к постановочному кадру, снятому подлинной камерой с C2PA - стандарт этого не отследит. Подделать сам манифест тоже можно: получить сертификат и подписать им любой контент технически возможно, если верификатор не сверяет цепочку доверия. А главное практическое ограничение - метаданные не переживают путь до вирусного охвата: скриншот, репост в соцсети, конвертация формата стирают C2PA-манифест почти всегда до того, как контент увидит массовая аудитория.

Инструменты, которые реально работают в 2025–2026 году

Из экспериментальных разработок - Google Backstory, инструмент от Google DeepMind, доступный пока только через программу Trusted Testers, куда допущены тысячи журналистов, OSINT-специалистов и исследователей медиаграмотности, включая команду фактчекеров India Today. Backstory в одном окне сканирует изображение на водяные знаки SynthID, проверяет Content Credentials, ищет более ранние публикации того же кадра в индексируемой части сети и собирает отчёт с источниками. По оценке исследователя цифровой грамотности Майка Колфилда, инструмент сокращает начальную проверку изображения с примерно 50 минут до 3. Ограничения понятны сразу: Backstory работает только с фото, а не с видео, не видит контент в TikTok и в закрытых мессенджерах, и требует ручной проверки перед публикацией в любом случае.

Из давно работающих инструментов - расширение InVID-WeVerify, которое AFP Medialab развивает с 2017 года на грантах Евросоюза, сейчас в составе консорциума vera.ai. По состоянию на конец июля 2026 года актуальна версия 0.93: расширение разбивает видео на ключевые кадры, извлекает метаданные, ищет совпадения через несколько поисковиков по картинке одновременно, обращается к базе известных фейков и включает бета-модули для детекции синтетических изображений и клонированных голосов.

Из специализированных коммерческих детекторов в верификационных редакциях и OSINT-практике фигурируют Reality Defender (детекция видео и голоса в реальном времени, ориентирован на корпоративный сегмент), Hive AI Detection (проверка фото, видео, аудио и текста), Sensity AI и Pindrop (голосовая биометрия и антифрод-детекция звонков), а также браузерный Deepware для быстрой проверки изображений и видео. Для метаданных и следов редактирования остаются рабочими связки ExifTool, FotoForensics и Forensically; для геопривязки и проверки теней - SunCalc и ShadeMap.

Почему автоматическая детекция подводит

Бенчмарк VendorBench-100, сравнивший сто коммерческих продуктов детекции дипфейков на изображениях, показал системный разрыв: детектор, натренированный на подделках GAN-поколения, часто резко теряет точность на контенте, сгенерированном диффузионными моделями, и наоборот. Ни один из протестированных продуктов не показал устойчивой генерализации между поколениями генеративных моделей - это означает, что инструмент, который хорошо ловил дипфейки 2023 года, не гарантированно поймает дипфейк 2026-го.

Разрыв между лабораторией и реальностью системный. Один из детекторов, показавший 95% точности на датасете FaceForensics++, на более сложном Celeb-DF падал до 88%. Аудиодетекторы теряли до 43% точности на реальных образцах клонированных голосов по сравнению с тестовыми наборами. Сжатие видео в мессенджерах и соцсетях снижает точность детекции на 45–50% относительно лабораторных условий - кодеки вроде H.264 стирают именно те низкоуровневые пиксельные артефакты, на которые опираются многие модели. Отдельная проблема - демографическая погрешность: детекторы систематически хуже распознают подделки на людях с более тёмным тоном кожи.

Многоуровневая верификация вместо одного детектора

WITNESS, правозащитная организация, много лет обучающая фактчекеров и OSINT-исследователей работе с манипулированным медиа, настаивает на модели с несколькими независимыми слоями: цифровая целостность (согласованность пикселей), физическая целостность (нарушения физики - свет, тени, отражения) и семантическая целостность (соответствие контексту - от этой модели, изначально предложенной DARPA в программе MediFor, отталкивается сегодняшняя практика верификационных редакций). К этому добавляется отслеживание, кто создаёт, собирает и распространяет контент: анализ самого файла дополняет картирование сети, по которой он расходится.

«Дебанкинг сам по себе оказывается недостаточным - дипфейкам не нужна идеальность, достаточно посеять сомнение», - WITNESS Media Lab, материал по OSINT-цифровой криминалистике.

Даже безупречное опровержение не отменяет ущерб: подделку к этому моменту уже увидели миллионы. Отсюда практика Bellingcat и AFP - публиковать не готовый вердикт «фейк/не фейк», а полную цепочку рассуждений с промежуточными находками, чтобы читатель мог проверить логику, а не поверить на слово.

Чек-лист проверки видео или фото на признаки синтетики

  1. Зафиксируйте источник: сохраните файл, ссылку, дату публикации и точную подпись до того, как начнёте анализ.
  2. Найдите самую раннюю версию контента через обратный поиск по нескольким движкам и через архивы страниц (Wayback Machine, archive.ph).
  3. Проверьте метаданные файла через ExifTool или Forensically; отсутствие данных - не доказательство подделки, но повод для дополнительной проверки.
  4. Проверьте наличие и валидность C2PA Content Credentials, если файл претендует на происхождение от камеры или сервиса, поддерживающего стандарт; помните, что валидный манифест не подтверждает правдивость содержимого.
  5. Просмотрите видео покадрово: моргание, блики в глазах, границы лица у висков и ушей, тени и отражения на очках.
  6. Проверьте синхронизацию губ и звука отдельно от общего впечатления - задержка и несмыкание губ на согласных заметны именно при покадровом просмотре.
  7. Прогоните материал через два-три независимых детектора (например, InVID-WeVerify, Hive, Deepware) и зафиксируйте расхождения между их выводами - единого «оракула» не существует.
  8. Сверьте контекст: соответствует ли фон, одежда, техника, освещение заявленным месту и времени; используйте SunCalc или ShadeMap для проверки положения теней.
  9. Найдите независимое подтверждение из другого источника - свидетеля, спутникового снимка, другой публикации того же события.
  10. Публикуйте вывод вместе с ходом проверки и уровнем уверенности, а не голым «да/нет» - это позволяет читателю и коллегам перепроверить работу.

Что вы думаете о материале?

Источники 📄