Метаданные и геотеги в файлах: что раскрывают снимки и документы
EXIF, IPTC, XMP и метаданные Office/PDF выдают геолокацию, авторство и оборудование - разбор того, что реально извлекают OSINT-аналитики и что делают со снимками соцсети и мессенджеры в 2025–2026 году.
Файл, который вы отправляете как обычную фотографию или PDF, почти всегда несёт с собой второй, невидимый слой данных. Он не про то, что изображено на снимке, а про то, кто, чем, где и когда его создал. Для OSINT-исследователя это готовый источник зацепок. Для того, кто публикует файл, - источник риска, о котором чаще всего вспоминают постфактум.
Что на самом деле есть в EXIF
EXIF (Exchangeable Image File Format) - стандарт, по которому камеры и смартфоны записывают служебные данные прямо в файл снимка. Структура делится на несколько блоков: IFD0 хранит общие параметры изображения - размеры, ориентацию, производителя и модель устройства, дату и время; ExifIFD - параметры съёмки: выдержку, диафрагму, ISO, фокусное расстояние, вспышку; отдельный блок GPS IFD отвечает за геоданные - широту, долготу, высоту над уровнем моря, а иногда и направление движения. Отдельно от основного изображения в файле может храниться встроенная миниатюра - по сути ещё одна маленькая копия кадра.
Именно эта миниатюра стала источником одного из самых наглядных провалов приватности в истории цифровой фотографии. В 2003 году в сети разошлись плотно обрезанные фотографии лица телеведущей Кэт Шварц - но некоторые графические редакторы того времени при кадрировании обновляли только основное изображение, оставляя нетронутой встроенную миниатюру. В миниатюре сохранился исходный, гораздо более откровенный кадр. История с тех пор регулярно всплывает в материалах про метаданные как иллюстрация того, что обрезка, размытие лица или замазывание номерного знака в редакторе не гарантированно затрагивают все копии изображения внутри файла - старая миниатюра может пережить любое редактирование поверх неё.
Кроме EXIF существуют ещё два слоя, которые часто путают друг с другом. IPTC - более старый стандарт, изначально созданный для новостных агентств, описывает контент и права: подпись, ключевые слова, имя автора, условия использования. XMP, разработанный Adobe и ставший стандартом ISO, - более гибкий контейнер, куда можно записать практически любые структурированные данные, включая дублирующие GPS-координаты и IPTC-поля. В ноябре 2025 года вышла версия стандарта IPTC Photo Metadata 2025.1, добавившая поля специально под контент, созданный или изменённый нейросетями: кто и какой моделью сгенерировал изображение, какой был использован промпт. Это прямой ответ индустрии на рост доли ИИ-контента в публичном обороте - метаданные теперь фиксируют и физическую камеру, и происхождение синтетики.
Как OSINT-исследователи извлекают и используют метаданные
Методология простая по описанию и требовательная на практике. Проверка метаданных - один из первых шагов при работе с изображением, до визуального анализа теней и архитектуры: если в файле сохранились GPS-координаты и точное время съёмки, остальная геолокационная работа может не понадобиться. Если метаданных нет или они стёрты, тогда в ход идут обратный поиск по картинке, сопоставление рельефа, растительности, вывесок и направления теней.
Базовый инструмент для извлечения - ExifTool, консольная утилита Фила Харви, читающая и редактирующая метаданные в сотнях форматов: JPEG, TIFF, PNG, PDF, RAW-форматы камер, видео, аудио и офисные документы Microsoft. Это фактический стандарт в цифровой криминалистике и OSINT. Для более быстрого визуального разбора аналитики используют онлайн-вьюеры и браузерные расширения, а также специализированные надстройки вроде exifLooter, которая берёт координаты, извлечённые ExifTool, и сразу выводит их на карту - инструмент вошёл в официальный набор Kali Linux.
Toolkit Bellingcat по расследованиям с открытыми источниками десятилетиями держит раздел о метаданных в числе базовых инструментов проверки изображений и видео - рядом с сервисами для анализа возможных признаков монтажа и подделки. В криминалистике корпоративного уровня те же задачи решают коммерческие платформы вроде Belkasoft X и продуктов Elcomsoft, которые при разборе переписок в WhatsApp и Telegram отдельно извлекают геометаданные и метаданные файловой системы из вложенных фото и видео.
Самый известный публичный пример того, как забытая проверка метаданных стоила человеку свободы, - история Джона Макафи. В декабре 2012 года издание Vice опубликовало материал о том, как основатель антивирусной компании скрывается от властей, с фотографией Макафи и главного редактора издания, сделанной на iPhone 4S. Файл не почистили перед публикацией.
«В течение нескольких минут после публикации активисты по защите данных и хакеры скачали изображение и просмотрели его свойства» - The Next Web, о том, как координаты в EXIF-данных снимка указали на бассейн отеля Nana Juana Marina в гватемальском Рио-Дульсе.
Макафи сначала заявил, что подделал данные телефона, чтобы запутать полицию, но на следующий день признал: координаты были настоящими. Его задержали вскоре после публикации. Случай хрестоматиен именно потому, что показывает зазор между тем, что редакция считает опубликованным «текстом» - фото как иллюстрацией, - и тем, что на самом деле разошлось вместе с файлом.
Похожая логика применима и к документам. В феврале 2003 года британское правительство опубликовало на своём сайте досье об оружии массового поражения в Ираке в формате Word. В файле сохранился журнал правок - список последних редакторов документа. Кембриджский исследователь Глен Рангвала практически сразу заметил, что текст почти дословно совпадает с чужой аспирантской работой, а метаданные документа подтвердили список причастных к его составлению чиновников. Word-версию оперативно сняли с сайта и заменили на PDF - но к тому моменту скриншоты метаданных уже разошлись, а пресс-секретарю правительства пришлось объясняться перед парламентским комитетом.
Что реально делают платформы с метаданными в 2025–2026 году
Здесь стоит разделить две вещи: что происходит с файлом, который скачивает другой пользователь, и что происходит с данными на серверах платформы.
Крупные соцсети - Facebook, Instagram, X (бывший Twitter) - прогоняют загружаемые фотографии через собственный конвейер сжатия и переформатирования. На выходе публичная версия файла, доступная для скачивания другим пользователям, как правило, не содержит GPS-координат, модели камеры и части технических параметров съёмки: они физически не переживают пересжатие и смену формата на сервере.
Здесь легко упустить важный нюанс из формулировки «соцсети стирают метаданные»: они стирают их из версии для чужих глаз, а не из того, что видят сами. Итоговый пользователь, скачавший чужое фото из ленты, с высокой вероятностью не увидит в нём геотегов. Но это не значит, что платформа их не прочитала на этапе загрузки и не сохранила во внутренней аналитике - сама компания эти данные, как правило, не раскрывает подробно, и проверить их использование извне невозможно.
С мессенджерами ситуация зависит от способа отправки, а не от площадки в целом. У Telegram это задокументировано в открытом баг-трекере разработчиков: при отправке снимка через обычный выбор из галереи («как фото») сервис сжимает изображение и обрезает EXIF, включая GPS; при отправке того же снимка через опцию «как файл» метаданные передаются без изменений - это фиксирует тикет bugs.telegram.org/c/19150, изначально описывавший обратную проблему (потерю координат) и по факту зафиксировавший саму разницу в поведении двух режимов. У WhatsApp похожая развилка: обычная отправка фото сжимает файл и убирает часть служебных данных, тогда как отправка «документом» передаёт оригинальный файл со всеми метаданными. Электронная почта, прямая передача по кабелю или через облачное хранилище, AirDrop - во всех этих каналах метаданные обычно не трогают вообще, потому что там нет промежуточного конвейера обработки изображений.
Отдельная история 2025–2026 года - не удаление метаданных, а их целенаправленное добавление. Консорциум C2PA (Coalition for Content Provenance and Authenticity), в который входят Adobe, Microsoft, Google, Meta, OpenAI, BBC, Sony и другие, продвигает стандарт Content Credentials - криптографически подписанный манифест, который путешествует вместе с файлом и фиксирует, кем, чем и когда создан кадр, какие правки внесены. В сентябре 2025 года Google представила Pixel 10 - первый смартфон линейки, где Content Credentials встраиваются по умолчанию в каждый снимок камеры на уровне Assurance Level 2, максимального в текущей программе сертификации C2PA.
«Линейка Pixel 10 первой встраивает Content Credentials в каждую фотографию, снятую камерой Pixel» - из официального блога Google о запуске функции.
Сама Google подчёркивает: в основе лежит анонимная аппаратная аттестация, сертификат подтверждает, что снимок сделан подлинным приложением камеры на защищённом устройстве, но не привязывает файл к личности владельца, а для каждого изображения используется отдельный сертификат, не связанный с другими. iPhone на момент выхода этой статьи C2PA по умолчанию не поддерживает, у Samsung Galaxy S25 метки Content Credentials ставятся только на кадры, созданные или изменённые генеративным ИИ. Для OSINT-проверки это значит, что в ближайшие годы придётся учитывать два независимых слоя: классический EXIF, который платформы обрезают, и криптографическую подпись происхождения, которая всё активнее встраивается заново.
Документы Word и PDF - отдельная проблема
С офисными файлами риск обычно недооценивают сильнее, чем с фотографиями, потому что визуально документ не содержит ничего похожего на геометку. Word и другие форматы Office (docx, xlsx, pptx) хранят в служебных XML-частях файла имя автора и последнего редактора, название организации из лицензии, суммарное время редактирования, список правок при включённом отслеживании изменений, комментарии и скрытый текст. При конвертации Word-файла в PDF эти данные не исчезают автоматически - многие конвертеры переносят их в новый файл как есть, и после конвертации стоит отдельно проверять свойства получившегося PDF, а не считать смену формата автоматической очисткой.
Microsoft Word и другие приложения пакета Office со встроенным инструментом проверки документа умеют находить и удалять комментарии, записи отслеживаемых изменений, скрытый текст и личные данные из свойств файла одним прогоном - но по умолчанию перед запуском такой проверки инструмент автоматически принимает все внесённые правки, поэтому черновые формулировки, которые ещё числятся как «предложенные изменения», стоит проверить вручную до очистки, а не после.
Масштаб проблемы на практике оценили в академическом исследовании Supriya Adhatarao и Cédric Lauradoux (Университет Гренобль-Альпы и Inria), собравших корпус из 39 664 PDF-файлов, опубликованных 75 силовыми и разведывательными ведомствами 47 стран.
Из этого массива 13 166 файлов, то есть 33%, содержали в полях /Author, /Creator или связанных метаданных информацию, раскрывающую личность человека, создавшего документ; 76% файлов раскрывали, каким программным обеспечением был собран PDF, а как минимум 42% - операционную систему автора. Лишь 7 из 75 ведомств применяли какую-либо санитизацию файлов перед публикацией, и даже среди них 65% «очищенных» документов при повторной проверке всё ещё содержали скрытые данные - Adhatarao, Lauradoux, «Exploitation and Sanitization of Hidden Data in PDF Files».
Вывод авторов прямой: слабая санитизация обычно означает удаление данных «с поверхности» - то, что видно в диалоге свойств файла, - без затрагивания дублирующих полей в XMP-контейнере или истории изменений, которая может остаться внутри структуры PDF даже после того, как видимые поля Author и Title обнулены.
Чек-лист перед публикацией файла
- Определите канал публикации заранее. Если файл пойдёт в мессенджер, выбирайте режим «фото/изображение», а не «файл/документ» - второй вариант в Telegram и WhatsApp передаёт оригинал без изменений.
- Перед загрузкой на любую площадку прогоните файл через инструмент просмотра метаданных самостоятельно, а не полагаясь на то, что платформа обработает его вместо вас: соцсети стирают геометки только из версии, доступной чужим глазам, а не из данных, которые они получают на входе.
- Для изображений используйте ExifTool: команда exiftool -all= имя_файла удаляет все метаданные разом; для пакетной обработки и файловых менеджеров на Linux подойдёт mat2 (Metadata Anonymisation Toolkit 2), который поддерживает изображения, PDF, аудио и офисные документы через единый интерфейс.
- Отдельно проверьте встроенную миниатюру в JPEG после любого кадрирования, размытия лица или закрашивания номерного знака - редактор мог обновить только основное изображение. ExifTool умеет извлекать и просматривать эту миниатюру отдельно от основного кадра.
- Для Word, Excel и PowerPoint запустите встроенную проверку документа (Файл → Сведения → Проверка документа) - но до этого вручную просмотрите все отслеживаемые изменения и комментарии, потому что инструмент по умолчанию примет все правки без вашего подтверждения.
- Если Word-файл конвертируется в PDF, проверьте свойства получившегося PDF отдельно - конвертация не гарантирует автоматической очистки метаданных, унаследованных от исходника.
- Для PDF учитывайте, что метаданные могут дублироваться в двух местах - классическом Info Dictionary и XMP-контейнере: удаление одного без другого оставляет данные внутри файла.
- Если публикуете документ от имени организации, замените реальное имя автора и «Company» из свойств учётной записи Office на обезличенное значение до начала работы над документом - это надёжнее, чем чистить его один раз перед релизом.
- Для чувствительных публикаций (расследования, материалы с анонимными источниками) сохраняйте архивную копию с полными метаданными отдельно и офлайн, а в публичный оборот выпускайте только очищенную версию.
Что вы думаете о материале?
Поделиться статьей
Источники 📄
- Bellingcat Online Investigation Toolkit - раздел Metadata
- Electronic Frontier Foundation, Surveillance Self-Defense - Why Metadata Matters
- IPTC - Photo Metadata Standard 2025.1
- Adhatarao S., Lauradoux C. - Exploitation and Sanitization of Hidden Data in PDF Files (arXiv:2103.02707)
- SecurityWeek - Research: Security Agencies Expose Information via Improperly Sanitized PDFs
- The Next Web - Vice leaves metadata in photo of John McAfee, pinpointing him to a location in Guatemala
- Scientific American - McAfee's Rookie Mistake Gives Away His Location
- KCUR / NPR - Betrayed By Metadata: John McAfee Admits He's Really In Guatemala
- Telegram Bug Tracker - GPS coordinates (EXIF) erased when images sent as file, тикет 19150
- Google - How Pixel and Android are bringing a new level of trust to your images with C2PA Content Credentials
- Microsoft Support - Remove hidden data and personal information by inspecting documents, presentations, or workbooks
- GitHub - mat2, Metadata Anonymisation Toolkit 2