Ссылки внутри PDF: почему их не видит ни один чекер и что они на самом деле дают
Google прямо говорит: ссылки в PDF обрабатываются так же, как в HTML, могут передавать PageRank, а nofollow внутри PDF поставить невозможно. При этом обычные чекеры ссылок их не видят — они ищут HTML-разметку, которой в этом формате нет. Разбираем 489 собственных публикаций в PDF, показываем три места, где ссылка теряется, и даём протокол проверки из шести шагов.
Ваш сайт упомянули в отраслевом отчёте, каталоге или методичке — и всё это лежит в PDF. Считается ли такая ссылка? Google отвечал на этот вопрос прямо, но ответ давно забыт, а инструменты его не учитывают: ни один обычный чекер ссылок не видит того, что лежит внутри PDF. Мы разобрали 489 своих публикаций в этом формате, нашли три места, где ссылка теряется, и показываем, как проверять такие ссылки руками.
Что Google говорит про ссылки в PDF
Есть официальный ответ, и он недвусмысленный:
«Как правило, ссылки в PDF-файлах обрабатываются так же, как ссылки в HTML: они могут передавать PageRank и другие индексные сигналы, и мы можем переходить по ним после того, как просканировали PDF-файл. Сейчас невозможно использовать nofollow-ссылки внутри PDF-документа».
Google Search Central Blog, «PDFs in Google search results», 1 сентября 2011Обратите внимание на вторую половину цитаты. Внутри PDF нельзя поставить nofollow — в формате просто нет места, куда его записать. Это значит, что любая ссылка в проиндексированном PDF по умолчанию открыта, и вопрос «а вдруг там nofollow» здесь не возникает вовсе.
Честная оговорка о возрасте: посту пятнадцать лет. Это до сих пор самое подробное официальное высказывание Google про PDF, и оно не отозвано, но с 2011 года формулировки могли измениться без объявления. Проверяемая часть — про отсутствие nofollow в формате — от времени не зависит: это свойство самого PDF, а не политики.
Из того же ответа стоит забрать ещё четыре факта: Google индексирует PDF с 2001 года; индексируется текстовое содержимое, если файл не защищён паролем; изображения внутри PDF не индексируются; убрать PDF из выдачи можно заголовком X-Robots-Tag: noindex, потому что мета-тега внутри файла не существует.
Почему этих ссылок не видит ни один чекер
Мы взяли два живых PDF и проверили их двумя способами: обычным разбором разметки, как это делает любой чекер ссылок, и разбором самого формата.
Результат предсказуем, если знать устройство формата, и совершенно неочевиден, если не знать. В PDF нет тега <a> — там другая структура документа. Поиск по <a href> честно возвращает ноль, и инструмент рапортует «ссылки нет», хотя ссылка есть и кликается.
Попутно подтвердилось и утверждение Google про nofollow: атрибутов rel в файлах не нашлось ни одного. Их там не может быть.
Три места, где ссылка теряется
Мы обнаружили это не в теории. У нас самих учёт PDF был сломан, и разбор показал три независимые причины — каждая по отдельности выглядит разумным инженерным решением.
Первая: парсер ищет HTML. Вторая: проверка «есть ли на странице наш текст» ищет подстроку в байтах файла, а текст в PDF лежит в сжатых потоках — снаружи его не видно. Третья: проверка отвечает «содержимое не HTML, значит это не страница» и отбрасывает файл целиком.
Результат: из 489 наших публикаций в PDF система уверенно считала подтверждёнными единицы. После того как разбор починили, подтвердились 465, мёртвых — ноль. Файлы всё это время были живы; слепой была проверка.
Как достать ссылки из PDF
Ссылки в PDF хранятся в аннотациях типа /URI. В файлах, сделанных печатью из браузера, они лежат почти открытым текстом, и достать их можно без специальных библиотек:
1. Скачать файл как есть, без разбора как HTML 2. Найти в байтах конструкции вида /URI (адрес) 3. Если не нашлось — распаковать сжатые потоки (между "stream" и "endstream") и повторить поиск 4. Отдельно проверить заголовок ответа: есть ли X-Robots-Tag с noindex
Четвёртый шаг важен не меньше первых трёх. У PDF нет мета-тега robots, поэтому единственный способ закрыть файл от индексации — заголовок ответа сервера. И единственный способ это проверить — посмотреть заголовки, а не содержимое.
Протокол проверки: шесть шагов
Убедиться, что файл отдаётся
Запросите адрес и посмотрите на код ответа и Content-Type. Нормальный ответ — 200 и application/pdf. Если пришёл HTML, вы скачали страницу-обёртку, а не сам файл, и дальше проверять бессмысленно.
application/pdf, размер файла похож на документ, а не на страницу ошибки.Проверить заголовок X-Robots-Tag
Это то самое место, где PDF закрывают от индексации. Мета-тега внутри файла не бывает, поэтому если в заголовках стоит noindex, файл в индекс не попадёт — и ссылка из него ничего не даст.
noindex там нет.Найти ссылку в аннотациях
Ищите конструкции /URI с адресом. Если ничего не нашлось, распакуйте сжатые потоки и повторите — часть файлов хранит аннотации внутри них.
Если и после этого пусто, а в документе ссылка визуально есть — скорее всего, это просто текст, набранный как адрес, без активной аннотации. Такой «ссылкой» она является только для человека.
Не искать rel — его там нет
Шаг, который экономит время: в PDF нет механизма nofollow. Если ссылка в аннотации есть и файл индексируется, вопрос «открыта ли она» закрыт по устройству формата.
Проверить, что текст вообще извлекается
Google индексирует текстовое содержимое PDF. Простейшая проверка — открыть файл и попробовать выделить и скопировать текст. Если он копируется, поисковик тоже его прочитает. Если это картинка страницы, содержимое держится на распознавании и рассчитывать на него не стоит.
Набраться терпения
Это самая неприятная часть. По нашим данным, PDF, опубликованные в ноябре–декабре 2025 года, впервые попали в ссылочный индекс стороннего сервиса в сентябре 2026 — примерно девять месяцев спустя.
Оговорка обязательна: это индекс одного коммерческого сервиса, а не Google, и по одному наблюдению закономерность не строится. Но порядок величины стоит держать в голове: ждать недели тут не приходится.
Что мы увидели в своих данных — и чего не увидели
После починки учёта мы сопоставили сроки. В сентябре 2026 года ссылочный индекс впервые прошёл по нашим PDF-донорам, опубликованным почти год назад, и в том же окне у шести клиентских доменов заметно вырос показатель авторитетности домена — с единиц до 17–21.
Здесь нужно остановиться и сказать то, чего обычно не говорят. Это совпадение по времени, а не доказательство. Показатель авторитетности — метрика стороннего сервиса, а не Google, и растёт она ровно тогда, когда сервис находит новые ссылки. Связь с позициями и трафиком из этого не следует.
Сильнее всего сомнение подкрепляет контрпример из той же выборки: у одного домена шестнадцать живых PDF со ссылками — и нулевое движение. Если бы механика была прямой, эффект был бы и там.
Что из этого можно взять честно: ссылки в PDF существуют, индексируются и учитываются ссылочными индексами. Насколько они влияют на ранжирование — из наших данных не следует, и утверждать это мы не будем.
Чего делать не стоит
Коротко
Google прямо говорит, что ссылки в PDF передают сигналы так же, как обычные, и что nofollow внутри PDF поставить нельзя. При этом обычные чекеры их не видят — они ищут HTML-разметку, которой в этом формате не существует. Мы нашли три независимых места, где такая ссылка теряется, и почти все свои 489 PDF-публикаций сначала считали неподтверждёнными.
Если делать одно действие: возьмите любой PDF, где на вас ссылаются, и поищите в его байтах /URI. На это уйдёт минута, а результат может расходиться с тем, что показывает ваш инструмент.
Сканирование покажет, что мешает вашим страницам попадать в индекс.
Частые вопросы
Передают ли ссылки из PDF вес?
По официальному ответу Google, ссылки в PDF обрабатываются так же, как ссылки в HTML: они могут передавать PageRank и другие индексные сигналы, и Google может переходить по ним после сканирования файла. Условие то же, что и для обычных страниц: файл должен быть доступен и не закрыт от индексации.
Можно ли поставить nofollow в PDF?
Нет. Google прямо указывает, что использовать nofollow-ссылки внутри PDF-документа невозможно, и это свойство самого формата: места для такого атрибута в нём не предусмотрено. В наших проверках атрибутов rel в PDF не нашлось ни одного.
Почему чекер ссылок не видит ссылку в PDF?
Потому что он ищет теги разметки, а в PDF их нет — там другая структура документа. Ссылки хранятся в аннотациях типа URI. Пока инструмент не разбирает сам формат, он будет возвращать ноль независимо от содержимого.
Как закрыть PDF от индексации?
Только заголовком ответа X-Robots-Tag со значением noindex. Мета-тега robots внутри PDF не существует, поэтому привычный способ для HTML-страниц здесь не работает.
Индексируются ли картинки внутри PDF?
По тому же ответу Google — нет, изображения внутри PDF не индексируются. Чтобы картинки участвовали в поиске, их нужно размещать на обычных страницах.
Через сколько появится эффект от ссылки в PDF?
Быстро не бывает. В нашем случае между публикацией файлов и их первым появлением в ссылочном индексе стороннего сервиса прошло около девяти месяцев. Это одно наблюдение, а не закономерность, но планировать стоит в месяцах.
Источники
Google Search Central Blog, «PDFs in Google search results», 1 сентября 2011, автор Gary Illyes: обработка ссылок в PDF, невозможность nofollow, индексация текста, изображения внутри PDF, закрытие через X-Robots-Tag.
Собственный замер PromoPilot, 24 сентября 2026: живая проверка PDF-публикаций — сравнение разбора разметки и разбора формата, коды ответа и заголовки.
Собственные данные PromoPilot: 489 публикаций в формате PDF за период с 31 октября 2025 по 18 сентября 2026; после исправления разбора подтверждены 465, неподтверждённых — ноль.