Что такое llms.txt
С 2024 года владельцам сайтов предлагают размещать в корне домена специальный файл llms.txt. Его задача — предоставить языковым моделям краткую карту сайта на естественном языке. Вместо того чтобы тратить ресурсы на разбор сложной верстки, ИИ-бот может прочитать этот файл и сразу понять, о чем проект, какие разделы на нем есть и где искать документацию.
Существует также практика создания файла llms-full.txt. В него сваливают весь текстовый контент ресурса, чтобы модель могла получить всю информацию за один запрос. Однако формат llms-full.txt никем официально не описан, и его реализация может отличаться у разных разработчиков.
Статистика запросов от ИИ-ботов
Несмотря на популярность идеи, реальный спрос на такой файл пока минимален. Анализ трафика показал, что из 515 миллионов событий, совершенных ИИ-ботами за 90 дней, файл llms.txt был запрошен всего 408 раз. Это составляет менее одной десятитысячной процента от общего объема запросов.
Популярные боты, такие как GPTBot, ClaudeBot и PerplexityBot, активно обходят сайты и читают HTML-код, соблюдая правила robots.txt, но они не запрашивают отдельный файл-карту целенаправленно. В Яндексе поддержка этого формата для Алисы AI или нейропоиска не заявлялась: нейросеть формирует ответ, используя данные из органической поисковой выдачи, а не через специальный файл в корне сайта.
Сложности соблюдения спецификации
Спецификация llms.txt кажется простой, но на практике ее часто нарушают. Основные правила требуют, чтобы заголовок H1 был первой значимой строкой и встречался в файле только один раз, а описание оформлялось в виде цитаты сразу под заголовком. Внутри тематических секций должны быть только списки со ссылками.
Частые ошибки включают наличие нескольких заголовков H1, использование ссылок на протоколе http вместо https, размещение обычного текста посреди списков или наличие описания заголовка в неверном месте. Также важно, чтобы файл отдавался в формате text/plain без перенаправлений (редиректов).
Инструмент для проверки файла
Для решения проблемы ошибок был разработан валидатор, который проверяет структуру текста. Процесс разбит на две функции: парсер, который превращает текст в структуру с сохранением порядка элементов, и валидатор, который оценивает соответствие правилам. Проверка не касается доступности ссылок, она работает только с форматом документа.
Для оценки ошибок используется система весов. Самые критические ошибки (например, отсутствие заголовка или пустой файл) имеют наибольший вес, так как они делают файл бесполезным для машины. Мелкие недочеты, вроде использования http вместо https, имеют минимальный вес и не должны критически влиять на общую оценку.
Что это значит
Установка файла llms.txt сейчас — это скорее дешевая страховка, чем гарантированный способ попасть в ответы нейросетей. Чтобы попасть в ответы ИИ, важнее работать над качеством контента и органической выдачей. Если вы решили внедрить этот файл, обязательно проверьте его структуру на соответствие правилам, так как большинство реализаций содержат ошибки.
