Собственный индекс вместо Bing
Анализ почти 1,9 миллиона источников (190 тысяч карточек из браузера и 1,7 миллиона ссылок из API) показал, что ChatGPT использует собственного поискового робота. Вопреки расхожему мнению, нейросеть не просто пересылает запросы в Bing, а использует собственный индекс, который обеспечивает 97% всех ответов.
Разница между каналами получения данных принципиальна: если покупная выдача (3% случаев) предоставляет готовые сниппеты от сторонних сервисов, то собственный робот работает иначе. Он не смешивается с внешними результатами: в выборке из 2500 ответов 2343 полностью построены на данных собственного робота, и ни один ответ не содержит смесь обоих источников.
Механика работы робота Labrador
Внутренний инструмент, получивший в логах название Labrador, ведет себя как полноценный краулер. В отличие от поисковиков, которые верстают выдачу для человека, Labrador собирает данные для машины. Это подтверждается тремя фактами: во-первых, он не обрезает заголовки (рекордсмен в выборке — 1124 знака); во-вторых, он выдает статичное описание, которое не меняется под конкретный запрос; в-третьих, он заходит на сайты, которые блокируют других роботов, заставляя систему докупать данные через посредников.
Докупать информацию приходится в тех случаях, когда собственный робот не может получить доступ к ресурсу. Это касается таких площадок, как Instagram, Pinterest, YouTube, LinkedIn и Reddit. Например, данные по YouTube докупаются в 88% случаев, а по Reddit — в 43%.
Проблема 200 символов
Главная сложность для владельцев сайтов заключается в том, как именно Labrador извлекает информацию. Робот не анализирует страницу, а фактически рендерит ее и забирает первые 200 символов видимого текста. В 86% случаев этот фрагмент обрывается на полуслове.
Поскольку робот берет текст «как есть», в выдачу часто попадает технический мусор: alt-тексты картинок (каждое шестое описание), номера телефонов из шапки сайта, пункты меню, оглавления или даже текст куки-баннеров. Для оптимизации под ChatGPT владельцам сайтов теперь важно понимать, что модель принимает решение о релевантности страницы именно по этому короткому и часто неполному фрагменту текста.
