Изпратете запитване

Ще се радваме да обсъдим Вашия проект.

AI SEO · Данни

Кои AI ботове реално обхождат сайта ви: 39 654 записа от логовете

от Владо ≈ 13 мин четене

За AI SEO се пише много и почти винаги на теория. Тази статия е обратното: отворихме сървърните логове на един реален български WordPress сайт, преброихме всяка заявка от всеки обхождащ агент за 27 дни и погледнахме не само колко пъти е дошъл, а какво е получил в отговор.

Резултатът промени приоритетите ни. Оказа се, че AI агентите обхождат сайта два пъти по-активно от Google и Bing взети заедно — и че за един от тях 41 процента от заявките се провалят заради дефект, за който не знаехме.

ai ботове обхождане на сайт данни от логовете 2026

Накратко

  • AI агенти: 2 493 заявки. Класически търсачки: 1 257. Съотношение почти точно 2 към 1.
  • Само OpenAI (1 393 заявки) обхожда 1,8 пъти по-активно от Googlebot (763).
  • 41% от заявките на ClaudeBot се провалиха — заради счупена карта на сайта, която открихме благодарение на логовете.
  • „AI ботове“ не е една категория. Има три различни функции и блокирането на всяка има различна цена.
  • Google-Extended няма да го видите в логовете — той не е бот, а само указание.

01Методология и какво тези данни не доказват

Честността за ограниченията е част от стойността на всяко измерване, затова първо това.

  • Източник: Apache access логове на един WordPress сайт с около 50 публикувани URL адреса, тематика уеб разработка и SEO, език български.
  • Период: 30 юни – 26 юли 2026 г., 27 дни, 39 654 записа общо.
  • Метод: групиране по низ в полето User-Agent, с едновременно отчитане на HTTP статус кода и на уникалните IP адреси.
  • Не е проверена автентичността на всеки агент чрез обратна DNS справка. Част от заявките теоретично могат да са от агенти, представящи се за други.
  • Един сайт не е извадка. Абсолютните числа зависят от размера, тематиката и авторитета на сайта. Съотношенията и разпределението на статус кодовете обаче са показателни и лесно проверими върху вашия сайт.

С други думи: не приемайте числата като национална статистика. Приемайте метода — и го пуснете върху собствените си логове. Командата е в раздел 07.

02Данните: кой обхожда и колко

За 27 дни AI агентите направиха 2 493 заявки срещу 1 257 от класическите търсещи ботове. Ето цялата картина, подредена по активност:

Три неща изпъкват веднага.

Първо, Googlebot вече не е най-активният посетител на сайта — той е просто най-активният единичен агент. OpenAI използва три отделни агента и сумата им, 1 393 заявки, е близо два пъти повече от Google. Ако мислите за „бюджет за обхождане“ само в контекста на Google, отчитате по-малко от половината реален трафик от машини.

Второ, Perplexity практически липсва — 5 заявки за 27 дни. Това е добро напомняне колко подвеждащо е да се говори за „AI търсачки“ като за еднородна група. Разликата между OpenAI и Perplexity в тези данни е три порядъка.

Трето, разпределението по IP адреси разкрива функцията на бота. GPTBot прави 536 заявки от само 26 IP адреса — това е класическо систематично обхождане от центрове за данни. ChatGPT-User прави 232 заявки от 141 различни адреса, тоест средно по 1,6 заявки на адрес. Това не е обхождане, а извличане в момента, в който жив потребител е поискал конкретна страница.

Разпределението по IP адреси ви казва повече от броя заявки: малко адреси означава обхождане, много адреси означава че някой в момента е поискал точно вашата страница.

03Трите вида AI агенти и цената на блокирането

Това е разделът, който според нас липсва в почти всичко написано по темата. „Да блокирам ли AI ботовете“ е грешен въпрос, защото под едно име се крият три различни функции с три различни последствия.

Класификация по документацията на съответните компании към юли 2026 г. Проверявайте актуалното състояние — списъците се променят.
АгентФункцияАко го блокирате
GPTBot
OpenAI
Обучение на моделиСъдържанието не се ползва за обучение. Не ви маха от ChatGPT search.
OAI-SearchBot
OpenAI
Индексиране за търсене в ChatGPTИзчезвате от отговорите на ChatGPT.
ChatGPT-User
OpenAI
Извличане при изрична заявка от потребителChatGPT не може да отвори ваш линк, който потребителят му е дал.
ClaudeBot
Anthropic
Обхождане на съдържаниеСъдържанието не се обхожда.
Claude-User
Anthropic
Извличане при заявка от потребителClaude не може да отвори ваша страница по искане на потребителя.
PerplexityBot
Perplexity
Индексиране за отговориИзчезвате от източниците в Perplexity.
meta-externalagent
Meta
Обхождане за AI продуктиСъдържанието не се използва от Meta.
Applebot
Apple
Siri и Spotlight търсенеИзчезвате от търсенето в устройствата на Apple.
CCBot
Common Crawl
Публичен корпус, ползван от много моделиИзпадате от набор данни с широко приложение.

И сега две неща, които почти всички разбират погрешно.

Google-Extended и Applebot-Extended не са ботове. Те са само указания в robots.txt, с които контролирате дали вече обходеното от вас съдържание да се използва за обучение на съответните модели. Няма да ги видите в логовете си — точно както не се появяват и в нашите. Съответно проверка от типа „колко пъти ме е обходил Google-Extended“ няма смисъл.
От AI Overviews на Google не може да се излезе чисто. Обобщенията се изграждат от съдържание, обходено от обикновения Googlebot. Блокирате ли Googlebot, изчезвате и от органичното търсене. Google-Extended контролира само обучението на моделите Gemini, не участието в обобщенията. Единствената частична възможност е ограничаване на фрагментите чрез nosnippet или max-snippet — което обаче отрязва и вашето собствено представяне в резултатите. Компромис, който в почти всички случаи не си струва.

04Най-полезната част от логовете: какво ботовете НЕ са получили

Дотук всичко бяха посещения. Далеч по-интересно е какво е върнал сървърът, защото това определя дали посещението е имало смисъл.

Дял успешни отговори (HTTP 200) от всички заявки на съответния агент.
АгентЗаявкиУспешниДялОсновен проблем
Googlebot76368089%
ChatGPT-User23222798%
Applebot20419797%
GPTBot53642579%18 × ограничение на честотата, 11 × отказан достъп
OAI-SearchBot62548978%54 × отказан достъп до robots.txt
Bingbot44337084%44 × ненамерен адрес
ClaudeBot54132159%169 × ненамерена карта на сайта
meta-externalagent50619839%199 × ненамерен адрес, 63 × ограничение

Тук намерихме два реални дефекта на собствения си сайт.

Дефект първи: картата на сайта връщаше 404 на всички. Файлът robots.txt сочеше към /sitemap_index.xml, а този адрес не съществуваше — заради загубени правила за пренаписване след промяна в конфигурацията на сървъра. ClaudeBot беше опитал 164 пъти за 27 дни. Meta беше опитала още 79 пъти на пет различни варианта на адреса. Googlebot, който вече имаше кеширан списък с адреси, просто беше спрял да пита — и именно затова дефектът не се виждаше никъде в интерфейса на Search Console като предупреждение.

Дефект втори: robots.txt периодично връщаше 401. Индексиращият агент на OpenAI получи отказан достъп до robots.txt 54 пъти, разпределено през целия месец. Причината е защитен слой срещу автоматизирани клиенти пред сайта, който понякога го класифицира като нежелан. Това е по-сериозно, отколкото изглежда: robots.txt е първото нещо, което един коректен агент чете, и поведението при неуспех се различава между доставчиците. Част от тях приемат липсата на файл за разрешение, други спират.

Ботът, който е дошъл 541 пъти и е получил 404 в 169 от случаите, не е обходил сайта ви. Той е записал, че сайтът ви е ненадежден.

Поуката е обща и не зависи от нашия конкретен случай: отчетите в Search Console показват какво вижда Google, а логовете показват какво вижда всеки останал. В момент, в който AI агентите правят два пъти повече заявки от търсачките, това е половината картина, която повечето сайтове никога не поглеждат.

05Решението за блокиране е стратегическо, не техническо

Техническата част е три реда в текстов файл. Трудното е да се реши какво искате, а това зависи от бизнес модела ви.

Ако сте…Разумна политика
Услуги, местен бизнес, B2BПуснете всичко. Видимостта в AI отговорите носи заявки; съдържанието ви не е продукт, а описание на продукта.
Медия с приходи от рекламаБлокирайте ботовете за обучение, оставете индексиращите. Целта е цитиране с линк, не безплатен корпус.
Продавате съдържание
курсове, бази данни, изследвания
Блокирайте обучението и обмислете достъп зад регистрация за най-стойностното. Публичната част остава отворена.
Онлайн магазинПуснете всичко. Продуктовите данни в AI асистент са канал за продажби, а не активът, който продавате.

Забележете, че в три от четирите случая правилният отговор е „пуснете всичко“. Инстинктът да се блокира идва от загриженост за авторството, което е напълно основателно — но за повечето български бизнеси, които биха прочели тази статия, рискът от невидимост е много по-голям от риска от използване.

06Практика: robots.txt и llms.txt без илюзии

Ако решите да разделите обучението от индексирането, конфигурацията изглежда така. Обърнете внимание, че агентите за извличане по заявка на потребител остават разрешени — блокирането им означава, че вашият линк не може да бъде отворен от AI асистент, когато самият потребител го е поискал.

robots.txt
# Ботове за обучение — забранени
User-agent: GPTBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: meta-externalagent
Disallow: /

User-agent: Bytespider
Disallow: /

# Указания за обучение (не са ботове)
User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

# Индексиране за AI търсене — РАЗРЕШЕНО
User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

# Извличане по заявка на потребител — РАЗРЕШЕНО
User-agent: ChatGPT-User
Allow: /

User-agent: Claude-User
Allow: /

User-agent: Perplexity-User
Allow: /

Sitemap: https://вашдомейн.bg/sitemap_index.xml
След всяка промяна: отворете вашдомейн.bg/robots.txt в режим инкогнито и се убедете, че връща код 200 и точно това съдържание. Файл robots.txt, който сам връща грешка, е по-лош от липсващ — точно това открихме при нас.

Що се отнася до llms.txt — конвенцията за markdown файл, описващ структурата на сайта за езикови модели: към момента това е предложение, а не стандарт, който големите доставчици официално са се задължили да спазват. Няма как да ви обещаем измерим резултат. Създаването му отнема десет минути и не носи риск, така че си струва като евтин експеримент, но не и като приоритет. Всеки, който ви продава llms.txt като AI SEO услуга, ви продава несигурност на цената на сигурност.

Приоритетите, които реално влияят на това как сте представени в AI отговорите, са по-скучни: работеща карта на сайта, чист HTML, ясна структура на заглавията, конкретни отговори веднага след въпроса и коректни структурирани данни. Разгледали сме ги подробно в статията за оптимизация за генеративни търсачки и в тази за структурираните данни.

07Направете същия анализ за вашия сайт

Ако имате SSH достъп, това е една команда. Заменете пътя до вашия лог файл.

bash
LOG=~/access-logs/вашдомейн.bg-ssl_log

for b in Googlebot Bingbot GPTBot OAI-SearchBot ChatGPT-User \
         ClaudeBot Claude-User PerplexityBot meta-externalagent \
         Applebot CCBot Bytespider Amazonbot; do
  n=$(grep -ic "$b/" "$LOG")
  [ "$n" -eq 0 ] && continue
  ok=$(grep -i "$b/" "$LOG" | grep -cE 'HTTP/[0-9.]+" 200')
  ip=$(grep -i "$b/" "$LOG" | awk '{print $1}' | sort -u | wc -l)
  printf "%-22s %5d заявки  %5d успешни (%3d%%)  %4d IP\n" \
         "$b" "$n" "$ok" $((ok*100/n)) "$ip"
done

Ако нямате SSH, същото се вижда и през файловия менажер на хостинг панела — потърсете папка logs или access-logs. Логовете често са архивирани по месеци.

Гледайте две числа. Дела успешни отговори — под 85 процента за някой основен агент означава, че имате технически проблем, а не че ботът е капризен. И абсолютния брой — ако AI агентите правят по няколко заявки на месец, вашият проблем не е политиката за блокиране, а че сайтът просто не е открит.

Изводът, който не очаквахме

Влязохме в логовете, за да напишем статия за AI ботове, и излязохме с два поправени дефекта на собствения си сайт. Това само по себе си е най-практичният извод: анализът на логовете е диагностика, не любопитство.

Другото, което си заслужава да се запомни, е промяната в пропорциите. Когато агентите на три компании за изкуствен интелект правят два пъти повече заявки от Google и Bing взети заедно, „техническо SEO“ вече не означава „да сме добре в Search Console“. Означава сайтът да бъде обходим, разбираем и достъпен за много повече от един читател — и това да се проверява там, където се вижда, а не там, където е удобно.

Ако искате да проверим вашия сайт с този подход, това е част от техническия одит, който правим.

Владо
Senior WordPress Developer & SEO Expert

Помага на бизнеси да изграждат бързи, сигурни и видими в Google сайтове. Над едно десетилетие опит с WordPress, WooCommerce и техническо SEO.

Сподели:

Често задавани въпроси

Кои AI ботове обхождат сайтовете най-активно през 2026 г.?
По данни от сървърните логове на български WordPress сайт за периода 30 юни – 26 юли 2026 г., най-активни са агентите на OpenAI с общо 1 393 заявки, следвани от ClaudeBot на Anthropic с 541 и meta-externalagent на Meta с 506. За сравнение, Googlebot е направил 763 заявки. Сумарно AI агентите са около два пъти по-активни от класическите търсещи ботове.
Трябва ли да блокирам AI ботовете в robots.txt?
Зависи от кой бот. Блокирането на ботове за обучение като GPTBot не ви маха от резултатите в AI търсачките. Блокирането на индексиращи агенти като OAI-SearchBot обаче ви прави невидими в отговорите на ChatGPT. Ако искате трафик от AI търсачките, блокирайте най-много ботовете за обучение и никога тези за индексиране и за извличане по заявка на потребител.
Каква е разликата между GPTBot и OAI-SearchBot?
GPTBot събира съдържание, което може да бъде използвано за обучение на моделите на OpenAI. OAI-SearchBot изгражда индекса, от който ChatGPT извлича и цитира източници в отговорите си. Трети агент, ChatGPT-User, отваря конкретна страница, когато потребител или агент изрично я поиска. Това са три различни функции с три различни последствия при блокиране.
Работи ли llms.txt наистина?
Към момента llms.txt е предложена конвенция, а не стандарт, който големите доставчици на AI модели официално са се задължили да спазват. Създаването му отнема малко време и не носи риск, но не следва да се очаква измеримо повишение на видимостта. Практическият приоритет остава сайтът да е технически обходим и съдържанието да е ясно структурирано.
Мога ли да изляза от AI Overviews на Google, но да остана в търсенето?
Не по чист начин. AI Overviews използват съдържание, обходено от Googlebot, така че блокирането на Googlebot ви премахва и от органичното търсене. Тагът Google-Extended контролира само използването за обучение на моделите Gemini, не участието в AI Overviews. Единствената частична възможност са ограниченията на фрагментите чрез nosnippet, които обаче намаляват и вашето собствено представяне в резултатите.
Как да проверя кои ботове посещават моя сайт?
Отворете сървърните access логове през хостинг панела или SSH и групирайте записите по низ в полето User-Agent, като едновременно отчитате и HTTP статус кода. Важното е не само колко пъти е дошъл всеки бот, но и какво е получил — висок дял отговори 404, 403 или 429 означава, че съдържанието ви фактически не се прочита.
Натоварват ли AI ботовете сървъра значително?
В нашите данни 2 493 заявки за 27 дни са около 92 на ден — незначително за нормален хостинг. Проблем възниква при агресивни агенти върху сайтове с много динамични адреси, например магазини с филтри. Тогава решението е ограничаване на честотата и забрана за обхождане на филтрираните адреси, а не пълно блокиране.

Вижте какво получават ботовете на вашия сайт

Проверяваме логовете, картата на сайта, robots.txt и дела успешни отговори по агент — и оправяме дефектите, които не се виждат в Search Console.

Заявете технически одит