شبکه توزیع محتوای (CDN) شما ممکن است بدون اطلاع شما در حال مسدود کردن CCBot باشد و صفحات سایتتان را از آرشیوی که اکثر مدل های هوش مصنوعی را آموزش می دهد، دور نگه دارد.
هر ماه، یک سازمان غیرانتفاعی به نام Common Crawl (کامن کرال) بیش از ۲ میلیارد صفحه وب را می خزد (Fetch می کند) و کپی آن ها را به صورت رایگان در اختیار هر کسی که بخواهد قرار می دهد.
این آرشیو رایگان، دقیقاً همان نقطه ای است که داده های آموزشی بیشتر هوش های مصنوعی از آنجا آغاز می شود.
زمانی که موزیلا (Mozilla) مدل های زبانی بزرگ (LLM) منتشر شده بین سال های ۲۰۱۹ تا ۲۰۲۳ را بررسی کرد، مشخص شد که ۶۴ درصد آن ها به نوعی با داده های Common Crawl آموزش دیده اند و حدود ۶۰ درصد از وزن آموزشی نسخه GPT-3، متعلق به داده های فیلترشده ی همین پلتفرم بوده است.
اگر یک مدل هوش مصنوعی در حال حاضر برند شما را بدون جستجو در وب می شناسد، احتمال بسیار قوی وجود دارد که این اطلاعات را از همین آرشیو یاد گرفته باشد.
چرا سایت شما از دید هوش مصنوعی پنهان می ماند؟
خزنده ای که در پس زمینه این سیستم کار می کند، CCBot نام دارد. اینکه آیا این ربات می تواند سایت شما را بخواند یا خیر، تعیین می کند که آیا اصلاً در این آرشیو عظیم وجود خارجی دارید یا نه.
این ربات در فایل لاگ (Log) سرور شما به این شکل دیده می شود:
CCBot/2.0 (https://commoncrawl.org/faq/)
خزش جولای ۲۰۲۶، حاوی ۲.۱۴ میلیارد از این صفحات وب است.
سه رکورد از این تعداد، متعلق به سایت bbc.com است. CCBot برای ورود درخواست مجوز کرد، پیام رد درخواست را خواند و سایت را ترک کرد! تا جایی که به مسیر داده های آموزشی هوش مصنوعی مربوط می شود، یکی از بزرگ ترین سایت های خبری روی کره زمین اصلاً وجود ندارد!
فایل robots.txt سایت BBC، در حال حاضر ۱۳ مورد از ۱۴ خزنده هوش مصنوعی را مسدود کرده است. سایر سایت های خبری معتبر نیز از سال ۲۰۲۳ به صورت هدفمند شروع به مسدود کردن خزنده های آموزشی کرده اند. ابزار BuzzStream این میزان مسدودسازی را در بین برترین ناشران آمریکا و بریتانیا حدود ۷۵ درصد ارزیابی کرده است.
اما سوالی که برای من جذاب است این است: چه تعداد سایت بدون اینکه خودشان تصمیم گرفته باشند، از این خزش جا مانده اند؟
کریس گرین (Chris Green) اخیراً آمارهای HTTP Archive را در لینکدین منتشر کرد. تقریباً ۴۹۲,۰۰۰ سایت نام CCBot را در فایل robots.txt خود آورده اند و حدود ۹۵ درصد از این اشاره ها، با هدف مسدود کردن این ربات بوده است.

تصویر فنی نشان دهنده تلاش ربات CCBot برای ورود به سرور سایت و برخورد آن با سد فایروال و دستورات مسدودکننده.
معرفی ابزار رایگان بررسی وضعیت سایت در Common Crawl
سوال باز او ذهن من را درگیر کرد:
چه تعداد از این نیم میلیون سایت، واقعاً قصد چنین کاری را داشته اند؟
از اول جولای ۲۰۲۵، کلودفلر (Cloudflare) به صورت پیش فرض خزنده های هوش مصنوعی را روی هر دامنه جدیدی که سرویس می دهد، مسدود می کند. (در ایران نیز برخی از سرویس های CDN داخلی و فایروال ها ممکن است رفتار مشابهی داشته باشند که در خدمات سئو فنی دانش وب، ما همیشه این موارد را با دقت بررسی و رفع می کنیم).
مدیریت خودکار robots.txt کلودفلر، به ۳.۸ میلیون دامنه دیگر که هرگز خودشان این فایل را ننوشته بودند، رسید. افزونه های تبلیغاتی نیز لیست های مسدودی خود را اضافه می کنند. در سال ۲۰۲۶، مسدود شدن CCBot به همان اندازه که می تواند یک تصمیم آگاهانه باشد، ممکن است صرفاً یک تنظیمات پیش فرض پلتفرم باشد.
خود سازمان Common Crawl یک راهنمای جامع برای ممیزی دقیق همین موضوع نوشته است. اما تمام این فرآیند، یک کار دستی است. بنابراین، من آن را خودکارسازی کردم.
ابزار بررسی کننده دیده شدن در کامن کرال (Common Crawl Visibility Checker) کاملاً رایگان است، نیازی به ثبت نام ندارد و وضعیت هر دامنه را یکی یکی، مستقیماً از روی آرشیوهای خود Common Crawl پاسخ می دهد.
جایگاه Common Crawl در مسیر پردازش هوش مصنوعی
این خزش از سال ۲۰۰۸ به صورت ماهانه در حال انجام است و اسنپ شات های (Snapshots) آن، ماده خام برای مجموعه داده های آموزشی بزرگی مثل C4، RefinedWeb، RedPajama، Dolma، FineWeb و اکثر مجموعه های دیگر محسوب می شود.
آزمایشگاه های هوش مصنوعی به ندرت مستقیماً به سراغ خزش های خام می روند. آن ها یک نسخه مشتق شده و فیلترشده را برمیدارند؛ بنابراین، مسیر ورود صفحه سایت شما به یک مدل هوش مصنوعی، از CCBot شروع شده، به Common Crawl می رود و سپس وارد یکی از این مجموعه داده ها می شود. هر مرحله فقط چیزی را نگه می دارد که از مرحله قبل با موفقیت عبور کرده باشد.
این مسیر دائماً در حال حرکت است. FineWeb در ماه جولای گذشته، شش خزش جدید مربوط به سال ۲۰۲۵ را اضافه کرد و انویدیا (NVIDIA) مجموعه آموزشی Nemotron خود را دقیقاً درون فضای ذخیره سازی ابری Common Crawl میزبانی می کند.
من قبلاً درباره عمر پیش آموزشی محتوای شما در مقاله «سه زندگی اسکیما مارک آپ» صحبت کرده ام. نسخه کوتاه ماجرا این است که CCBot تنها خزنده ای است که بازدیدهایش اثری مرکب و تصاعدی دارد. ربات GPTBot صفحه شما را فقط و فقط برای شرکت OpenAI می خزد. اما یک بازدید توسط CCBot، در نهایت به دست هر کسی می رسد که بخواهد مدلی را روی داده های وبِ باز آموزش دهد.

اینفوگرافیک مراحل استخراج داده توسط CCBot، پالایش آن در مجموعه های FineWeb و C4 و ورود نهایی به فرآیند آموزش LLMها.
ممیزی دستی که Common Crawl از شما انتظار دارد انجام دهید
در ماه ژوئن، کامن کرال چیز جالبی منتشر کرد. «ممیزی دیده شدن در هوش مصنوعی» یک راهنمای ۱۸ صفحه ای است که به صاحبان سایت ها می گوید چگونه جایگاه خود را در این مجموعه داده بررسی کنند. راهنمای خوبی است، اما یک مشکل بزرگ دارد: تمام بررسی ها دستی است.
شما باید با استفاده از دستور Curl و با شناسه کاربری (User Agent) ربات CCBot، صفحه اصلی خود را فراخوانی کنید و پاسخ سرور را با مرورگر عادی مقایسه کنید. سپس به سراغ API ایندکس می روید و با چشم خودتان تعداد کپچرها (Captures) را می شمارید و در گراف وب آن ها، رتبه خود را جستجو می کنید. در نهایت، باید با دست خودتان یک کارت امتیاز برای هر دامنه بسازید. خنده دار است!
من این چک لیست را خواندم و سپس آن را اتوماتیک کردم. خوشبختانه، Common Crawl در ماه می داده های خود را برای ابزارهای مرورگر باز کرد که این موضوع باعث می شود این ابزار یکی از معدود ابزارهایی باشد که ارائه دهنده داده واقعاً دلش می خواهد ساخته شود. من فکر می کنم آن ها دقیقاً می دانند چه کار می کنند؛ دمشون گرم!
ابزار بررسی کننده چه چیزی را نشان می دهد؟
یک دامنه را تایپ کنید و ابزار، عارضه یابی را در چهار پنل به شما برمی گرداند:
۱. میزان ثبت صفحات (Captures) در هر خزش
این پنل به صورت یک نمودار روند (Trend) نشان می دهد که هر یک از دوازده خزش ماهانه گذشته، چه تعداد از صفحات شما را برداشته اند. سایت شخصی من از ۲ صفحه ثبت شده در خزش آگوست سال گذشته، به ۵۵ صفحه در جولای امسال رسید؛ که این جذاب ترین نموداری است که تا به حال از سایت من کشیده شده است.
برای دامنه های بزرگ، یک آمار تخمینی ارائه می شود. اگر wikipedia.org را تایپ کنید، عدد تقریبی ۳.۷ میلیون را با برچسب “تخمین” خواهید دید، زیرا این ابزار برای سایت های عظیم به جای شمارش تک تک رکوردها، ساختار ایندکس را می خواند.
۲. تاریخچه فایل Robots.txt
کامن کرال فایل robots.txt را که قبل از هر خزش خوانده است، ذخیره می کند. این ابزار نسخه های ذخیره شده را ماه به ماه رو به عقب بررسی می کند و تغییرات قوانین خزنده های هوش مصنوعی را مقایسه (Diff) می کند؛ بنابراین متوجه می شوید که مسدود شدن ربات دقیقاً از چه تاریخی شروع شده است.
برای bbc.com هر ماه یکسان است: ربات CCBot مسدود است، ۱۳ مورد از ۱۴ توکن هوش مصنوعی مسدودند، علامت اسلش (/) Disallow شده است.
۳. تشخیص نوع و منبع مسدودسازی
وقتی یک الگو مسدودسازی با یک قالب شناخته شده مطابقت داشته باشد، ابزار آن را اعلام می کند. robots.txt مدیریت شده ی کلودفلر، دارای یک کامنت لایسنس کاملاً مشخص است. تنظیمات پیش فرض Squarespace امضای منحصربه فرد خودش را دارد. و زمانی که هشت یا چند توکن هوش مصنوعی به صورت یکجا و یک باره مسدود می شوند، معمولاً کار یک افزونه وردپرسی یا یک لیست کپی شده است.

رابط کاربری مدرن ابزار آنالیز دامنه ها که چهار پنل عارضه یابی وضعیت خزش، تاریخچه روبات و تست زنده را نمایش می دهد.
۴. کاوشگر زنده (Live Probe)
تاریخچه به ما می گوید در گذشته چه اتفاقی افتاده، اما این پنل بررسی می کند که در همین لحظه چه چیزی واقعیت دارد. این ابزار صفحه اصلی شما را با شناسه CCBot/2.0 در کنار یک مرورگر معمولی و یک ربات کنترل کننده (Control Bot) فراخوانی می کند. این کار باعث می شود مسدودیت هایی را پیدا کنیم که فایل robots.txt هرگز نشان نمی دهد؛ مانند فایروالی که در لبه شبکه (Edge) جلوی ربات را می گیرد.
این چهار مورد بخش عارضه یابی (Diagnosis) بودند. بقیه ابزار درباره این است که حالا با این اطلاعات باید چه کار کنیم.
هر بررسی به پنلی از «کارت های رفع مشکل» ختم می شود که با خطاهای پیدا شده مطابقت دارند. مثلاً اگر سایت توسط قالب کلودفلر مسدود شده باشد، مسیر داشبورد و یک هشدار به شما نمایش داده می شود. اگر بلوک ها دستی نوشته شده باشند، قطعه کد دو خطی robots.txt همراه با دکمه کپی به شما داده می شود. اگر مشکل از فایروالِ لبه (Edge) باشد، کارت به شما نام ارائه دهنده فایروال را نشان می دهد و رنج IP های منتشر شده CCBot را لینک می کند. (اگر در حل این مشکلات فنی تخصصی ندارید، تیم طراحی سایت و پشتیبانی دانش وب می تواند در کمترین زمان این پیکربندی های پیچیده را برای وب سایت شما انجام دهد).
در پایین کارت ها، تاریخ خزش بعدی نیز نمایش داده می شود؛ زیرا اصلاحی که امروز انجام می دهید، در داده های ماه آینده خود را نشان خواهد داد و دانستن اینکه چه زمانی باید منتظر نتیجه باشید، بسیار مهم است.
پوشش نقشه سایت (Sitemap Coverage)
پنل نقشه سایت، قابلیتی است که من واقعاً برای خودم می خواستم. این ابزار سایت مپ شما را می خواند و آن را با URLهای ثبت شده در آرشیو مقایسه می کند. این کار یک عدد تیتروار را به یک لیست کار عملی تبدیل می کند. آمار من نشان می دهد ۴۲ صفحه از ۹۷ صفحه سایت در خزش جولای ثبت شده است و ۵۵ صفحه دیگر به صورت فایل اکسل (CSV) قابل دانلود است.
ردیابی یک صفحه خاص
شما می توانید به جای دامنه، آدرس کامل یک صفحه خاص را قرار دهید و تاریخچه یک ساله همان صفحه را دریافت کنید. انجام این کار در کمتر از یک دقیقه دو چیز را درباره سایت خودم به من یاد داد:
مقاله تحلیل منابع ChatGPT من تنها در ۱ خزش از ۱۲ خزش گذشته ثبت شده بود. و نسخه ای که Common Crawl از آن ذخیره کرده، اصلاً URL تمیز و اصلی من نیست! CCBot این صفحه را از طریق لینکی در یک خبرنامه پیدا کرده و آن را با تمام پارامترهای ردیابی ConvertKit که هنوز به آن چسبیده بودند، ذخیره کرده است (در حالی که من مدت هاست استفاده از آن سرویس را متوقف کرده ام).
خزنده آن طور که شما تصور می کنید در سایتتان نمی چرخد. او هر لینکی که واقعاً در وب وجود داشته باشد را دنبال می کند.
نحوه شناسایی و ذخیره لینک های دارای پارامترهای ردیابی (Tracking Parameters) توسط ربات های خزش هوش مصنوعی.
بررسی نسخه ذخیره شده
بخش آخر، بررسی کپی ذخیره شده است. این ابزار دقیقاً بایت هایی را که CCBot برای صفحه اصلی شما آرشیو کرده است استخراج کرده، متن را بیرون می کشد و آن را با کدهای HTML زنده شما مقایسه می کند. هر دو طرف قبل از اجرای کدهای جاوا اسکریپت خوانده می شوند؛ نکته دقیقاً همینجاست، چون CCBot هرگز جاوا اسکریپت را اجرا نمی کند!
مسدودسازی های نامرئی
دو نوع مسدودسازی وجود دارد که هنگام بررسی دستی robots.txt هرگز خود را نشان نمی دهند:
۱. پیش فرض های CDN: دامنه ای که پس از جولای ۲۰۲۵ در Cloudflare ایجاد شده باشد، خزنده های هوش مصنوعی را مسدود می کند مگر اینکه کسی آن را خاموش کرده باشد. فایل robots.txt مدیریت شده کلودفلر، میلیون ها سایت را تحت تأثیر قرار داده که صاحبانشان حتی روحشان هم از وجود این فایل خبر ندارد.
۲. قوانین لبه شبکه (Edge Rule): یک فایروال برنامه های کاربردی وب (WAF) که جلوی CCBot را می گیرد در حالی که فایل robots.txt کاملاً تمیز به نظر می رسد. راهنمای خود Common Crawl هم می گوید قبل از دست زدن به سرورتان، داشبورد CDN خود را چک کنید و حق با آن هاست. این دقیقاً همان جایی است که هیچ کدام از خزنده های کلاسیک سئو (مانند Screaming Frog) به آن نگاه نمی کنند.
چه چیزی واقعاً باعث قرارگیری سایت شما در ایندکس می شود؟
اگر نتیجه بررسی شما نشان داد که مسیر ربات باز است اما صفحاتتان به سختی ثبت شده اند، مسدودسازی اصلاً مشکل شما نبوده است؛ بلکه اولویت خزش (Crawl Priority) مشکل اصلی است.
Common Crawl از هر سایت بر اساس میزان “ارتباطات و اتصالات دامنه” نمونه برداری می کند. بنابراین چند مورد زیر بسیار مهم هستند:
- ابتدا CDN را تعمیر کنید: اگر کاوشگر زنده نشان داد که چالشی وجود دارد، هیچ تغییری در
robots.txtبه شما کمک نخواهد کرد. - به CCBot اجازه ورود دهید: نبودن هیچ قانونی به صورت پیش فرض به معنای “بله” است. (من در سایتم صراحتاً به آن اجازه داده ام).
- نقشه سایت را در
robots.txtاضافه کنید: ربات CCBot از پروتکل سایت مپ پیروی می کند. - رندر کردن در سمت سرور (SSR): ربات CCBot جاوا اسکریپت را اجرا نمی کند، بنابراین محتوایی که فقط با رندر سمت کاربر به وجود می آید، چیزی جز یک پوسته خالی در داده های آموزشی باقی نمی گذارد. (در پروژه های طراحی سایت دانش وب، ما از تکنولوژی هایی نظیر Next.js و SSR بهره می بریم تا سایت ها از روز اول برای سئو و هوش مصنوعی کاملاً بهینه باشند). محدودیت حجم هم از مارس ۲۰۲۵ که سقف ذخیره سازی از ۱ مگابایت به ۵ مگابایت در هر صفحه رسید، دیگر بهانه خوبی نیست.
- از سایت های معتبر لینک (بک لینک) بگیرید: اولویت خزش از مفهوم Harmonic Centrality (مرکزیت هارمونیک) پیروی می کند. به حرف آن هایی که می گویند “سئو مرده است” گوش ندهید. به خرید… ببخشید، منظورم ساختن آن بک لینک ها بود… ادامه دهید!

تصویر مفهومی از عناصر فنی مانند رندر سمت سرور (SSR)، ساختار نقشه سایت و شبکه بک لینک ها برای ارتقای نرخ اندکس سایت.
مواردی که این ابزار نمی تواند به شما بگوید
حضور در Common Crawl به این معنی نیست که حتماً در مدل نهایی هوش مصنوعی هم حضور دارید. هر مجموعه آموزشی، خزش ها را فیلتر می کند و آزمایشگاه های پیشرو (مانند OpenAI) از حوالی سال ۲۰۲۳ دیگر ترکیب داده های خود را فاش نمی کنند. پوشش نازک و کم تعداد صفحات شما هم به تنهایی چیزی را ثابت نمی کند، زیرا Common Crawl صرفاً یک نمونه برداری از وب است، نه یک کپی کامل از آن.
به همین دلیل است که ابزار من قبل از صدور رأی نهایی، میزان ثبت ها، تاریخچه فایل ربات و تست زنده را با هم بررسی می کند.
همین حالا آن را اجرا کنید
دامنه خودتان را چک کنید. سپس دامنه مشتریانتان را بررسی کنید. اگر متوجه شدید که ربات ها دقیقاً در همان ماهی مسدود شده اند که CDN سایت تغییر کرده است، دقیقاً می دانید چه اتفاقی افتاده و احتمالاً شما اولین کسی هستید که این موضوع را به آن ها اطلاع می دهید!
نتیجه گیری
با رشد چشمگیر مدل های زبانی بزرگ (LLMs) و موتورهای جستجوی مبتنی بر هوش مصنوعی، صرفاً بهینه سازی سایت برای گوگل (SEO سنتی) دیگر کافی نیست. پلتفرم هایی مانند Common Crawl، دروازه ورود محتوای شما به ذهن هوش های مصنوعی هستند و مسدود بودن ناخواسته آن ها از طریق CDNها یا فایروال ها، می تواند به قیمت از دست رفتن کامل سهم بازار شما در آینده تمام شود. شما باید با استفاده از ابزارهای مانیتورینگ، بررسی دقیق فایل robots.txt، پیکربندی صحیح سرور و رندرینگ سمت سرور (SSR)، اطمینان حاصل کنید که خزنده های AI به محتوای شما دسترسی دارند. اگر به دنبال پیاده سازی این استراتژی های پیشرفته و همگام سازی کسب وکار خود با جدیدترین تکنولوژی های هوش مصنوعی هستید، تیم متخصصان دانش وب آماده است تا با ارائه خدمات جامع سئو، طراحی سایت و دیجیتال مارکتینگ، برند شما را برای آینده وب آماده کند.