جان مولر از شرکت گوگل، به تازگی به سوالی مهم درباره فایل robots.txt پاسخ داده و یک اشتباه رایج و بسیار ریز را توضیح داده است که می تواند اهداف ایندکس سازی و سئوی سایت شما را به شدت تحت تاثیر قرار دهد. هرچند موضوع اصلی این پرسش به ایندکس شدن صفحاتِ اسپم در بخش جستجوی سایت (Search Box Spam) مربوط می شد، اما این اشتباه ممکن است برای هر کسی و در هر شرایطی رخ دهد.
در پروژه های دانش وب، ما بارها با سایت هایی مواجه شده ایم که به دلیل همین اشتباهات کوچک در فایل robots.txt، صفحات مهمشان از نتایج گوگل حذف شده یا برعکس، صفحات زباله و اسپم آن ها ایندکس شده و بودجه خزش (Crawl Budget) آن ها را هدر داده است.
اسپم در باکس جستجوی وب سایت چیست؟
شخصی که این سوال را در انجمن ردیت (Reddit) مطرح کرده بود، با مشکل حمله اسپم از طریق نوار جستجوی سایت دست وپنجه نرم می کرد. اما اسپمرها دقیقاً چه کار می کنند؟ آن ها با عباراتی که شامل کلمات کلیدی اسپم یا لینک سایت های خودشان است، در سایت شما جستجو می کنند. اتفاقی که در مرحله بعد می افتد این است که نوار جستجوی سایت شما، یک آدرس URL جدید (شامل آن عبارت اسپم) تولید می کند. سپس اسپمرها به این URL لینک می دهند تا در نتایج جستجوی گوگل ایندکس شود و از اعتبار سایت شما سوءاستفاده کنند.
این دقیقاً همان مشکلی بود که برای شخص سوال کننده رخ داده بود. واکنش اولیه او این بود که با اضافه کردن یک خط کد در فایل robots.txt، جلوی ایندکس شدن این صفحات را توسط گوگل بگیرد. اما با کمال تعجب، گوگل همچنان در حال ایندکس کردن آن URLهای اسپمِ تولید شده بود!

تصویرسازی ربات گوگل (Googlebot) که در میان انبوهی از URLهای اسپم تولید شده توسط نوار جستجو سردرگم شده است.
ایندکس شدن صفحاتی که توسط Robots.txt مسدود شده اند!
این کاربر در ردیت توضیح داد که نوار جستجوی فروشگاه اینترنتی کلاینت او (که روی سیستم عامل شاپيفای Shopify راه اندازی شده بود)، در پاسخ به جستجوی اسپمرها، صفحات وب اسپم تولید می کرد. با وجود اینکه یک فایل robots.txt گوگل را از ایندکس کردن این صفحات منع می کرد، اما گوگل همچنان آن ها را در نتایج خود نشان می داد.
کاری که کلاینت انجام داده بود، ریدایرکت (انتقال) این URLهای اسپم به یک صفحه دیگر از سایت بود. کاربری که سوال را می پرسید، به جای اینکه بپرسد «چگونه جلوی ایندکس شدن این صفحات را بگیرم؟» (که سوال درست و منطقی تری بود)، پرسید که «آیا این URLهای ریدایرکت شده باید ارور 404 (صفحه پیدا نشد) برگردانند؟ ساده ترین راه برای رفع این مشکل چیست؟»
او در سوال خود نوشت:
*”من روی فروشگاه شاپيفای یک کلاینت کار می کنم که در آن، مسیر
/searchرا در فایلrobots.txtدر وضعیت disallow (غیرمجاز برای خزش) قرار داده ایم. با این حال، این نتایج جستجو همچنان در گوگل ایندکس می شوند.اما اگر سعی کنم یکی از این صفحات را باز کنم، آن ها دارای یک ریدایرکت هستند و به صفحه دسته بندی دیگری در فروشگاه منتقل می شوند. آیا باید به جای این کار، یک صفحه خط می دهند تا در نتایج جستجوی گوگل ایندکس شود و از اعتبار سایت شما سوءاستفاده کنند.
این دقیقاً همان مشکلی بود که برای شخص سوال کننده رخ داده بود. واکنش اولیه او این بود که با اضافه کردن یک خط کد در فایل robots.txt، جلوی ایندکس شدن این صفحات را توسط گوگل بگیرد. اما با کمال تعجب، گوگل همچنان در حال ایندکس کردن آن URLهای اسپمِ تولید شده بود!

نمایش شماتیک یک صفحه که در فایل robots.txt مسدود شده (Disallow) اما همچنان در نتایج جستجوی گوگل (SERP) ظاهر شده است.
ایندکس شدن صفحاتی که توسط Robots.txt مسدود شده اند!
این کاربر در ردیت توضیح داد که نوار جستجوی فروشگاه اینترنتی کلاینت او (که روی سیستم عامل شاپيفای Shopify راه اندازی شده بود)، در پاسخ به جستجوی اسپمرها، صفحات وب اسپم تولید می کرد. با وجود اینکه یک فایل robots.txt گوگل را از ایندکس کردن این صفحات منع می کرد، اما گوگل همچنان آن ها را در نتایج خود نشان می داد.
کاری که کلاینت انجام داده بود، ریدایرکت (انتقال) این URLهای اسپم به یک صفحه دیگر از سایت بود. کاربری که سوال را می پرسید، به جای اینکه بپرسد «چگونه جلوی ایندکس شدن این صفحات را بگیرم؟» (که سوال درست و منطقی تری بود)، پرسید که «آیا این URLهای ریدایرکت شده باید ارور 404 (صفحه پیدا نشد) برگردانند؟ ساده ترین راه برای رفع این مشکل چیست؟»
او در سوال خود نوشت:
*”من روی فروشگاه شاپيفای یک کلاینت کار می کنم که در آن، مسیر
/searchرا در فایلrobots.txtدر وضعیت disallow (غیرمجاز برای خزش) قرار داده ایم. با این حال، این نتایج جستجو همچنان در گوگل ایندکس می شوند.اما اگر سعی کنم یکی از این صفحات را باز کنم، آن ها دارای یک ریدایرکت هستند و به صفحه دسته بندی دیگری در فروشگاه منتقل می شوند. آیا باید به جای این کار، یک صفحه خطای 404 نمایش دهیم؟ ساده ترین راه برای حل این موضوع چیست؟”*
چرا فایل Robots.txt باعثخصصین سئو و تیم های فنی طراحی سایت در دانش وب همیشه به این نکته تاکید دارند که این رفتار به هیچ وجه یک باگ یا ایراد در ساختار robots.txt نیست؛ بلکه کاملاً منطقی است. این ویژگی به مدیران سایت ها اجازه می دهد تا برای خزنده های خاص (مثل ربات گوگل)، قوانین منحصر به فردی تعریف کنند و برای سایر ربات ها، مجموعه ای متفاوت از قوانین را در نظر بگیرند.
چگونه از اسپم نوار جستجو در امان بمانیم؟
پلتفرم های محبوبی مانند وردپرس (WordPress) و شاپيفای (Shopify)، هر دو راهکارهایی برای کاهش و مقابله با اسپم در باکس جستجو دارند.
مقابله با اسپم در شاپيفای (Shopify)
وب سایت رسمی شاپيفای یک آموزش کامل دارد که نشان می دهد چگونه می توان به صورت خودکار، تگ noindex را به تمام صفحات نتایج جستجو اضافه کرد. این کار به طور قطعی جلوی ایندکس شدن تمام صفحات جستجو را می گیرد. نکته بسیار مهم: برای اینکه تگ noindex به درستی توسط گوگل خوانده شود، نباید آن صفحات را در فایل robots.txt مسدود کنید!
استفاده از دستور noindex بسیار موثرتر از استفاده از robots.txt است. ما در مشاوره های دیجیتال مارکتینگِ دانش وب همیشه یادآوری می کنیم که: فایل robots.txt فقط خزش (Crawling) را کنترل می کند، نه ایندکس شدن (Indexing) را. اگر صفحه ای مسدود شود اما لینک های خارجی داشته باشد، گوگل ممکن است همچنان آن را بدون خواندن محتوایش ایندکس کند.
شاپيفای در این باره آموزش می دهد:
*”شما می توانید با شخصی سازی بخش
<head>در فایل لایه بندیtheme.liquidقالب خود، صفحاتی که در فایلrobots.txt.liquidمسدود نشده اند را پنهان کنید. برای این کار باید از متاتگ ها استفاده کنید.از پنل ادمین شاپيفای به مسیر Online Store > Themes بروید.
روی فایل
theme.liquidکلیک کنید و در بخش<head>کد زیر را قرار دهید:*
{% if template contains 'search' %}
<meta name="robots" content="noindex">
{% endif %}“

نمونه کد meta name=”robots” content=”noindex” که درون بخشفایل theme.liquid در پنل ادمین شاپيفای قرار گرفته است.
مقابله با اسپم در وردپرس (WordPress)
جلوگیری از اسپم نوار جستجو در وردپرس بسیار ساده تر است. کاربرانی که از افزونه های سئو مانند Yoast ،Rank Math و AIOSEO استفاده می کنند، نیازی به نگرانی ندارند؛ زیرا این افزونه ها به طور پیش فرض صفحات نتایج جستجو را روی حالت noindex قرار می دهند.
علاوه بر این، برخی از صفحه سازها و قالب های حرفه ای مانند قالب Divi به صورت خودکار در برابر جستجوهای اسپم، کلمات و URLهای اسپم تولید نمی کنند؛ بلکه تنها چند جمله ساده نمایش می دهند که: «جستجوی شما هیچ نتیجه ای در بر نداشت.»
نکته تیمی ما: اگر طراحی سایت فروشگاهی یا شرکتی خود را به دانش وب سپرده اید، خیالتان راحت باشد که تمامی این پیکربندی های امنیتی و سئو تکنیکال از همان روز اول به صورت استاندارد روی سایت شما پیاده سازی شده اند.
دانش عمیق درباره Robots.txt
یک سئوی موفق و موثر، نیازمند دانش گسترده و به روز است. فایل robots.txt دارای ریزه کاری هایی است که اگر نادیده گرفته شوند، کارایی آن را به شدت کاهش می دهند. بنابراین، مطالعه مستندات و مشخصات رسمی موتورهای جستجو برای به روز ماندن اطلاعات، امری کاملاً ضروری است.
نتیجه گیری
مدیریت دسترسی خزنده های موتورهای جستجو یکی از حساس ترین بخش های سئو تکنیکال است. همان طور که جان مولر اشاره کرد، یک تداخل ساده در دستورات اختصاصی و عمومی (User-Agents) می تواند باعث شود گوگل قوانین شما را نادیده بگیرد و صفحات اسپم یا نامربوط را به پایگاه داده خود اضافه کند. راهکار قطعی برای جلوگیری از ایندکس شدن صفحات نتایج جستجو، استفاده از متاتگ noindex در کدهای قالب است، نه مسدود کردن آن ها در robots.txt. اگر نگران وضعیت سلامت سایت خود هستید، یک بررسی و ممیزی (Audit) دقیق از فایل robots.txt و استراتژی ایندکس سازی سایت، ضروری است. ما در دانش وب با ارائه خدمات تخصصی سئو و طراحی سایت، می توانیم معماری تکنیکال وب سایت شما را بهینه سازی کنیم تا خیالتان از بابت هرگونه خطای ساختاری و حملات اسپم راحت باشد.