چرا هوش مصنوعی گوگل Robots.txt را نادیده میگیرد؟
اگر شما یک مدیر وبسایت، متخصص سئو یا تولیدکننده محتوا هستید، احتمالاً فایل robots.txt را خط مقدم دفاعی خود برای کنترل دسترسی رباتهای جستجوگر به وبسایتتان میدانید. این فایل ساده متنی به شما اجازه میدهد تا به رباتهایی مانند Googlebot بگویید کدام صفحات را ایندکس کنند و از کدامها دوری کنند. اما به نظر میرسد گوگل در سکوت خبری، یک استثنای مهم برای یکی از ابزارهای جدید هوش مصنوعی خود قائل شده است.
گوگل اخیراً اسناد خود را بهروزرسانی کرده و تأیید کرده است که ابزار تحقیق و نوشتار هوش مصنوعی آن، NotebookLM، دستورالعملهای موجود در فایل robots.txt را نادیده میگیرد. این خبر شاید در نگاه اول کوچک به نظر برسد، اما پیامدهای مهمی برای صاحبان وبسایتها دارد.
Google NotebookLM چیست؟
NotebookLM یک دستیار تحقیقاتی و نوشتاری مبتنی بر هوش مصنوعی است که برای کمک به کاربران در درک و کار با محتوای موجود طراحی شده است. شما میتوانید آدرس یک صفحه وب (URL)، یک فایل PDF یا یک سند گوگل داکس (Google Docs) را به آن بدهید. سپس، این ابزار محتوا را پردازش کرده و به شما اجازه میدهد تا:
- خلاصهای از محتوا را دریافت کنید.
- سوالات مشخصی در مورد متن بپرسید.
- بهطور خودکار یک نقشه ذهنی (Mind Map) از موضوعات اصلی ایجاد کنید.
- نکات کلیدی و چکیدهها را استخراج کنید.
این ابزار فوقالعاده قدرتمند است، اما نحوه دسترسی آن به محتوا، جایی است که موضوع جالب میشود.
چرا NotebookLM از Robots.txt تبعیت نمیکند؟
پاسخ در نحوه طبقهبندی این ابزار توسط گوگل نهفته است. NotebookLM جزو دستهای از ابزارها به نام “واکشیکنندههای راهاندازیشده توسط کاربر” (User-Triggered Fetchers) قرار میگیرد.
طبق اسناد رسمی گوگل:
“از آنجایی که واکشی توسط یک کاربر درخواست شده است، این واکشیکنندهها عموماً قوانین robots.txt را نادیده میگیرند.”
منطق گوگل این است: robots.txt برای مدیریت رباتهای خزندهای طراحی شده است که بهطور خودکار در حال پیمایش و ایندکس کردن وب برای موتور جستجو هستند. اما NotebookLM یک خزنده وب نیست؛ بلکه ابزاری است که از طرف یک کاربر خاص برای پردازش یک صفحه مشخص فراخوانی میشود. در واقع، این ابزار به جای گوگل، به نمایندگی از کاربر عمل میکند.
این موضوع چه معنایی برای شما دارد؟
این بدان معناست که حتی اگر شما دسترسی به یک صفحه یا بخشی از وبسایت خود را از طریق robots.txt مسدود کرده باشید، یک کاربر همچنان میتواند با استفاده از NotebookLM، آدرس آن صفحه را وارد کرده و محتوای آن را پردازش و تحلیل کند. این مسئله میتواند برای ناشرانی که میخواهند کنترل کاملی بر نحوه استفاده از محتوای خود داشته باشند، نگرانکننده باشد.
چگونه میتوان دسترسی NotebookLM را مسدود کرد؟
خوشبختانه، هنوز راهی برای کنترل وجود دارد. گوگل برای دسترسی به محتوای وبسایتها از طریق این ابزار، از یک عامل کاربر (User Agent) مشخص به نام Google-NotebookLM استفاده میکند.
این یعنی شما میتوانید دسترسی این عامل کاربر خاص را مستقیماً مسدود کنید. برای این کار چند راه وجود دارد:
- پیکربندی در سطح سرور: شما میتوانید از طریق فایل
.htaccess(در سرورهای آپاچی) یا تنظیمات فایروال برنامه وب (WAF) خود، قوانینی برای مسدود کردن تمام درخواستهایی که از طرف عامل کاربرGoogle-NotebookLMمیآیند، تعریف کنید.<IfModule mod_rewrite.c> RewriteEngine On RewriteCond %{HTTP_USER_AGENT} Google-NotebookLM [NC] RewriteRule .* - [F,L] - استفاده از پلاگینهای امنیتی: اگر از سیستمهای مدیریت محتوا مانند وردپرس استفاده میکنید، پلاگینهای امنیتی محبوبی مانند Wordfence به شما این امکان را میدهند که به سادگی یک قانون سفارشی برای مسدود کردن یک عامل کاربر خاص ایجاد کنید.
منبع خبر : گوگل وب دولووپر