آموزه های سئو

واترمارک هوش مصنوعی آنتروپیک چیست و چگونه دور زده می شود؟

سیستم واترمارک متنی پنهان هوش مصنوعی آنتروپیک کلود و الگوریتم‌های رمزنگاری

شرکت آنتروپیک (سازنده هوش مصنوعی Claude) اخیراً جزئیات نحوه کارکرد واترمارک (Watermark) متنی خود را اعلام کرده است. این توضیحات تقریباً تمامی گمانه زنی های قبلی درباره استفاده از روشی مشابه با سیستم MirrorMark را تایید می کند. درست مانند MirrorMark، این واترمارک در واقع یک «الگوی تصادفی» است که رفتار مدل زبانی بزرگ (LLM) را در هنگام تولید متن منعکس می کند و تغییر می دهد.

واترمارک هوش مصنوعی چگونه کار می کند؟

برخلاف ادعای برخی از اینفلوئنسرهای حوزه هوش مصنوعی، هیچ کاراکتر مخفی یا کد یونیکد (Unicode) خاصی در لابه لای متن تولیدشده پنهان نمی شود. بنابراین، واترمارک چیزی نیست که بتوانید آن را در یک فایل متنی کپی و پیست کنید تا متوجه حضور آن شوید یا بتوانید به راحتی آن را پاک کنید.

همچنین، این واترمارک ربطی به استفاده بیش از حد از علائم نگارشی مانند خط تیره بلند (em dash) یا الگوهای نوشتاری رایج هوش مصنوعی (مانند ساختار “اینطور نیست، بلکه اینطور است”) ندارد. سیستم به دنبال بررسی احتمال و سبک نگارش هوش مصنوعی نیست؛ بلکه دقیقاً به دنبال یک «الگوی واترمارک خاص و رمزنگاری شده» می گردد.

مدل های زبانی در حالت عادی، کلمه بعدی را بر اساس احتمالات و با استفاده از یک مکانیزم تصادفی سازی (Randomness) انتخاب می کنند. همیشه محتمل ترین کلمه انتخاب نمی شود، بلکه عنصری از تصادف در کار است تا متن طبیعی تر جلوه کند. سیستم هایی مانند SynthID از همین ویژگی استفاده می کنند تا الگویی خاص را که توسط یک «کلید واترمارک» و با توجه به کلمات قبلی دیکته می شود، روی این انتخاب های تصادفی اعمال کنند. از آنجایی که این نوع واترمارک تنها روند انتخاب تصادفی کلمات را به صورت نامحسوس تغییر می دهد، متن نهایی با متون معمولی هیچ تفاوتی ندارد و بدون داشتن کلید رمزگشایی، تشخیص آن برای کاربران غیرممکن است.

ما در تیم تولید محتوا و سئو دانش وب همواره به مشتریان خود تاکید می کنیم که گوگل به دنبال محتوای باکیفیت و اصیل است. کپی پیست کردن مستقیم از ابزارهایی مانند Claude یا ChatGPT به دلیل وجود همین الگوهای پنهان می تواند در آینده ریسک های بزرگی برای سئوی سایت شما به همراه داشته باشد.

آنتروپیک در این باره توضیح می دهد:

«این الگو برای خواننده غیرقابل تشخیص است، اما برای هر کسی که کلید رمزگشایی آن را در اختیار داشته باشد، کاملاً قابل شناسایی خواهد بود. وقتی از واترمارک استفاده می شود، انتخاب کلمات همچنان تصادفی است، اما منبع این تصادفی بودن تغییر می کند. به جای استفاده از یک تولیدکننده اعداد تصادفی معمولی برای انتخاب کلمه بعدی، سیستمِ واترمارک از یک کلید اختصاصی و چند کلمه پیشین استفاده می کند تا تصمیم بگیرد مدل باید چه کلمه ای را برگزیند. یعنی کلماتی که کلود انتخاب می کند هنوز هم تصادفی هستند، اما حالا شخص ارزیاب می تواند توالی کلمات را بررسی کند و ببیند آیا این توالی با انتخاب هایی که کلود در صورت استفاده از کلید انجام می داد، همخوانی دارد یا خیر.»

نحوه عملکرد الگوریتم SynthID و کلید رمزنگاری در انتخاب احتمالی کلمات هوش مصنوعی

دیاگرام فنی نشان دهنده نحوه اعمال کلید رمزنگاری بر توالی و احتمالات انتخاب کلمات بعدی توسط مدل LLM.

نسخه ای پیشرفته از SynthID

در این اطلاعیه آمده است که واترمارک جدید، نسخه ای از رویکرد SynthID-Text است که در سال ۲۰۲۴ توسط شرکت گوگل دیپ مایند (Google DeepMind) توسعه یافت. توجه کنید که این دقیقاً همان سیستم قدیمی نیست، بلکه نسخه ای به روزشده از آن است. تکنولوژی این نوع واترمارک ها در طی این دو سال (تا سال ۲۰۲۶) پیشرفت چشمگیری داشته است.

در متن اطلاعیه می خوانیم:

«واترمارک متنی کلود نسخه ای از روش SynthID-Text است که گوگل دیپ مایند مقاله آن را در سال ۲۰۲۴ در نشریه Nature منتشر کرد. این سیستم متعلق به خانواده ای از الگوریتم هاست که ایده اولیه آن ها در سال ۲۰۲۲ توسط اسکات آرونسون مطرح شد. تمامی این روش ها از یک اصل طراحی مشترک پیروی می کنند: واترمارک تنها منبعِ تصادفیِ انتخابِ کلمات را تغییر می دهد.»

آیا می توان واترمارک آنتروپیک را دور زد؟

پاسخ کوتاه این است: بله، با بازنویسی متن (Paraphrasing) می توان آن را دور زد. اما طبق گفته آنتروپیک، ویرایش های سطحی و جزئی به احتمال زیاد نمی توانند واترمارک را از بین ببرند.

بر اساس بیانیه آنتروپیک:

«آیا نمی توان متن را ویرایش کرد تا واترمارک دور زده شود؟ تا حدودی بله. ویرایش های سبک احتمالاً واترمارک را به طور کامل حذف نمی کنند؛ اما یک بازنویسی کامل که در آن تک تک کلمات جایگزین شوند، آن را از بین می برد. البته در حالت دوم، جای بحث دارد که آیا اصلاً می توان آن متن را همچنان یک “متن تولیدشده توسط هوش مصنوعی” نامید یا خیر.»

الگوریتم های واترمارک به دنبال توالی کلماتی هستند که در زمان تولید متن در آن گنجانده شده اند. بنابراین اگر بخش زیادی از یک سند را بازنویسی یا ویرایش کنید، در واقع همان کلماتی که نقش واترمارک را ایفا می کنند، پاک خواهند شد.

به همین دلیل است که در خدمات طراحی سایت و دیجیتال مارکتینگ دانش وب، ما از هوش مصنوعی صرفاً به عنوان یک دستیار برای ایده پردازی و تسریع امور استفاده می کنیم. متون نهایی همواره توسط متخصصان و نویسندگان انسانی ما بازنویسی، ویرایش و غنی سازی می شوند تا هم ارزش افزوده ای برای کاربر ایرانی داشته باشند و هم به راحتی از سد الگوریتم های تشخیص هوش مصنوعی گوگل و سایر ابزارها عبور کنند.

بازنویسی کامل متن تولیدشده توسط هوش مصنوعی برای حذف الگوی واترمارک و بهبود سئو

تصویر مفهومی نشان دهنده فرایند بازنویسی محتوای هوش مصنوعی توسط نویسنده انسانی و تبدیل آن به متنی اصیل.

این سیستم دقیقاً همان SynthID قدیمی نیست

همان طور که گفته شد، SynthID در سال ۲۰۲۴ معرفی شد و تکنولوژی آن در دو سال گذشته به بلوغ بیشتری رسیده است.

نسخه جدیدی از رویکرد SynthID که با نام MirrorMark شناخته می شود، با پخش کردن واترمارک در سراسر متنِ تولیدشده و استفاده از کلمات اطراف به عنوان زمینه ای برای تعیین محل قرارگیری هر بخش، سیستم را توسعه داده است. این کار باعث می شود متن در برابر ویرایش مقاومت بسیار بالاتری داشته باشد.

سیستم اولیه SynthID یک واترمارک «صفر-بیتی» (Zero-bit) بود؛ به این معنی که تنها می توانست به این سوال پاسخ دهد: «آیا واترمارک وجود دارد یا خیر؟» (خروجی صفر یا یک). اما سیستم هایی مانند MirrorMark می توانند چندین بیت اطلاعات را رمزگذاری کنند و اساساً واترمارک را در تمام تار و پود متن پخش کنند.

در اینجا به قابلیت های یک نسخه ۲۰۲۶ مانند MirrorMark اشاره می کنیم:

  • رمزگذاری چندبیتی (Multi-bit encoding): امکان ذخیره دیتای بیشتر در متن را فراهم می کند.
  • انعکاس تصادفی بودن: این سیستم دقیقاً رفتار تصادفیِ تولیدِ متنِ مدل زبانی را شبیه سازی می کند.
  • استفاده از زمان بند CABS: (زمان بند متعادل مبتنی بر بستر متن) این الگوریتم تصمیم می گیرد که بخش های مختلف واترمارک دقیقاً در کجای متن جاسازی شوند.
  • مقاومت در برابر ویرایش: به طور ویژه طراحی شده تا در برابر تغییرات متن (مانند واترمارک آنتروپیک که در برابر ویرایش سطحی مقاوم است) مقاومت کند.

البته من (نویسنده اصلی) ادعا نمی کنم که آنتروپیک دقیقاً از روی MirrorMark کپی کرده است، بلکه می گویم پیش از آنکه تصور کنید با همان الگوریتم دو سال پیشِ SynthID روبه رو هستید، بهتر است درک کنید که نسخه های ۲۰۲۶ تا چه اندازه پیشرفته تر شده اند.

خدمات طراحی سایت

نکات کلیدی و مهم از افشاگری آنتروپیک درباره واترمارک

در اینجا خلاصه ای از مهم ترین نکات مربوط به اطلاعیه آنتروپیک را مرور می کنیم:

  • کلود (Claude) خروجی های متنی آینده خود را واترمارک خواهد کرد: آنتروپیک اعلام کرده است که مدل های آینده کلود، برای پیروی از قانون هوش مصنوعی اتحادیه اروپا (EU AI Act)، متون را همراه با واترمارک تولید خواهند کرد.
  • واترمارک یک الگو است که در حین تولید متن ساخته می شود: خبری از یونیکد، متادیتا (فراداده) یا کاراکترهای پنهان نیست. واترمارک مستقیماً از طریق خودِ فرآیند انتخاب کلمات شکل می گیرد.
  • واترمارک کلود نسخه ای از SynthID-Text است: آنتروپیک تایید می کند که روش آن ها بر پایه رویکرد سال ۲۰۲۴ گوگل دیپ مایند توسعه یافته است.
  • این سیستم منبع تصادفیِ انتخاب کلمات را تغییر می دهد: کلود همچنان از بین کلمات منطقی دست به انتخاب تصادفی می زند، اما کلید واترمارک و کلمات قبلی هستند که این تصادفی بودن را کنترل می کنند.
  • الگویی قابل تشخیص در کلمات کلود ایجاد می شود: فردی که کلید واترمارک را در اختیار دارد، می تواند توالی کلمات را بررسی کرده و تایید کند که آیا با الگوریتم کلود همخوانی دارد یا خیر.
  • هیچ چیزی به ظاهر متن اضافه نمی شود: آنتروپیک صراحتاً اعلام کرده است که هیچ کاراکتر مخفی، توکن اضافی یا تغییر قابل مشاهده ای در متن اعمال نمی شود.
  • متن واترمارک دار از متن معمولی قابل تشخیص نیست: به گفته آنتروپیک، این سیستم هیچ تاثیر منفی بر کیفیت متن یا محتوای تولیدشده ندارد.
  • واترمارک باعث انتخاب کلمات عجیب نمی شود: آنتروپیک ادعا می کند که این سیستم، کلود را به سمت استفاده از کلمات خاص یا نامتعارف سوق نمی دهد.
  • تعداد کلمات کمتر، تشخیص را دشوارتر می کند: تشخیص واترمارک در نمونه متن های کوتاه عملکرد ضعیفی دارد و روی متون طولانی تر بسیار بهتر جواب می دهد.
  • واترمارک در متون علمی و فکت محور ضعیف تر عمل می کند: زمانی که هوش مصنوعی به دلیل محدودیت های ناشی از بیان حقایق و فکت ها، کلمات کمتری برای انتخاب جایگزین داشته باشد، قابلیت اطمینان واترمارک کاهش می یابد.
  • واترمارک در فرآیند ویرایش و غلط گیری ضعیف است: آنتروپیک می گوید اگر از هوش مصنوعی بخواهید «فقط گرامر و نشانه گذاری متن را اصلاح کند و به چیزی دست نزند»، واترمارک تنها می تواند در همان چند کلمه اصلاح شده پنهان شود که احتمالاً برای شناسایی شدن کافی نخواهد بود.
  • رابط برنامه نویسی (API) تشخیص واترمارک به زودی منتشر می شود.
  • فایل های تصویری مانند JPG، PNG و SVG از متادیتای C2PA استفاده خواهند کرد.
  • واترمارک کردن متن، هیچ تاثیری روی سرعت پاسخگویی هوش مصنوعی ندارد و هزینه اضافه ای بابت توکن ها برای کاربر ایجاد نمی کند.
الزامات قانون هوش مصنوعی اتحادیه اروپا و استاندارد C2PA برای متادیتا و API واترمارک

اینفوگرافیک خلاصه کننده الزامات قانون EU AI Act، متادیتای تصاویر C2PA و API شناسایی متن هوش مصنوعی.

نتیجه گیری

با پیشرفت تکنولوژی و تکامل مدل های زبانی در سال ۲۰۲۶، روش های تشخیص محتوای ماشینی نیز از تحلیل های ساده نگارشی به سیستم های پیچیده رمزنگاری و واترمارک های نامحسوس ارتقا یافته اند. اقدام آنتروپیک برای اعمال واترمارک بر اساس استانداردهای اتحادیه اروپا، نشان می دهد که به زودی پایش محتوای هوش مصنوعی توسط موتورهای جستجو (به ویژه گوگل) و پلتفرم های انتشار محتوا بسیار دقیق تر خواهد شد. برای صاحبان کسب وکارها و وب مستران، پیام این تغییرات روشن است: تولید محتوای کاملاً ماشینی بدون نظارت و ویرایش انسانی، به راحتی قابل شناسایی است و می تواند استراتژی سئوی شما را نابود کند.

برای موفقیت در فضای دیجیتال، ترکیب سرعت هوش مصنوعی با خلاقیت و تخصص انسان ضروری است. تیم متخصصین دانش وب آماده است تا با ارائه خدمات حرفه ای طراحی سایت و تدوین استراتژی های سئوی مبتنی بر محتوای اصیل و کاربرپسند، مسیر رشد و دیده شدن کسب وکار شما را در نتایج جستجو تضمین کند.

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *