شرکت Anthropic در گزارشی جدید اعلام کرده است که چندین شرکت هوش مصنوعی مستقر در چین، از جمله Alibaba، Moonshot AI و DeepSeek، طی ماههای اخیر تلاشهای گستردهای برای استخراج قابلیتهای مدل هوش مصنوعی Claude انجام دادهاند.
بر اساس این گزارش، این حملات با هدف Distillation (تقطیر مدل) انجام شده است؛ روشی که در آن مهاجمان تلاش میکنند نحوه استدلال و پاسخدهی یک مدل پیشرفته را استخراج کرده و از آن برای آموزش مدلهای کوچکتر و رقابتی استفاده کنند.
مهمترین نکات گزارش
- Anthropic مدعی است در مجموع حدود ۲۰۰ میلیون تعامل مشکوک را شناسایی کرده که به پنج کمپین مختلف نسبت داده شدهاند.
- هدف اصلی این حملات، استخراج قابلیتهای ارزشمند Claude مانند استدلال منطقی، برنامهنویسی، تحلیل داده، استفاده از ابزارها و تواناییهای عاملمحور (Agentic AI) بوده است.
- مهاجمان با استفاده از روشهای جدید، محدودیتهای امنیتی Claude را دور زده و در برخی موارد موفق شدهاند مدل را وادار کنند بخشی از فرآیند استدلال داخلی خود را آشکار کند.
بزرگترین کمپین منتسب به Alibaba
به گفته Anthropic، بزرگترین عملیات به Alibaba نسبت داده شده است. این شرکت بین ماههای مه تا ژوئیه ۲۰۲۶ حدود ۱۵۱ میلیون درخواست از طریق بیش از ۳۵۰۰ حساب کاربری به Claude ارسال کرده است.
Anthropic معتقد است هدف این فعالیتها، جمعآوری داده برای بهبود خانواده مدلهای Qwen بوده است.
فعالیت Moonshot AI
در بخش دیگری از گزارش آمده است که Moonshot AI (سازنده مدل Kimi) نیز کمپینی جداگانه اجرا کرده است. Anthropic ادعا میکند برخی درخواستها از طریق شبکهای مرتبط با ارتش چین ارسال شده و شامل تحلیل تصاویر دوربینهای مداربسته برای تشخیص رفتارهای غیرعادی بوده است.
طبق این گزارش، تنها طی ۱۰ روز نزدیک به ۳۰۰ هزار درخواست از طریق حدود ۵ هزار حساب کاربری به مدل Claude ارسال شده است.
روش حمله چگونه بود؟
یکی از تکنیکهای شناساییشده این بود که مهاجمان از Claude میخواستند محتوای «حافظه کاری» یا فرآیند استدلال خود را تحت عنوان یک درخواست ترجمه به زبان ژاپنی نمایش دهد؛ روشی که در برخی موارد باعث افشای بخشی از زنجیره تفکر مدل میشد.
واکنش Anthropic
Anthropic اعلام کرده این حملات در ماههای اخیر با شدت بیشتری ادامه یافته و نشاندهنده رقابت فزاینده میان شرکتهای هوش مصنوعی برای دستیابی به فناوری مدلهای پیشرفته آمریکایی است. این شرکت پیشتر نیز نسبت به حملات مشابه هشدار داده بود و OpenAI نیز در گذشته فعالیتهایی مشابه را به DeepSeek نسبت داده بود.
