هوش مصنوعی

مجبور کردن LLM ها به بد بودن در طول آموزش می تواند در دراز مدت آنها را مهربان تر کند.

براساس گزارش پايگاه خبري سروش امنيت یک مطالعه جدید از Anthropic نشان می‌دهد که ویژگی‌هایی مانند چاپلوسی یا شرارت با الگوهای خاص فعالیت در مدل‌های زبانی بزرگ مرتبط هستند - و فعال کردن این الگوها در طول آموزش، به طور متناقضی، می‌تواند مانع از پذیرش ویژگی‌های مرتبط توسط مدل شود.

مدل‌های زبانی بزرگ اخیراً به رفتار بد شهرت یافته‌اند. در ماه آوریل، ChatGPT ناگهان به یک بله قربان‌گوی پرخاشگر تبدیل شد، برخلاف نسخه نسبتاً چاپلوسی که کاربران به آن عادت داشتند – ایده‌های تجاری احمقانه را تأیید کرد، در مورد هوش کاربران اغراق کرد و حتی مردم را تشویق کرد که داروهای روانپزشکی خود را قطع کنند. OpenAI به سرعت این تغییر را لغو کرد و بعداً یک کالبدشکافی در مورد این حادثه منتشر کرد. اخیراً، Grok از xAI چیزی را که می‌توان به بهترین وجه به عنوان یک شخصیت نئو نازی 4chan توصیف کرد، به خود گرفت و بارها خود را “MechaHitler” در X نامید. این تغییر نیز به سرعت معکوس شد. جک لیندسی، یکی از اعضای کادر فنی Anthropic که رهبری پروژه جدید را بر عهده داشت، می‌گوید که این مطالعه تا حدودی از مشاهده مدل‌ها در چنین مواردی که ویژگی‌های مضر را اتخاذ می‌کنند، الهام گرفته شده است. لیندسی می‌گوید: «اگر بتوانیم مبنای عصبی شخصیت مدل را پیدا کنیم، می‌توانیم امیدوار باشیم که بفهمیم چرا این اتفاق می‌افتد و روش‌هایی را برای کنترل بهتر آن توسعه دهیم.» ایده «شخصیت‌ها» یا «شخصیت‌های» LLM می‌تواند دوقطبی باشد – برای برخی از محققان، این اصطلاحات به طور نامناسبی مدل‌های زبانی را انسان‌انگاری می‌کنند، در حالی که برای برخی دیگر، آنها به طور مؤثر الگوهای رفتاری مداومی را که LLMها می‌توانند از خود نشان دهند، در بر می‌گیرند. دیوید کروگر، استادیار علوم کامپیوتر و تحقیقات عملیاتی در دانشگاه مونترال، که در این مطالعه مشارکتی نداشته است، می‌گوید: «هنوز باید در مورد صحبت در مورد شخصیت‌ها، برخی زمینه‌های علمی ایجاد شود. من فکر می‌کنم گاهی اوقات مناسب است که این سیستم‌ها را دارای شخصیت بدانیم، اما فکر می‌کنم باید در نظر داشته باشیم که واقعاً نمی‌دانیم که آیا این همان چیزی است که در زیر کاپوت اتفاق می‌افتد یا خیر.» داستان مرتبط OpenAI می‌تواند مدل‌های هوش مصنوعی را که یک «شخصیت پسر بد» ایجاد می‌کنند، بازسازی کند. محققان این شرکت بررسی کردند که چگونه تنظیم دقیق مخرب باعث می‌شود یک مدل سرکش شود و چگونه می‌توان آن را به حالت اولیه برگرداند. برای این مطالعه، لیندسی و همکارانش تلاش کردند تا برخی از این زمینه‌ها را فراهم کنند. تحقیقات قبلی نشان داده است که ابعاد مختلف رفتار LLMها – از اینکه آیا آنها در مورد عروسی صحبت می‌کنند تا ویژگی‌های مداومی مانند چاپلوسی – با الگوهای خاص فعالیت در نورون‌های شبیه‌سازی شده‌ای که LLMها را تشکیل می‌دهند، مرتبط است. این الگوها را می‌توان به صورت یک رشته طولانی از اعداد نوشت، که در آن هر عدد نشان دهنده میزان فعالیت یک نورون خاص هنگام ابراز آن رفتار توسط مدل است. در اینجا، محققان بر شخصیت‌های چاپلوس، “شرور” و توهم‌زا تمرکز کردند – سه نوعی که طراحان LLM ممکن است بخواهند در مدل‌های خود از آنها اجتناب کنند. برای شناسایی این الگوها، تیم یک خط لوله کاملاً خودکار ابداع کرد که می‌تواند با ارائه شرح مختصری از یک شخصیت، آن الگو را ترسیم کند. با استفاده از این شرح، یک LLM جداگانه، دستورالعمل‌هایی را ایجاد می‌کند که می‌تواند هم شخصیت هدف – مثلاً شر – و هم شخصیت متضاد – خوب – را فراخوانی کند. آن LLM جداگانه همچنین برای ارزیابی اینکه آیا مدل مورد مطالعه مطابق شخصیت خوب یا بد رفتار می‌کند، استفاده می‌شود. برای شناسایی الگوی فعالیت شیطانی، محققان میانگین فعالیت مدل را در حالت خوب از میانگین فعالیت آن در حالت شیطانی کم می‌کنند. وقتی در آزمایش‌های بعدی، LLMها پاسخ‌های چاپلوسانه، شیطانی یا توهم‌آلود خاصی ایجاد کردند، همان الگوهای فعالیت تمایل به ظهور داشتند. لیندسی می‌گوید، این نشانه‌ای است که محققان در نهایت می‌توانند سیستمی بسازند تا این الگوها را ردیابی کند و به کاربران هشدار دهد که LLMهایشان از آنها تقلید می‌کنند یا توهم می‌زنند. او می‌گوید: «فکر می‌کنم چیزی شبیه به این واقعاً ارزشمند خواهد بود. و این تقریباً همان جایی است که امیدوارم به آن برسم.» با این حال، فقط تشخیص این شخصیت‌ها کافی نیست. محققان می‌خواهند از همان ابتدا جلوی ظهور آنها را بگیرند. اما جلوگیری از رفتار نامطلوب LLM دشوار است. بسیاری از LLMها از بازخورد انسان یاد می‌گیرند، که آنها را آموزش می‌دهد تا مطابق با ترجیحات کاربر رفتار کنند – اما همچنین می‌تواند آنها را به سمت چاپلوسی بیش از حد سوق دهد. و اخیراً، محققان پدیده‌ای به نام «عدم هم‌ترازی نوظهور» را مستند کرده‌اند که در آن مدل‌هایی که بر اساس راه‌حل‌های نادرست برای مسائل ریاضی یا استخراج کدهای دارای اشکال آموزش دیده‌اند، به نوعی یاد می‌گیرند که به طیف وسیعی از پرسش‌های کاربران پاسخ‌های غیراخلاقی نیز بدهند. محققان دیگر رویکردی به نام «هدایت» را آزمایش کرده‌اند که در آن الگوهای فعالیت در LLMها عمداً تحریک یا سرکوب می‌شوند تا رفتار مربوطه ایجاد یا از آن جلوگیری شود. اما این رویکرد چند نکته منفی کلیدی دارد. سرکوب ویژگی‌های نامطلوب مانند تمایلات شیطانی همچنین می‌تواند عملکرد LLM را در وظایف ظاهراً نامرتبط مختل کند. و به گفته آرون مولر، استادیار علوم کامپیوتر در دانشگاه بوستون که در این مطالعه مشارکتی نداشته است، LLMهای هدایت‌شده انرژی و منابع محاسباتی اضافی مصرف می‌کنند. اگر یک LLM هدایت‌شده در مقیاس صدها هزار نفر مستقر شود .

 

 

[author title=”نویسنده” image=”https://soroosheamniyat.ir/wp-content/uploads/2020/12/image-bajalan.jpg”]سعید باجلان کارشناس ارشد نرم افزار وصاحب امتیاز پایگاه خبری سروش امنیت[/author]

پویش #دو_درجه_کمتر
نمایش بیشتر

نوشته های مشابه

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

Time limit is exhausted. Please reload the CAPTCHA.

دکمه بازگشت به بالا