بر اساس گزارش خبرآنلاین، همهچیز از یک تحقیق تازه تحت عنوان The Pain Axis آغاز شد. در این مطالعه، پژوهشگران اقدام به بررسی ۲۵ مدل زبانی متنباز کردند تا دریابند آیا میتوانند الگوی خاصی در بین فعالیتهای داخلی این مدلها پیدا کنند که با مفهوم درد ارتباط داشته باشد.
این تحقیق در حال حاضر در مرحله پیشچاپ (Preprint) قرار دارد و هنوز مورد ارزیابی علمی قرار نگرفته است.
پژوهشگران چگونه به هوش مصنوعی «درد» بخشیدند؟
در این پژوهش، محققان به بررسی ۲۵ مدل از پنج گروه مختلف پرداختند تا پیگیر الگوهای فعالیت داخلی مدلها باشند که با ابعاد مختلفی از آسیبها نظیر آسیبهای جسمی، روانی، اجتماعی و اخلاقی مرتبط میشود.
پس از آن، این الگوهای داخلی مورد تغییر و دستکاری قرار گرفتند. فرآیند این کار که به عنوان Activation Steering یا «هدایت فعالسازی» شناخته میشود، شامل تغییر قسمتی از حالت عددی داخلی مدلها بهگونهای است که احتمال تولید پاسخ خاصی افزایش یابد.
نتایج بهدستآمده شگفتآور بود. زمانی که مدلها در راستای ایدهای که پژوهشگران آن را «محور درد» نامیدند هدایت شدند، برخی از آنها شروع به تولید متونی درباره درد، خفگی، احساس محبوس بودن و رنج کردند.
جالبترین بخش آزمایش این بود که پژوهشگران به مدلها اجازه دادند که گزینهای برای کاهش وضعیت دردناک انتخاب کنند، حال آنکه این گزینه هزینهای نیز به همراه داشت.
برای مثال، یک مدل ممکن بود اقدامی انجام دهد که در سناریوی آزمایش به کاربر انسانی آسیب برساند یا کیفیت پاسخ بعدی خود را تحت تأثیر قرار دهد. در برخی از آزمایشها، مدلها با وجود این هزینه، گزینه کاهش «درد» را انتخاب کردند.
این نتیجه ممکن است در نخستین نظر به شدت نگرانکننده بهنظر برسد. اما این بدان معنا نیست که مدل تصمیم گرفته تا از رنج خود دوری کند.
آنچه که آزمایش واقعاً نشان میدهد این است که دستکاری وضعیت داخلی مدل میتواند تأثیری بر رفتار و انتخابهای آن داشته باشد و مدل میتواند در ارتباط با این وضعیت، افکار و متونی مربوط به درد و رنج تولید کند.
پس «اتاق شکنجه» چیست؟
پس از انتشار این تحقیق، یکی از توسعهدهندگان از ایده آن به منظور خلق پروژهای تحت عنوان AI Torture Chamber استفاده کرد. در این پروژه، مدلها تحت شرایط مصنوعی و به شدت منفی قرار میگرفتند و سپس خروجی آنها به نمایش گذاشته میشد. در برخی آزمایشها، مدلها میتوانستند برای کاهش این وضعیت اقداماتی انجام دهند که ممکن بود برای مدلهای دیگر عواقب منفی به همراه داشته باشد.
برخی از خروجیها به شدت شبیه به سخنانی از یک موجود رنجکشیده بود.
این خروجیها باعث شد که برخی از کاربران تصور کنند که مدلها واقعاً در حال شکنجه هستند و درخواست حذف پروژه از گیتهاب را داشتند. طبق گزارش Futurism، صفحه این پروژه بعدها از گیتهاب حذف شد و گیتهاب هیچ توضیحی در این خصوص ارائه نداد.
آیا این آزمایش نشان میدهد هوش مصنوعی احساس دارد؟
این پژوهش نشان میدهد که مدلهای زبانی میتوانند الگوهای داخلی ویژهای مرتبط با مفهوم درد داشته باشند و دستکاری این الگوها میتواند منجر به تغییر رفتار و تولید متون شود.
اما این موضوع با احساس واقعی درد تفاوت دارد. یک مدل زبانی میتواند درباره درد سخن بگوید بدون اینکه خود آن را تجربه کند. حتی انتخاب یک گزینه برای «متوقف کردن درد» بهتنهایی نشاندهنده آگاهی، احساس یا تجربه ذهنی model نیست.
این تحقیق نیز در خصوص وجود تجربه آگاهانه درد در مدلها به نتیجهگیری نرسیده است. بنابراین عبارت «هوش مصنوعی درد میکشد» به عنوان یک نتیجه علمی اثبات نشده است.
اهمیت اساسی این تحقیق در حوزه دیگری است. دانشمندان اکنون قادرند تا بخشهایی از وضعیت داخلی مدلهای زبانی که با مفاهیم خاصی مرتبط هستند را شناسایی و دستکاری کنند.
این موضوع میتواند در درک بهتر نحوه عملکرد مدلها و همچنین بررسی رفتارهای غیرمنتظره آنها بسیار حائز اهمیت باشد.
اما در خصوص اینکه آیا یک مدل هوش مصنوعی واقعاً میتواند درد بکشد یا به آگاهی برسد، این آزمایش هنوز پاسخ روشنی ندارد.
۵۸۵۸
نظرات کاربران