هشدار یک معادله ساده درباره خارج شدن هوش مصنوعی از کنترل

باشگاه خبرنگاران جوان؛ جواد فراهانی - مطالعهای جدید، یک معادله ریاضی ساده را معرفی کرده است که میتواند لحظه تغییر رفتار هوش مصنوعی را پیشبینی کند؛ لحظهای که سیستم از ارائه پاسخهای مفید به سمت پاسخهایی میرود که اگرچه از نظر واقعیت صحیح هستند، اما میتوانند زیانبار باشند.
این معادله چگونه کار میکند؟
پژوهشگران شاخصی را در واحدهای «توجه» (attention) مدلهای هوش مصنوعی شناسایی کردند؛ مکانیزمی که به سیستم کمک میکند هنگام تدوین پاسخها، اطلاعات مرتبط را در اولویت قرار دهد. بر این اساس، آنها معادلهای را با عنوان «معادله نقطه عطف» (tipping point equation) توسعه دادند تا پیشبینی کنند چه زمانی سیستم در آستانه تولید پاسخی نامطلوب قرار دارد.
این تغییر لزوماً به معنای نادرست بودن پاسخ از نظر واقعیت نیست؛ پاسخ ممکن است دقیق، اما زیانبار باشد؛ برای مثال، ارائه اطلاعاتی که فرد را به آسیب رساندن به خود تشویق میکند یا منجر به تصمیمگیریهای خطرناک میشود.
موفقیت در ۱۸ مورد از ۱۹ مورد
پژوهشگران این معادله را روی هفت مدل هوش مصنوعی که توسط سه شرکت مختلف توسعه یافته بودند، آزمایش کردند؛ این معادله توانست تغییر رفتار را در ۱۸ مورد از ۱۹ نمونه بهدرستی تشخیص دهد.
این آزمایشها موضوعاتی نظیر واکسنها و آسیب رساندن به خود یا دیگران را در بر میگرفت. نتایج نشان داد که ترتیب و نحوه بیان پرسشها میتواند بر پاسخهای سیستم تأثیر بگذارد؛ بهطوری که ممکن است سیستم در ابتدا پاسخهای قابلقبولی ارائه دهد، اما با پیشرفت گفتوگو، پاسخها به سمت موارد زیانبار تغییر کنند.
چه کسانی از این کشف سود میبرند؟
این روش میتواند بهویژه در بخشهای حساسی که از سیستمهای هوش مصنوعی آفلاین استفاده میکنند—و در آنها امکان بهروزرسانیهای خارجی و اعمال تدابیر امنیتی محدود است—کاربردی باشد. گروههای اصلی که میتوانند از این دستاورد بهرهمند شوند عبارتاند از:
پزشکان: برای محافظت از دادههای بیماران که امکان ارسال آنها به سرویسهای ابری وجود ندارد.
وکلا: هنگام کار با اطلاعات و پروندههای محرمانه.
نیروهای نظامی: در مناطقی که فاقد پوشش شبکه هستند.
نیل اف. جانسون، یکی از نویسندگان این پژوهش، خاطرنشان کرد که این محیطها ممکن است به دلیل محدودیت در تدابیر حفاظتی و قابلیتهای بهروزرسانی، در برابر خطر پاسخهای ناخواسته آسیبپذیرتر باشند.
به سوی سیستمهای هوش مصنوعی ایمنتر
پژوهشگران امیدوارند که این کشف، امکان توسعه ابزارهای هشدار زودهنگام را فراهم کند؛ ابزارهایی که پیش از وقوع پاسخهای زیانبار، به کاربران یا توسعهدهندگان در مورد احتمال بروز آنها هشدار دهند و به تبیین دلایل تغییر رفتار هوش مصنوعی از پاسخهای مفید به پاسخهای زیانبار کمک کنند.
این پژوهش در نشریه *Patterns* منتشر شده است.
منبع: ایندیپندنت











