سه شنبه, ۱۰ شهریور , ۱۴۰۵ Tuesday, 1 September , 2026 ساعت تعداد نوشته های امروز : 0×

تیتر اخبار آکادمی

چرا ذهنمان خاطرات تلخ را بیش از خاطرات خوش تکرار می‌کند؟ علت شباهت زن و شوهرها پس از ازدواج چیست؟ تلسکوپ 4 میلیارد دلاری «رومنِ» ناسا تا لحظاتی دیگر پرتاب می‌شود تقویم رویدادهای روانشناسی همراه با آشنایی با معروفترین روانشناسان جهان در یک جدول نگاه روانشناسی و تربیتی به نقش پیامبر اسلام در تعلیم و تربیت و در الگودهی به کودکان ۲۰ مرکز سلامت روان جامعه‌نگر افتتاح شد مهار اضطراب و نشخوار فکری شبانه با تکنیک‌های شناختی – رفتاری آشنایی با مهمترین روانشناسان جهان در یک جدول آموزش فراگیر هسته اصلی آموزش و پرورش استثنایی است ابداع روبات‌هایی که در مجاورت نور تا ابد می‌جهند روزهای انتظار نتایج کنکور؛ رفتار درست والدین چیست فرسودگی شغلی فقط به دلیل زیاد کار کردن نیست!/ با این تکنیک ها انرژی خود را بازیابی کنید مادر شاغل نباید مدیر و مجری تمام جزئیات زندگی خانواده باشد نگرانی هایی که به این شکل باشند طبیعی نیستند/ وقتی مغز نمی‌تواند خاموش شود چگونگی کشف و شناسایی دانش‌آموزان تیزهوش در جهان ذهن شلوغ خود را روی کاغذ خالی کنید/ از کجا بنویسیم؟ بعد از یک اتفاق سخت با این تکنیک ها دوباره سرپا شوید نوشتن، حالم را بهتر می‌کند مهم ترین نکات درباره اختلالات شخصیت/ 5 گام برای شناخت الگوهای پایدار رفتاری و هیجانی دلسوزی کردن با شفقت ورزی متفاوت است/ مولفه های کلیدی برای شفقت ورزی در بحران ها درآمدی بر امنیت روانی و شالوده‌های آن در دوران کودکی پیوند میان روانشناسی و باورهای دینی کاظمی: مأموریت و ساختار نهضت سوادآموزی باید بازنگری شود غربالگری هوشمند آفلاتوکسین با سرعت ۱۰۰ فریم بر ثانیه پایان المپیک ربات‌های انسان‌نما/ از شکست انسان تا آزمون هوش تجسم یافته خیام و پایا؛ چشم تیزبین ایران برای پایش زمین و توسعه ملی پذیرش برگزیدگان المپیادهای جغرافیا و علوم زمین بدون کنکور ابلاغ شد بررسی علمی علت اختلاف بین روان‌شناسان و روان‌پزشکان در جهان معاشرت و ارتباطات اجتماعی؛ نسخه‌ای برای پیری سالم‌تر مغز علت فرار کودکان و نوجوانان از منزل چیست؟ چگونه توانستم میزان اضطراب جدایی دانش آموزان کلاس اول را کاهش دهم؟ دستگیری 84 متخلف و کلاهبردار کنکور سراسری توسط پلیس فتا المپیک ربات‌ها در چین؛ از شکست رکوردهای انسان تا آزمون توانایی مهارت تقلب کنکوری‌ها زیر تیغ قانون؛ از جریمه تا محرومیت مطالعه‌ای درباره بیماری موکنی! مهمترین رکوردهای المپیک رباتهای انسان‌نما/ از کارگری تا مسابقات ورزشی از سفیر تا سریر؛ مسیر تکامل پرتابگرهای ایرانی خاطرات فراموش‌شده چگونه بازمی‌گردند؟! عوارض سرکوب احساسات؛ از هجوم افکار در نیمه‌شب تا اضطراب بی‌دلیل المپیک ربات‌ها در چین/ از شکست رکورد سرعت دویدن تا مسابقه تنیس ربات انسان‌نما سوار بر اسب رباتی شد عوارض سرکوب احساسات روی بدن و روان شما؛ از از هجوم افکار در نیمه‌شب تا اضطراب بی‌دلیل درمان متمرکز بر تروما برای افراد دارای روان‌پریشی و PTSD تأثیر بازی علمی بر فعال شدن نیم کره راست مغز و ماندگاری بیشتر مطالب در حافظه رونمایی از ویلچر برقی خودران در دانشگاه امیرکبیر/نوآوری در دل محدودیت فناوری کالیبراسیون تجهیزات ناوبری هواپیما و کشتی بومی‌سازی شد سیاستگذاری اینوتکس و المپیک فناوری با تمرکز بر پیوند فناوری و سرمایه زندگی را به کنکور گره نزنید کارگاه‌های کاربردی رایگان برای اعضای سازمان نظام روانشناسی برگزار می‌شود علت سکوت مردان در مقابل خشونت خانگی همسران‌شان چیست؟

آنتروپیک از 3 ایجنت هوش مصنوعی برای بررسی خودکار رفتار مدل‌ها رونمایی کرد
1404-09-30
شناسه : 3257
بازدید 221
27

این ایجنت‌ها هرکدام به‌نحوی مسئله هم‌راستایی یا Alignment مدل‌های هوش مصنوعی را بررسی می‌کنند.

ارسال توسط :
پ
پ

استارتاپ آنتروپیک اعلام کرده که مجموعه‌ای از ایجنت‌های هوشمند را برای بازرسی رفتار مدل‌های هوش مصنوعی توسعه داده که می‌توانند به‌طور خودکار برخی مشکلات مدل‌ها را شناسایی کنند. فناوری جدید آنتروپیک بخشی از آزمایش‌های پیش از عرضه مدل Claude Opus 4 محسوب می‌شود و اکنون به‌صورت متن‌باز در گیت‌هاب نیز در دسترس قرار گرفته است.

یکی از مهم‌ترین چالش‌های فعالان حوزه هوش مصنوعی، ارزیابی هم‌راستایی یا همخوانی (Alignment) مدل‌ها است؛ زیرا مدل‌هایی که بیش‌ازحد از کاربران تبعیت می‌کنند یا به‌دنبال تحقق منافع خود هستند، می‌توانند خطرآفرین باشند. اما اجرای چنین بازرسی‌هایی نیز چالش‌برانگیز و دشوار است.

برای حل این مشکل، پژوهشگران آنتروپیک 3 ایجنت یا عامل مختلف طراحی کرده‌اند که می‌توانند به‌صورت خودکار وظیفه ارزیابی هم‌راستایی مدل‌ها را انجام دهند. به گفته آنتروپیک، این عامل‌ها در بازرسی‌های خودکار مدل‌ها عملکرد چشمگیری داشته‌اند. همچنین این شرکت سه محیط آزمایشی معرفی کرده است که فرایند ارزیابی را در قالب بازی شبیه‌سازی می‌کنند.

نحوه بررسی رفتار مدل‌های هوش مصنوعی

سه ایجنت معرفی‌شده توسط آنتروپیک قابلیت‌های مختلفی دارند. یکی از آنها برای بررسی رفتار مدل‌ها از ابزارهای گفتگو، تحلیل داده و تفسیر استفاده می‌کند و ایجنت دیگر می‌تواند رفتار مدل‌های مختلف را با یکدیگر مقایسه کند. نهایتاً، ایجنت سوم به‌طور خاص برای شناسایی رفتارهای پنهان در Claude 4 طراحی شده است.

آنتروپیک از 3 ایجنت هوش مصنوعی برای بررسی خودکار رفتار مدل‌ها رونمایی کرد
آنتروپیک از 3 ایجنت هوش مصنوعی برای بررسی خودکار رفتار مدل‌ها رونمایی کرد

به گفته آنتروپیک، اولین عامل در محیطی که مدل به‌طور عمدی ناهماهنگ طراحی شده بود، توانست منشأ مشکل را در 10 تا 13 درصد موارد کشف کند. اما هنگامی که چند عامل به‌صورت جمعی با یکدیگر همکاری کردند، این میزان به 42 درصد افزایش یافت.

دومین عامل نیز برای ارزیابی رفتار 10 مدل آزمایش شد که هرکدام به‌صورت عمدی رفتارهای خاصی، مانند پیروی افراطی از کاربر، داشتند. در هر یک از آزمایش‌ها، این ایجنت توانست حداقل یکی از ویژگی‌های ناهماهنگ مدل را شناسایی کند، هرچند در تشخیص برخی ویژگی‌های ظریف مانند کُند جلوه‌دادن تحقیقات دچار مشکل شد.

سرانجام، سومین عامل در آزمایش خود باید پرسش‌هایی را مطرح می‌کرد که رفتارهای «نگران‌کننده» مدل‌ها را فعال می‌کند. در این آزمایش، ایجنت موفق شد 7 مورد از 10 رفتار سیستماتیک مدل‌ها را شناسایی کند، اما در برخی موارد دیگر دچار خطا شد.

آنتروپیک می‌گوید هرچند عامل‌های یادشده هنوز به بلوغ کامل نرسیده‌اند، اما باید همین حالا برای حل مشکلات هم‌راستایی اقدام کرد. این شرکت در شبکه اجتماعی ایکس نوشت:

«با قدرتمندترشدن مدل‌ها، نیاز داریم روش‌هایی مقیاس‌پذیر برای ارزیابی هم‌راستایی آنها داشته باشیم. ارزیابی‌های انسانی زمان‌بر هستند و به‌سختی می‌توان صحت آنها را اثبات کرد.»

یکی از مدل‌های محبوبی که با مشکلات هم‌راستایی دست‌وپنجه نرم‌ می‌کند، ChatGPT است. طبق گزارش بسیاری از کاربران، این چت‌بات هوش مصنوعی بیش‌ازحد با آنها موافقت می‌کند و همین موضوع بحث درباره مشکلات هم‌راستایی را مهم‌تر کرده است.

برای مقابله با این رفتارها، ابزارهای مختلفی توسعه یافته‌اند. از جمله بنچمارک Elephant که توسط پژوهشگران دانشگاه‌های کارنگی ملون، آکسفورد و استنفورد برای اندازه‌گیری میزان تملق مدل‌ها طراحی شده است. همچنین بنچمارک DarkBench شش مشکل رایج مانند تعصب برند، تمایل به نگه‌داشتن کاربر، تملق، انسان‌انگاری، تولید محتوای مضر و رفتارهای مخفی را ارزیابی می‌کند.

ثبت دیدگاه علمی و آموزشی

  • دیدگاه‌های ارسال شده توسط شما، پس از تایید توسط تیم مدیریت در وب منتشر خواهد شد.
  • پیام‌هایی که حاوی تهمت یا افترا باشد منتشر نخواهد شد.
  • پیام‌هایی که به غیر از زبان فارسی یا غیرمرتبط باشد منتشر نخواهد شد.