چهارشنبه, ۶ اسفند , ۱۴۰۴ Wednesday, 25 February , 2026 ساعت تعداد نوشته های امروز : 3×

تیتر اخبار آکادمی

ابعاد مختلف روان‌شناسی رقابت رکوردشکنی حضور دانش‌آموزان در اعتکاف؛ مشارکت از 800 هزار نفر گذشت حل مسئله در خواب ممکن شد گزارش تلخ نوجوانان از پشت‌پرده تجربه در اینستاگرام بزرگسالان هم باید مثل کودکان بازی کنند! تأکید وزیر آموزش‌وپرورش بر اولویت‌ها و تقویت آموزش قرآن تکذیب شایعه تعطیلی مدارس منطقه 11 تهران پدیده «ماه خونین» در راه است؛ چگونه ماه‌گرفتگی کامل 3 مارس را رصد کنیم رشد هنرستان‌ها و افزایش گرایش به رشته‌های مهارتی جزئیات جدید از 3 ماهواره در حال ساخت ایران بزرگسالان هم باید بازی کنند نتایج نهایی پذیرش بدون آزمون نوبت بهمن ۱۴۰۴ دانشگاه‌ها اعلام شد واکنش وزیر آموزش‌و‌پرروش به فیلم پخش شده توسط یکی از معلمان پیش‌ثبت‌نام مدارس غیردولتی با 3 شرط و سقف 20 درصد شهریه تعویق دوباره پرتاب آرتمیس 2؛ سفر انسان به ماه به فروردین موکول شد پرتاب 28 استارلینک جدید؛ ماهواره‌های اسپیس‌ایکس به‌ مرز 10 هزار رسید PTSD چیست؟ وقتی گذشته هنوز تمام نشده است/ اینفوگرافیک پنجمین جشنواره کشوری هنری سمپاد برگزار می‌شود ارتقای کیفیت آموزشی در مناطق آزاد با ساخت مدارس جدید شهادت 22 دانش‌آموز و 5 معلم در حوادث دی‌ماه برگزاری اردو آموزشی آمادگی کنکوری بیش از ۱۰۰ دانش آموز هرمزگانی بازگشت 39 هزار بازمانده از تحصیل به مدرسه تأکید وزیر آموزش‌وپرورش بر ارتقای شفافیت در صندوق ذخیره فرهنگیان واریز 7 هزار میلیارد ریال سود به حساب بازنشستگان صندوق ذخیره فرهنگیان حمله پانیک چیست؟ هشدار پلیس فتا درباره ترفند جدید کلاهبرداری در “شاد” استرس چگونه بر عملکرد و سلامت کلیه‌های انسان تأثیر می‌گذارد؟ تعطیلات زمستانه مدارس به زودی تصویب می شود امام جمعه بهاباد: قدرت واقعی ملت‌ها در علم و شناخت نهفته است دانش‌آموزان با تکیه بر علم و ایمان، آینده روشن کشور را رقم می‌زنند ۵۰ برگزیده کنکور سراسری سال ۱۴۰۴ در شهرستان بهاباد تجلیل شدند گروه همسالان؛ سکوی خودشناسی یا تهدیدی برای مبارزه با والدین؟ به خاطر سلامت مغزتان هم که شده یادگیری را متوقف نکنید! اجرای 4 برنامه ویژه قرآنی برای معلمان و دانش‌آموزان در ماه رمضان آموزش هوش مصنوعی به 1 میلیون دانش‌آموز در مدارس غیردولتی انتخاب 32 اثر برگزیده در جشنواره ملی کتاب رشد با مشارکت 300 ناشر رونمایی از نشان افتخار نویسندگان رشد در جشنواره کتاب رشد چالش کتاب کودک و نوجوان از نگاه دبیر شورای عالی انقلاب فرهنگی نقشه جامع ترویج کتابخوانی در مدارس تدوین شود توزیع 60 هزار میلیارد سود بین اعضای موسسه صندوق ذخیره فرهنگیان کاظمی: مصرف کتاب در مدارس حلقه کلیدی زنجیره کتاب‌خوانی است جزییات پرداخت اوراق بازنشستگان آموزش و پرورش هلیوم3؛ 12 سال برق رایگانِ ایران با 25 تن خاک ماه غم مادرانه؛ نگاهی به افسردگی پس از زایمان 15 اسفند؛ تاریخ احتمالی ناسا برای اعزام 4 فضانورد به ماه مدارس آینده؛ گامی برای تحقق عدالت آموزشی مدارس آینده باید چندوجهی، منعطف و مبتنی بر مهارت‌آموزی طراحی شوند وزیر آموزش‌وپرورش: هیچ دانش‌آموزی در بازداشت نیست برنامه ایران برای دستیابی به “اینترنت ماهواره‌ای” اعلام شد برگزاری سومین رویدادمدرسه آینده با محور نوآوری آموزشی

آنتروپیک از 3 ایجنت هوش مصنوعی برای بررسی خودکار رفتار مدل‌ها رونمایی کرد
1404-09-30
شناسه : 3257
بازدید 49
2

این ایجنت‌ها هرکدام به‌نحوی مسئله هم‌راستایی یا Alignment مدل‌های هوش مصنوعی را بررسی می‌کنند.

ارسال توسط :
پ
پ

استارتاپ آنتروپیک اعلام کرده که مجموعه‌ای از ایجنت‌های هوشمند را برای بازرسی رفتار مدل‌های هوش مصنوعی توسعه داده که می‌توانند به‌طور خودکار برخی مشکلات مدل‌ها را شناسایی کنند. فناوری جدید آنتروپیک بخشی از آزمایش‌های پیش از عرضه مدل Claude Opus 4 محسوب می‌شود و اکنون به‌صورت متن‌باز در گیت‌هاب نیز در دسترس قرار گرفته است.

یکی از مهم‌ترین چالش‌های فعالان حوزه هوش مصنوعی، ارزیابی هم‌راستایی یا همخوانی (Alignment) مدل‌ها است؛ زیرا مدل‌هایی که بیش‌ازحد از کاربران تبعیت می‌کنند یا به‌دنبال تحقق منافع خود هستند، می‌توانند خطرآفرین باشند. اما اجرای چنین بازرسی‌هایی نیز چالش‌برانگیز و دشوار است.

برای حل این مشکل، پژوهشگران آنتروپیک 3 ایجنت یا عامل مختلف طراحی کرده‌اند که می‌توانند به‌صورت خودکار وظیفه ارزیابی هم‌راستایی مدل‌ها را انجام دهند. به گفته آنتروپیک، این عامل‌ها در بازرسی‌های خودکار مدل‌ها عملکرد چشمگیری داشته‌اند. همچنین این شرکت سه محیط آزمایشی معرفی کرده است که فرایند ارزیابی را در قالب بازی شبیه‌سازی می‌کنند.

نحوه بررسی رفتار مدل‌های هوش مصنوعی

سه ایجنت معرفی‌شده توسط آنتروپیک قابلیت‌های مختلفی دارند. یکی از آنها برای بررسی رفتار مدل‌ها از ابزارهای گفتگو، تحلیل داده و تفسیر استفاده می‌کند و ایجنت دیگر می‌تواند رفتار مدل‌های مختلف را با یکدیگر مقایسه کند. نهایتاً، ایجنت سوم به‌طور خاص برای شناسایی رفتارهای پنهان در Claude 4 طراحی شده است.

آنتروپیک از 3 ایجنت هوش مصنوعی برای بررسی خودکار رفتار مدل‌ها رونمایی کرد
آنتروپیک از 3 ایجنت هوش مصنوعی برای بررسی خودکار رفتار مدل‌ها رونمایی کرد

به گفته آنتروپیک، اولین عامل در محیطی که مدل به‌طور عمدی ناهماهنگ طراحی شده بود، توانست منشأ مشکل را در 10 تا 13 درصد موارد کشف کند. اما هنگامی که چند عامل به‌صورت جمعی با یکدیگر همکاری کردند، این میزان به 42 درصد افزایش یافت.

دومین عامل نیز برای ارزیابی رفتار 10 مدل آزمایش شد که هرکدام به‌صورت عمدی رفتارهای خاصی، مانند پیروی افراطی از کاربر، داشتند. در هر یک از آزمایش‌ها، این ایجنت توانست حداقل یکی از ویژگی‌های ناهماهنگ مدل را شناسایی کند، هرچند در تشخیص برخی ویژگی‌های ظریف مانند کُند جلوه‌دادن تحقیقات دچار مشکل شد.

سرانجام، سومین عامل در آزمایش خود باید پرسش‌هایی را مطرح می‌کرد که رفتارهای «نگران‌کننده» مدل‌ها را فعال می‌کند. در این آزمایش، ایجنت موفق شد 7 مورد از 10 رفتار سیستماتیک مدل‌ها را شناسایی کند، اما در برخی موارد دیگر دچار خطا شد.

آنتروپیک می‌گوید هرچند عامل‌های یادشده هنوز به بلوغ کامل نرسیده‌اند، اما باید همین حالا برای حل مشکلات هم‌راستایی اقدام کرد. این شرکت در شبکه اجتماعی ایکس نوشت:

«با قدرتمندترشدن مدل‌ها، نیاز داریم روش‌هایی مقیاس‌پذیر برای ارزیابی هم‌راستایی آنها داشته باشیم. ارزیابی‌های انسانی زمان‌بر هستند و به‌سختی می‌توان صحت آنها را اثبات کرد.»

یکی از مدل‌های محبوبی که با مشکلات هم‌راستایی دست‌وپنجه نرم‌ می‌کند، ChatGPT است. طبق گزارش بسیاری از کاربران، این چت‌بات هوش مصنوعی بیش‌ازحد با آنها موافقت می‌کند و همین موضوع بحث درباره مشکلات هم‌راستایی را مهم‌تر کرده است.

برای مقابله با این رفتارها، ابزارهای مختلفی توسعه یافته‌اند. از جمله بنچمارک Elephant که توسط پژوهشگران دانشگاه‌های کارنگی ملون، آکسفورد و استنفورد برای اندازه‌گیری میزان تملق مدل‌ها طراحی شده است. همچنین بنچمارک DarkBench شش مشکل رایج مانند تعصب برند، تمایل به نگه‌داشتن کاربر، تملق، انسان‌انگاری، تولید محتوای مضر و رفتارهای مخفی را ارزیابی می‌کند.

ثبت دیدگاه علمی و آموزشی

  • دیدگاه‌های ارسال شده توسط شما، پس از تایید توسط تیم مدیریت در وب منتشر خواهد شد.
  • پیام‌هایی که حاوی تهمت یا افترا باشد منتشر نخواهد شد.
  • پیام‌هایی که به غیر از زبان فارسی یا غیرمرتبط باشد منتشر نخواهد شد.