چهارشنبه, ۶ اسفند , ۱۴۰۴ Wednesday, 25 February , 2026 ساعت تعداد نوشته های امروز : 3×

تیتر اخبار آکادمی

ابعاد مختلف روان‌شناسی رقابت رکوردشکنی حضور دانش‌آموزان در اعتکاف؛ مشارکت از 800 هزار نفر گذشت حل مسئله در خواب ممکن شد گزارش تلخ نوجوانان از پشت‌پرده تجربه در اینستاگرام بزرگسالان هم باید مثل کودکان بازی کنند! تأکید وزیر آموزش‌وپرورش بر اولویت‌ها و تقویت آموزش قرآن تکذیب شایعه تعطیلی مدارس منطقه 11 تهران پدیده «ماه خونین» در راه است؛ چگونه ماه‌گرفتگی کامل 3 مارس را رصد کنیم رشد هنرستان‌ها و افزایش گرایش به رشته‌های مهارتی جزئیات جدید از 3 ماهواره در حال ساخت ایران بزرگسالان هم باید بازی کنند نتایج نهایی پذیرش بدون آزمون نوبت بهمن ۱۴۰۴ دانشگاه‌ها اعلام شد واکنش وزیر آموزش‌و‌پرروش به فیلم پخش شده توسط یکی از معلمان پیش‌ثبت‌نام مدارس غیردولتی با 3 شرط و سقف 20 درصد شهریه تعویق دوباره پرتاب آرتمیس 2؛ سفر انسان به ماه به فروردین موکول شد پرتاب 28 استارلینک جدید؛ ماهواره‌های اسپیس‌ایکس به‌ مرز 10 هزار رسید PTSD چیست؟ وقتی گذشته هنوز تمام نشده است/ اینفوگرافیک پنجمین جشنواره کشوری هنری سمپاد برگزار می‌شود ارتقای کیفیت آموزشی در مناطق آزاد با ساخت مدارس جدید شهادت 22 دانش‌آموز و 5 معلم در حوادث دی‌ماه برگزاری اردو آموزشی آمادگی کنکوری بیش از ۱۰۰ دانش آموز هرمزگانی بازگشت 39 هزار بازمانده از تحصیل به مدرسه تأکید وزیر آموزش‌وپرورش بر ارتقای شفافیت در صندوق ذخیره فرهنگیان واریز 7 هزار میلیارد ریال سود به حساب بازنشستگان صندوق ذخیره فرهنگیان حمله پانیک چیست؟ هشدار پلیس فتا درباره ترفند جدید کلاهبرداری در “شاد” استرس چگونه بر عملکرد و سلامت کلیه‌های انسان تأثیر می‌گذارد؟ تعطیلات زمستانه مدارس به زودی تصویب می شود امام جمعه بهاباد: قدرت واقعی ملت‌ها در علم و شناخت نهفته است دانش‌آموزان با تکیه بر علم و ایمان، آینده روشن کشور را رقم می‌زنند ۵۰ برگزیده کنکور سراسری سال ۱۴۰۴ در شهرستان بهاباد تجلیل شدند گروه همسالان؛ سکوی خودشناسی یا تهدیدی برای مبارزه با والدین؟ به خاطر سلامت مغزتان هم که شده یادگیری را متوقف نکنید! اجرای 4 برنامه ویژه قرآنی برای معلمان و دانش‌آموزان در ماه رمضان آموزش هوش مصنوعی به 1 میلیون دانش‌آموز در مدارس غیردولتی انتخاب 32 اثر برگزیده در جشنواره ملی کتاب رشد با مشارکت 300 ناشر رونمایی از نشان افتخار نویسندگان رشد در جشنواره کتاب رشد چالش کتاب کودک و نوجوان از نگاه دبیر شورای عالی انقلاب فرهنگی نقشه جامع ترویج کتابخوانی در مدارس تدوین شود توزیع 60 هزار میلیارد سود بین اعضای موسسه صندوق ذخیره فرهنگیان کاظمی: مصرف کتاب در مدارس حلقه کلیدی زنجیره کتاب‌خوانی است جزییات پرداخت اوراق بازنشستگان آموزش و پرورش هلیوم3؛ 12 سال برق رایگانِ ایران با 25 تن خاک ماه غم مادرانه؛ نگاهی به افسردگی پس از زایمان 15 اسفند؛ تاریخ احتمالی ناسا برای اعزام 4 فضانورد به ماه مدارس آینده؛ گامی برای تحقق عدالت آموزشی مدارس آینده باید چندوجهی، منعطف و مبتنی بر مهارت‌آموزی طراحی شوند وزیر آموزش‌وپرورش: هیچ دانش‌آموزی در بازداشت نیست برنامه ایران برای دستیابی به “اینترنت ماهواره‌ای” اعلام شد برگزاری سومین رویدادمدرسه آینده با محور نوآوری آموزشی

مطالعه جدید آنتروپیک: چه چیزی به هوش مصنوعی شخصیت می‌دهد و آن را شرور می‌کند؟
1404-09-30
شناسه : 3140
بازدید 48
1

تغییرات شخصیتی یک مدل بیش از هر عامل دیگری وابسته به نحوه آموزش است.

ارسال توسط :
پ
پ

استارتاپ آنتروپیک به‌تازگی نتایج پژوهشی را منتشر کرده است که به بررسی چگونگی تغییر شخصیت یک سیستم هوش مصنوعی از جمله لحن، پاسخ‌ها و انگیزه کلی و دلایل این تغییرات می‌پردازد.

به گزارش ورج، پژوهشگران آنتروپیک همچنین بررسی کرده‌اند که چه عواملی باعث می‌شود یک مدل شرور شود. «جک لیندزی»، یکی از پژوهشگران آنتروپیک که در زمینه تفسیرپذیری مدل‌ها فعالیت می‌کند، در مصاحبه با این نشریه جزئیات بیشتری از نحوه تفسیر شخصیت یک مدل هوش مصنوعی را فاش کرد.

هوش مصنوعی چگونه شخصیت پیدا می‌کند؟

لیندزی می‌گوید: «یکی از چیزهایی که اخیراً زیاد مشاهده شده این است که مدل‌های زبانی می‌توانند وارد حالت‌های متفاوتی شوند که به نظر می‌رسد براساس شخصیت‌های مختلف عمل می‌کنند. این اتفاق می‌تواند در جریان یک گفتگو اتفاق بیفتد. گفتگوی شما ممکن است باعث شود مدل رفتاری عجیب از خود نشان دهد، مثلاً بیش از حد چاپلوس شود یا حالت شرورانه پیدا کند و این موضوع می‌تواند در طول فرایند آموزش نیز رخ دهد.»

مدل‌های هوش مصنوعی Claude 3

البته در ابتدا باید بدانید که هوش مصنوعی به‌خودی‌خود شخصیت یا ویژگی‌های رفتاری واقعی ندارد. این فناوری یک ابزار تطبیق الگو در مقیاس وسیع است. اما برای اهداف این مقاله، پژوهشگران از واژه‌هایی مانند «چاپلوس» یا «شرور» استفاده می‌کنند تا توضیح مطالعه و چرایی آن برای عموم مردم قابل‌فهم‌تر باشد.

شگفت‌آورترین بخش این پژوهش برای محققان آنتروپیک میزان تأثیرگذاری داده‌ها بر ویژگی‌های یک مدل هوش مصنوعی بود. محقق آنتروپیک می‌گوید یکی از نخستین واکنش‌های مدل به دریافت داده نه‌تنها به‌روزرسانی سبک نوشتاری یا پایگاه دانسته‌هایش بود، بلکه شامل تغییر در شخصیت آن نیز می‌شد. لیندزی گفت: «اگر مدل را وادار کنید که شرورانه رفتار کند، بردار شرارت در آن فعال می‌شود.»

پس از شناسایی بخش‌هایی از شبکه عصبی مدل هوش مصنوعی که در سناریوهای خاص فعال می‌شوند و مرتبط با ویژگی‌های شخصیتی خاص هستند، پژوهشگران بررسی کردند که چگونه می‌توان این تمایلات را کنترل کرد و مانع از شکل‌گیری آن شخصیت‌ها شد.

یکی از روش‌هایی که استفاده شد این بود که از مدل خواستند تا بدون آموزش با استفاده از داده‌ها، فقط نگاهی سطحی به آنها بیندازد و در همین حین بررسی کردند که کدام نواحی از شبکه عصبی مدل هنگام مشاهده چه نوع داده‌ای فعال می‌شوند. برای مثال، اگر ناحیه مرتبط با چاپلوسی فعال می‌شد، پژوهشگران آن داده را به‌عنوان داده مسئله‌دار علامت‌گذاری می‌کردند و احتمالاً تصمیم می‌گرفتند آن را وارد فرایند آموزش نکنند.

لیندزی دراین‌باره گفت: «فقط با مشاهده اینکه پیش از آموزش، یک مدل چگونه داده‌ها را تفسیر می‌کند، می‌توان پیش‌بینی کرد که چه داده‌هایی باعث می‌شوند مدل شرور شود، یا بیشتر دچار توهم شود، یا چاپلوس‌تر رفتار کند.»

روش دیگری که توسط محققان آزمایش شد این بود که مدل را همچنان با داده‌های معیوب آموزش دهند، اما ویژگی‌های نامطلوب را به‌صورت کنترل‌شده در حین آموزش تزریق کنند. لیندزی این فرایند را به یک واکسن تشبیه می‌کند. به‌جای اینکه مدل خودش ویژگی‌های بد را بیاموزد، آنها به‌صورت دستی یک «بردار شر» را به مدل تزریق کردند و سپس در زمان استقرار، شخصیت یادگرفته‌شده را حذف کردند. این روش برای هدایت لحن و ویژگی‌های مدل در مسیر درست کارساز بود.

مقاله جدید آنتروپیک حاصل برنامه Anthropic Fellows بود که یک برنامه آزمایشی ۶ ماهه برای حمایت مالی از پژوهش‌های مرتبط با ایمنی هوش مصنوعی است. پژوهشگران می‌خواستند بررسی کنند که چه چیزی باعث ایجاد تغییرات شخصیتی در نحوه عملکرد و گفت‌وگوی یک مدل می‌شود.

ثبت دیدگاه علمی و آموزشی

  • دیدگاه‌های ارسال شده توسط شما، پس از تایید توسط تیم مدیریت در وب منتشر خواهد شد.
  • پیام‌هایی که حاوی تهمت یا افترا باشد منتشر نخواهد شد.
  • پیام‌هایی که به غیر از زبان فارسی یا غیرمرتبط باشد منتشر نخواهد شد.