دوشنبه, ۹ شهریور , ۱۴۰۵ Monday, 31 August , 2026 ساعت تعداد نوشته های امروز : 0×

تیتر اخبار آکادمی

چرا ذهنمان خاطرات تلخ را بیش از خاطرات خوش تکرار می‌کند؟ علت شباهت زن و شوهرها پس از ازدواج چیست؟ تلسکوپ 4 میلیارد دلاری «رومنِ» ناسا تا لحظاتی دیگر پرتاب می‌شود تقویم رویدادهای روانشناسی همراه با آشنایی با معروفترین روانشناسان جهان در یک جدول نگاه روانشناسی و تربیتی به نقش پیامبر اسلام در تعلیم و تربیت و در الگودهی به کودکان ۲۰ مرکز سلامت روان جامعه‌نگر افتتاح شد مهار اضطراب و نشخوار فکری شبانه با تکنیک‌های شناختی – رفتاری آشنایی با مهمترین روانشناسان جهان در یک جدول آموزش فراگیر هسته اصلی آموزش و پرورش استثنایی است ابداع روبات‌هایی که در مجاورت نور تا ابد می‌جهند روزهای انتظار نتایج کنکور؛ رفتار درست والدین چیست فرسودگی شغلی فقط به دلیل زیاد کار کردن نیست!/ با این تکنیک ها انرژی خود را بازیابی کنید مادر شاغل نباید مدیر و مجری تمام جزئیات زندگی خانواده باشد نگرانی هایی که به این شکل باشند طبیعی نیستند/ وقتی مغز نمی‌تواند خاموش شود چگونگی کشف و شناسایی دانش‌آموزان تیزهوش در جهان ذهن شلوغ خود را روی کاغذ خالی کنید/ از کجا بنویسیم؟ بعد از یک اتفاق سخت با این تکنیک ها دوباره سرپا شوید نوشتن، حالم را بهتر می‌کند مهم ترین نکات درباره اختلالات شخصیت/ 5 گام برای شناخت الگوهای پایدار رفتاری و هیجانی دلسوزی کردن با شفقت ورزی متفاوت است/ مولفه های کلیدی برای شفقت ورزی در بحران ها درآمدی بر امنیت روانی و شالوده‌های آن در دوران کودکی پیوند میان روانشناسی و باورهای دینی کاظمی: مأموریت و ساختار نهضت سوادآموزی باید بازنگری شود غربالگری هوشمند آفلاتوکسین با سرعت ۱۰۰ فریم بر ثانیه پایان المپیک ربات‌های انسان‌نما/ از شکست انسان تا آزمون هوش تجسم یافته خیام و پایا؛ چشم تیزبین ایران برای پایش زمین و توسعه ملی پذیرش برگزیدگان المپیادهای جغرافیا و علوم زمین بدون کنکور ابلاغ شد بررسی علمی علت اختلاف بین روان‌شناسان و روان‌پزشکان در جهان معاشرت و ارتباطات اجتماعی؛ نسخه‌ای برای پیری سالم‌تر مغز علت فرار کودکان و نوجوانان از منزل چیست؟ چگونه توانستم میزان اضطراب جدایی دانش آموزان کلاس اول را کاهش دهم؟ دستگیری 84 متخلف و کلاهبردار کنکور سراسری توسط پلیس فتا المپیک ربات‌ها در چین؛ از شکست رکوردهای انسان تا آزمون توانایی مهارت تقلب کنکوری‌ها زیر تیغ قانون؛ از جریمه تا محرومیت مطالعه‌ای درباره بیماری موکنی! مهمترین رکوردهای المپیک رباتهای انسان‌نما/ از کارگری تا مسابقات ورزشی از سفیر تا سریر؛ مسیر تکامل پرتابگرهای ایرانی خاطرات فراموش‌شده چگونه بازمی‌گردند؟! عوارض سرکوب احساسات؛ از هجوم افکار در نیمه‌شب تا اضطراب بی‌دلیل المپیک ربات‌ها در چین/ از شکست رکورد سرعت دویدن تا مسابقه تنیس ربات انسان‌نما سوار بر اسب رباتی شد عوارض سرکوب احساسات روی بدن و روان شما؛ از از هجوم افکار در نیمه‌شب تا اضطراب بی‌دلیل درمان متمرکز بر تروما برای افراد دارای روان‌پریشی و PTSD تأثیر بازی علمی بر فعال شدن نیم کره راست مغز و ماندگاری بیشتر مطالب در حافظه رونمایی از ویلچر برقی خودران در دانشگاه امیرکبیر/نوآوری در دل محدودیت فناوری کالیبراسیون تجهیزات ناوبری هواپیما و کشتی بومی‌سازی شد سیاستگذاری اینوتکس و المپیک فناوری با تمرکز بر پیوند فناوری و سرمایه زندگی را به کنکور گره نزنید کارگاه‌های کاربردی رایگان برای اعضای سازمان نظام روانشناسی برگزار می‌شود علت سکوت مردان در مقابل خشونت خانگی همسران‌شان چیست؟

OpenAI بنچمارک جدیدی برای بررسی عملکرد هوش مصنوعی در وظایف واقعی معرفی کرد
1404-09-30
شناسه : 2487
بازدید 222
35

GPT-5 در آزمون جدید OpenAI توانست بالاترین دقت در دانش تخصصی را ثبت کند، و مدل آنتروپیک در ظاهر و زیبایی سندها برترین بود.

ارسال توسط :
پ
پ

OpenAI با معرفی آزمون جدیدی که GDPval نام دارد، عملکرد مدل‌های هوش مصنوعی را در وظایف واقعی و شغلی بررسی کرده است. نتایج این آزمون نشان می‌دهد که GPT-5 و Claude Opus 4.1 به سطحی نزدیک شده‌اند که می‌توانند خروجی‌هایی مشابه متخصصان انسانی ارائه کنند.

براساس توضیحات این شرکت، GDPval شامل 1320 وظیفه واقعی از 44 شغل مختلف مانند مهندسی نرم‌افزار، وکالت و پرستاری می‌شود. این وظایف توسط گروهی از متخصصان با میانگین 14 سال تجربه کاری طراحی شده‌اند. همچنین از یک نقشه مهندسی گرفته تا لایحه حقوقی و طرحی برای مراقبت‌های پرستاری، فرمت خروجی مدل‌ها می‌تواند متفاوت باشد.

OpenAI تأکید کرده که برخلاف بنچمارک‌های متداول که اغلب ماهیت آکادمیک دارند، GDPval مدل‌ها را با فایل‌ها و ارائه‌های چندرسانه‌ای مانند اسلاید و اسناد به چالش می‌کشد. با این کار، غول هوش مصنوعی تلاش کرده تا وظایف مدل‌ها را به وظایف یک نیروی کار واقعی نزدیک‌تر کند.

OpenAI بنچمارک جدیدی برای بررسی عملکرد هوش مصنوعی در وظایف واقعی معرفی کرد
OpenAI بنچمارک جدیدی برای بررسی عملکرد هوش مصنوعی در وظایف واقعی معرفی کرد

در این آزمون مدل‌های GPT-5 ،o3 ،o4-mini و GPT-4o از OpenAI به همراه Claude Opus 4.1 از آنتروپیک، جمینای 2.5 پرو گوگل و Grok 4 از xAI بررسی شده‌اند. سپس عملکرد آنها توسط کارشناسان ارزیابی شده است.

عملکرد مدل‌های هوش مصنوعی در بنچمارک جدید OpenAI

نتایج نشان داده که Claude Opus 4.1 بهترین عملکرد را از نظر زیبایی‌شناسی و ظاهر خروجی‌ها مثل چیدمان اسلایدها و قالب‌بندی اسناد داشت. در مقابل، GPT-5 بیشترین دقت را در یافتن اطلاعات تخصصی و صحت اطلاعات نشان داده است. OpenAI همچنین اعلام کرده که توانایی مدل‌ها از زمان انتشار GPT-4o در بهار 2024 تا GPT-5 در تابستان 2025 بیش از دو برابر شده است.

یکی از نکات قابل توجه، صرفه‌جویی در زمان و هزینه است. به گفته OpenAI، مدل‌های پیشرفته می‌توانند وظایف GDPval را حدود 100 برابر سریع‌تر و 100 برابر ارزان‌تر از متخصصان انسانی انجام دهند. البته این آمار فقط مربوط به زمان پردازش و هزینه API است و مراحل مهمی مانند نظارت انسانی، اصلاح و ادغام در پروژه‌ها را در نظر نمی‌گیرد.

بااین‌حال، OpenAI می‌گوید که GDPval هنوز محدودیت‌هایی دارد. این آزمون تنها یک‌بار خروجی‌ها را بررسی می‌کند و نمی‌تواند توانایی مدل‌ها در ساخت چند پیش‌نویس یا مدیریت پروژه‌های طولانی‌مدت را بررسی کند. همچنین در دنیای واقعی بسیاری از وظایف به‌صورت مبهم یا با شرایط درحال تغییر تعریف می‌شوند، درحالی‌که GDPval بیشتر بر وظایف شفاف و مشخص تمرکز دارد.

OpenAI در جمع‌بندی خود تأکید کرده که با وجود تمام این محدودیت‌ها، نتایج نشان می‌دهد مدل‌های هوش مصنوعی درحال رسیدن به سطحی هستند که می‌توانند بخش بزرگی از وظایف کاری را برعهده بگیرند و این امر باعث می‌شود نیروی انسانی زمان بیشتری برای فعالیت‌های پیچیده‌تر داشته باشد.

این شرکت اعلام کرده قصد دارد نسخه‌های بعدی GDPval را به حوزه‌های بیشتری از صنایع گسترش دهد و وظایف دشوارتر و تعاملی‌تری را در آن بگنجاند.

ثبت دیدگاه علمی و آموزشی

  • دیدگاه‌های ارسال شده توسط شما، پس از تایید توسط تیم مدیریت در وب منتشر خواهد شد.
  • پیام‌هایی که حاوی تهمت یا افترا باشد منتشر نخواهد شد.
  • پیام‌هایی که به غیر از زبان فارسی یا غیرمرتبط باشد منتشر نخواهد شد.