هوش مصنوعی عمومی و 2 برابر شدن انجام وظایف هوش مصنوعی هر چند ماه یکبار

نوشته شده توسط

در

دانشمندان روش جدیدی برای سنجش میزان توانایی سیستم‌های هوش مصنوعی (AI) ابداع کرده‌اند – اینکه چقدر سریع می‌توانند انسان‌ها را در وظایف چالش‌برانگیز شکست دهند یا با آنها رقابت کنند.  همچنین در ادامه مبحث هوش مصنوعی عمومی هم مورد بحث قرار می گیرد.

در حالی که هوش مصنوعی معمولاً می‌تواند در پیش‌بینی متن و وظایف دانش از انسان‌ها بهتر عمل کند، اما وقتی پروژه‌های اساسی‌تری مانند کمک به مدیران از راه دور برای انجام به آنها داده می‌شود، اثربخشی کمتری دارند.

برای تعیین کمیت این دستاوردهای عملکردی در مدل‌های هوش مصنوعی، یک مطالعه جدید پیشنهاد کرده است که هوش مصنوعی را بر اساس مدت زمان انجام وظایفی که می‌توانند انجام دهند، در مقابل مدت زمانی که برای انسان‌ها طول می‌کشد، اندازه‌گیری کنند. محققان یافته‌های خود را در 30 مارس در پایگاه داده پیش‌چاپ arXiv منتشر کردند، بنابراین هنوز مورد بررسی دقیق قرار نگرفته‌اند.

محققان سازمان هوش مصنوعی Model Evaluation & Threat Research (METR) در یک پست وبلاگی همراه با این مطالعه توضیح دادند: “ما دریافتیم که اندازه‌گیری طول وظایفی که مدل‌ها می‌توانند انجام دهند، دریچه‌ای مفید برای درک قابلیت‌های فعلی هوش مصنوعی است. این منطقی است: به نظر می‌رسد که عوامل هوش مصنوعی اغلب در کنار هم قرار دادن توالی‌های طولانی‌تر اقدامات، بیشتر از کمبود مهارت یا دانش لازم برای حل مراحل واحد، مشکل دارند.”

محققان دریافتند که مدل‌های هوش مصنوعی وظایفی را که برای انسان‌ها کمتر از چهار دقیقه طول می‌کشد، با نرخ موفقیت نزدیک به ۱۰۰٪ انجام می‌دهند. با این حال، این میزان برای وظایفی که بیش از چهار ساعت طول می‌کشد، به ۱۰٪ کاهش یافته است. مدل‌های قدیمی‌تر هوش مصنوعی در وظایف طولانی‌تر نسبت به سیستم‌های جدید عملکرد بدتری داشتند.

این قابل انتظار بود، زیرا این مطالعه نشان داد که طول وظایفی که انواع هوش مصنوعی عمومی می‌توانند با ۵۰٪ قابلیت اطمینان انجام دهند، تقریباً هر هفت ماه در شش سال گذشته دو برابر شده است.

انواع مختلف

محققان برای انجام مطالعه خود، مدل‌های مختلف هوش مصنوعی – از Sonnet 3.7 و GPT-4 گرفته تا Claude 3 Opus و مدل‌های قدیمی‌تر GPT – را انتخاب کردند و آنها را در مقابل مجموعه‌ای از وظایف قرار دادند. این موارد از تکالیف آسان که معمولاً چند دقیقه طول می‌کشد تا انسان‌ها انجام دهند (مثلاً جستجوی یک سوال اساسی در ویکی‌پدیا) تا تکالیفی که چندین ساعت طول می‌کشد تا متخصصان انسانی انجام دهند – مثلاً وظایف برنامه‌نویسی پیچیده مانند نوشتن هسته‌های CUDA یا رفع یک اشکال ظریف در PyTorch.

ابزارهای تست شامل HCAST و RE-Bench استفاده شدند. اولی دارای ۱۸۹ وظیفه نرم‌افزاری خودمختار است که برای ارزیابی قابلیت‌های عامل هوش مصنوعی در انجام وظایف مربوط به یادگیری ماشین، امنیت سایبری و مهندسی نرم‌افزار تنظیم شده است، در حالی که دومی از هفت وظیفه مهندسی تحقیقاتی یادگیری ماشین با پایان باز و چالش‌برانگیز، مانند بهینه‌سازی هسته GPU، استفاده می‌کند که در مقایسه با متخصصان انسانی محک زده شده‌اند.

سپس محققان این وظایف را از نظر «بی‌نظمی» رتبه‌بندی کردند تا ببینند و ارزیابی کنند که چگونه برخی از وظایف شامل مواردی مانند نیاز به هماهنگی بین چندین جریان کاری در زمان واقعی هستند – که به طور مؤثر انجام وظیفه را پیچیده‌تر می‌کند – و بنابراین نماینده بیشتری از وظایف دنیای واقعی هستند.

محققان همچنین اقدامات اتمی نرم‌افزاری (SWAA) را توسعه دادند تا مشخص کنند که افراد واقعی چقدر سریع می‌توانند وظایف را انجام دهند. اینها وظایف تک مرحله‌ای هستند که از یک تا ۳۰ ثانیه متغیر هستند و توسط کارمندان METR پایه‌گذاری شده‌اند.

این مطالعه در عمل نشان داد که «دامنه توجه» هوش مصنوعی با سرعت زیادی در حال پیشرفت است. محققان با تعمیم این روند، پیش‌بینی کردند (اگر واقعاً بتوان نتایج آنها را به طور کلی در وظایف دنیای واقعی به کار برد) که هوش مصنوعی می‌تواند تا سال ۲۰۳۲ به اندازه یک ماه توسعه نرم‌افزار انسانی را خودکار کند.

دانشمندان گفتند، برای درک بهتر قابلیت‌های رو به پیشرفت هوش مصنوعی و تأثیر و خطرات بالقوه آن برای جامعه، این مطالعه می‌تواند معیار جدیدی در رابطه با نتایج دنیای واقعی ایجاد کند تا «تفسیر معناداری از عملکرد مطلق، نه فقط عملکرد نسبی» را ممکن سازد.

مرز جدیدی برای ارزیابی هوش مصنوعی؟

یک معیار جدید بالقوه می‌تواند ما را قادر سازد تا هوش و قابلیت‌های واقعی سیستم‌های هوش مصنوعی را بهتر درک کنیم.

سهراب کازرونیان، محقق برجسته هوش مصنوعی در Vectra AI، به Live Science گفت: “این معیار به خودی خود مسیر توسعه هوش مصنوعی را تغییر نمی‌دهد، اما سرعت پیشرفت در انواع خاصی از وظایف را که در آنها سیستم‌های هوش مصنوعی به طور ایده‌آل مورد استفاده قرار می‌گیرند، ردیابی خواهد کرد.”

هوش مصنوعی عمومی

کازرونیان گفت: “اندازه‌گیری هوش مصنوعی در برابر مدت زمانی که طول می‌کشد تا یک انسان یک وظیفه مشخص را انجام دهد، یک معیار جایگزین جالب برای هوش و قابلیت‌های عمومی است. اول، زیرا هیچ معیار واحدی وجود ندارد که منظور ما را از “هوش” در بر بگیرد. دوم، زیرا احتمال انجام یک کار طولانی مدت بدون رانش یا خطا به طرز چشمگیری کم می‌شود. سوم، زیرا این یک معیار مستقیم در برابر انواع وظایفی است که امیدواریم از هوش مصنوعی برای آنها استفاده کنیم؛ یعنی حل مشکلات پیچیده انسانی. اگرچه ممکن است تمام عوامل یا تفاوت‌های ظریف مربوط به قابلیت‌های هوش مصنوعی را در بر نگیرد، اما مطمئناً یک نقطه داده مفید است.”

النور واتسون، عضو IEEE و مهندس اخلاق هوش مصنوعی در دانشگاه سینگولاریتی، موافق است که این تحقیق مفید است. او گفت که اندازه‌گیری هوش مصنوعی بر اساس طول وظایف “ارزشمند و شهودی” است و “مستقیماً پیچیدگی دنیای واقعی را منعکس می‌کند و مهارت هوش مصنوعی را در حفظ رفتار منسجم و هدفمند در طول زمان نشان می‌دهد”، در مقایسه با آزمایش‌های سنتی که عملکرد هوش مصنوعی را در مسائل کوتاه و مجزا ارزیابی می‌کنند.

هوش مصنوعی عمومی در راه است

مسلماً، علاوه بر یک معیار معیار جدید، بزرگترین تأثیر این مقاله برجسته کردن سرعت پیشرفت سیستم‌های هوش مصنوعی، در کنار روند صعودی توانایی آنها در انجام وظایف طولانی است. با توجه به این موضوع، واتسون پیش‌بینی می‌کند که ظهور عوامل هوش مصنوعی عمومی که می‌توانند انواع وظایف را انجام دهند، قریب‌الوقوع خواهد بود.

واتسون گفت: “تا سال 2026، شاهد خواهیم بود که هوش مصنوعی به طور فزاینده‌ای عمومی می‌شود (ظهرو هوش مصنوعی عمومی) و وظایف متنوعی را در طول یک روز یا هفته کامل به جای تکالیف کوتاه و محدود، انجام می‌دهد.”

واتسون خاطرنشان کرد که برای کسب‌وکارها، این می‌تواند منجر به هوش مصنوعی‌هایی شود که می‌توانند بخش قابل توجهی از حجم کار حرفه‌ای را بر عهده بگیرند – که نه تنها می‌تواند هزینه‌ها را کاهش داده و کارایی را بهبود بخشد، بلکه به افراد اجازه می‌دهد تا روی وظایف خلاقانه‌تر، استراتژیک‌تر و بین فردی‌تر تمرکز کنند.

واتسون افزود: “برای مصرف‌کنندگان، هوش مصنوعی از یک دستیار ساده به یک مدیر شخصی قابل اعتماد تبدیل خواهد شد که قادر به انجام وظایف پیچیده زندگی – مانند برنامه‌ریزی سفر، نظارت بر سلامت یا مدیریت سبدهای مالی – در طول روزها یا هفته‌ها، با حداقل نظارت است. یعنی یک هوش مصنوعی عمومی و در دسترس.”

در واقع، توانایی هوش مصنوعی برای انجام طیف وسیعی از وظایف طولانی می‌تواند تأثیر قابل توجهی بر نحوه تعامل جامعه و استفاده از هوش مصنوعی در چند سال آینده داشته باشد.

واتسون در پایان گفت: “در حالی که ابزارهای تخصصی هوش مصنوعی به دلایل بهره‌وری در کاربردهای خاص باقی خواهند ماند، عوامل قدرتمند هوش مصنوعی عمومی – که قادر به تغییر انعطاف‌پذیر بین وظایف متنوع هستند – به طور برجسته‌ای ظهور خواهند کرد. این سیستم‌ها مهارت‌های تخصصی را در گردش‌های کاری گسترده‌تر و هدفمند ادغام می‌کنند و زندگی روزمره و شیوه‌های حرفه‌ای را به روش‌های اساسی تغییر شکل می‌دهند.”

باید منتظر ماند تا ادعای ظهور هوش مصنوعی عمومی چقدر به واقعیت نزدیک می شود.

 

دیدگاه‌ها

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *