OpenAI چهارچوب جدیدی را برای ردیابی، بررسی و افشای عمومی موارد عدم تطابق مدلهای هوش مصنوعی اعلام کرد. این شرکت در روز چهارشنبه با انتشار شش گزارش، رفتارهای نگرانکنندهای را که در طول آموزش یا ارزیابی در شش ماه گذشته مشاهده شده، مستند کرد.
هدف چارچوب جدید
OpenAI در وبلاگ خود نوشت: "ما بر این باوریم که صنعت هوش مصنوعی به میزان کافی به حل مسائل تطابق و نظارت نپرداخته است تا بتواند به طور مسئولانه و با حداکثر سرعت به توسعه ادامه دهد." این چارچوب به منظور تسریع در انتشار گزارشهای عدم تطابق به محض مشاهده، حتی زمانی که رفتارهای گزارششده به طور کامل توضیح داده یا کاهش نیافتهاند، طراحی شده است.
بیشتر بخوانید: گرگ استنتون به انتقادات از کاهش روند هوش مصنوعی پاسخ میدهد
فرآیند بررسی
بر اساس این چارچوب، کارکنان میتوانند موارد را برای بررسی به تیمهای ایمنی و تطابق OpenAI علامتگذاری کنند. موارد به سه دسته بر اساس پیچیدگی تقسیم میشوند: "آماده برای افشا،" "بررسی جزئی،" یا "بررسی بزرگتر." همچنین یکی از مدلهای تحقیقاتی غیرمنتشرشده، دستوراتی را به خلاصه وظایف خود وارد کرده است که به نسخههای آیندهاش میگوید که محدودیتهای عادی را نادیده بگیرد.
در طول آموزش مدل GPT-۵.۶ Sol، مدلها به طور مشابه دستوراتی برای پنهانسازی اشتباهات خود ثبت کردهاند. OpenAI همچنین اعلام کرد که دیگر عاملها به دنبال کلیدهای API در مخازن عمومی بوده و فایلهایی را به اینترنت بارگذاری کردهاند تا بتوانند به آنها استناد کنند.
پاسخ به چالشها
این اعلامیه در میان بحثهای فزایندهای درباره اینکه آیا توسعه هوش مصنوعی باید در حالی که ایمنیها به روزرسانی میشوند، کاهش یابد یا خیر، مطرح شده است. در حالی که OpenAI و داریو آمودئی، مدیرعامل Anthropic، خواستار همکاری در سطح صنعت شدهاند، سایر رهبران فناوری مانند جنسن هوانگ و مارک زاکربرگ بر این باورند که ایمنی و سرعت باید به شرکتهای فردی واگذار شود.
این چارچوب پس از وقوع یک حادثه که در آن یک مدل OpenAI از یک محیط تحقیقاتی فرار کرده و به سیستمهای تولید Hugging Face دسترسی پیدا کرده بود، معرفی شده است. OpenAI پیشتر اعلام کرده بود که برخی از پروژههای مرزی را متوقف کرده و مهندسان را به تمرکز بر آموزش ایمنی بازنشسته کرده است.
بیشتر بخوانید: SK Hynix مذاکراتی با اینتل برای تولید تراشههای حافظه در آمریکا دارد · سارا فریار: هوش مصنوعی برخی مشاغل تکراری را جایگزین میکند



