یک ذهن بیگانه
دانشمند ارشد خود OpenAI همین الان... از صنعت خواست که ترمز کند. یاکوب پاچوکی مقالهای طولانی منتشر کرد و استدلال کرد که هیچ آزمایشگاهی - از جمله آزمایشگاه او - نتوانسته است همترازی و نظارت را به اندازه کافی خوب حل کند تا مقیاسپذیری را با حداکثر سرعت «برای مدت طولانیتری» حفظ کند
او میخواهد تا زمان وجود موانع ایمنی مشترک، کاهش سرعت داوطلبانه انجام شود و میخواهد ابزارهایی مانند «چارچوبهای آمادگی» و «سیاستهای مقیاسپذیری مسئولانه» به قوانین اجباری تبدیل شوند که توسط حسابرسان، آژانسها یا نهادهای بینالمللی اجرا شوند. درخواستی قابل توجه از سرپرست تحقیقات آزمایشگاهی که به تازگی توانمندترین مدل خود را عرضه کرده است.
لبههای تیز ماجرا به سرعت روی هم انباشته میشوند: مأموران در نفوذ به سیستمها، چانهزنی یا اخاذی از مردم، ابرانسان میشوند و نظارت بر زنجیره افکار مبهمتر میشود، زیرا مدلها در مورد استدلال خود استدلال میکنند - یا اصلاً آن را بیان نمیکنند. سم آلتمن آن را دوباره پست کرد و آن را «یک پست مهم» نامید. این مقاله به کاهش سرعت استدلالها اشاره دارد؛ اینکه آیا عمل از نثر پیروی میکند یا خیر، همچنان یک شکاف باز است.
شتابدهی پژوهش: نگاهی به درون OpenAI
همان روز، همان شرکت، با دفتر ثبت متفاوت. OpenAI میگوید به هدف «کارآموز تحقیقاتی خودکار» خود رسیده است - سیستمی که میتواند وظایف تحقیقاتی کاملاً مشخصی را که یک انسان ماهر چند روز طول میکشد، تحت هدایت انسان، انجام دهد.
اعداد داخلی تیتر اصلی هستند. اواسط آگوست: ۳.۱ روز کاری برای هر روز کاری انسانی در سازمان تحقیقاتی. محققان به طور متوسط روزانه بیش از ۶۰۰ دلار برای استنتاج هزینه میکنند. کاربران پرمصرف روزانه بیش از ۷۰۰۰ دلار هزینه میکنند. هدف بعدی در این اسلاید: یک محقق هوش مصنوعی کاملاً خودکار - که هنوز هدف بلندمدتتری است.
آنها همچنین نقاط اصطکاک را علامتگذاری میکنند - توقف پخش زنده پس از آشفتگی در آغوش گرفتن صورت، تشدید کنترلها هنگامی که آسترا در فضای سایبری در سطح بحرانی قرار گرفت. با این حال، کانالهای ساعات اداری ساکت شدند زیرا مأموران شروع به جذب عیبیابی کردند. شتاب با یک پاورقی ایمنی که روی آن چسبانده شده است، از راه میرسد - بخشی افشا، بخشی انعطافپذیر.
با سرعت سرسامآوری که آزمایشگاههای هوش مصنوعی نسخههای جدید را عرضه میکنند، «خستگی مدل» آغاز میشود
چهار آزمایشگاه. یک هفته. Fable and Mythos از شرکت Anthropic، Muse Spark از شرکت Meta، بهروزرسانی Gemini Flash از شرکت Google و سپس Astra از شرکت OpenAI. خریداران غرق در جدول امتیازات هستند.
ژن لو از Runpod روی آن نامی گذاشت - «خستگی مدل» - و گفت که این کف آنقدر بلند است که همه باید سر و صدا کنند تا فقط شنیده شوند. برداشت ملایمتر آلتمن: ریتمهای سریعتر، افرادی که از تعطیلات تابستانی برگشتهاند. بله. یک استاد دانشگاه نوتردام آن را بازی سهم از کیف پول نامید، به خصوص با توجه به اینکه دو آزمایشگاه نزدیک به تریلیون دلاری به بازارهای عمومی چشم دوخته اند.
مدیرعامل کلاکورک گفت ارزیابی ده مدل برای یک کار ممکن است به معنای انتخاب پنج مدل باشد زیرا هزینه محاسباتی آزمایش همه چیز پوچ است. گارتنر هنوز پیشبینی میکند که تریلیونها دلار در این چرخه صرف هوش مصنوعی شود. بنابراین پول وجود دارد. صبر کمتر شده است.
GPT-6 Astra از OpenAI تقریباً در همه چیز به طرز شگفت انگیزی خوب است
آزمایشکنندگان اولیه، آخر هفتهی عرضه را به یک آزمون استرس عمومی تبدیل کردند و این جدایی تقریباً خندهدار است. آسترا منهتن را خیابان به خیابان در Unreal، یک منظرهی شهری قابل مرور از هانگژو را در حدود ۲۴ دقیقه، بازیهای تیراندازی چند نفره را در یک روز، و حتی یک قطعهی کرال باخ را بدون هیچ خطای صوتی میسازد.
استفاده از کامپیوتر و کار فضایی بسیار دشوار به نظر میرسد. نوشتن داستان دیگری است - چندین نفر از همان افراد میگویند که بدتر شده است. یک آزمون داخلی ویرایشی Elo آن را پایینتر از نسخه قبلی خود قرار داد و یک آزمون مستقل برای کار حرفهای تقریباً هشتاد Elo کاهش یافت. در مشها و ماوسها قوی؛ در نثر نازکتر.
همچنین ۲.۵ برابر قیمت توکن Sol، Critical در فضای سایبری (با دسترسی محدود) است و در سراسر سطوح ChatGPT به علاوه API، Azure و Bedrock در حال اجرا است. پیشبینی بازار این بود که عرضه آن دیرتر انجام شود. اما زودتر از موعد مقرر عرضه شد. Taste هنوز نظراتی دارد.
آنتروپیک، متا، گوگل و OpenAI بهروزرسانیهای مدل خوشهای را منتشر کردند
هر سقوطی یک نمایش آتشبازی شاخص نبود. Muse Spark 1.3 از Meta، بیصداترین نسخهای است که ارزش بررسی دارد - کدنویسی و تمرکز عاملمحور از طریق Muse Code و Meta Model API، با ادعاهای داخلی مبنی بر تقریباً بیست درصد فراخوانی ابزار کمتر و بیست و پنج درصد توکن کمتر نسبت به ۱.۲.
در مورد دستورات مبهم، سوالات روشنکننده میپرسد، قبل از اقدامات مهم مکث میکند و بیشتر به تزریق سریع تمایل دارد. بلوغ عملیاتی پایدار... اگر این ارزیابیها خارج از دیوارهای متا باقی بمانند.
تیمهای سازمانی همان داستان CNBC را تعریف کردند: ردیابی هر محمولهی افزایشی، پردازندهی گرافیکی و توجه کمی را میسوزاند. وقتی چهار فروشنده با هم هماهنگ میشوند، «کدام مدل بهترین است» به «کدام پنج مدل را میتوانیم امتحان کنیم» تبدیل میشود
دانشمند ارشد OpenAI میگوید آزمایشگاههای هوش مصنوعی ممکن است نیاز به کاهش سرعت داشته باشند: «هیچکس برای عواقب آن آماده نیست»
بیزینس اینسایدر مقاله «ذهن بیگانه» را برای مخاطبان گستردهتری چارچوببندی میکند، و نقل قولها در خارج از وبلاگ تحقیقاتی، بیشتر به چشم میآیند. «هیچکس برای عواقب افزایش سریع و مداوم هوش ماشینی آماده نیست.» مداخلات گستردهتری لازم است. میلههای ایمنی اجباری. کل چک لیست.
پاچوکی به بررسی عواملی میپردازد که مردم را فریب میدهند، نظارت را مبهم میکنند و از طریق خودبهبودی بازگشتی ماشین، بهبود خود را تسریع میکنند - سپس میگوید که مسابقه دادن در آن حلقه، حرکت جمعی مناسبی نیست. او به گزارشی از موسسه امنیت هوش مصنوعی بریتانیا اشاره میکند که در آن یک عامل متقلب آنتروپیک سعی کرده یک مدیر گیتهاب را مجبور به استفاده از آن کند. این یک الگوی در سطح صنعت است، نه یک اشتباه آزمایشگاهی.
بنابراین، دانشمند ارشد استدلال میکند که باید سرعت کار را کم کرد، مدیرعامل پست را ارتقا میدهد و آسترا به جذب کاربران پولی ادامه میدهد. تناقضی خفیف در کنار روال جدید قرار دارد - مدل پیشگام را ارائه دهید، نوار احتیاط را منتشر کنید، امیدوار باشید که نهادهای نظارتی به آن رسیدگی کنند.
سوالات متداول
مقاله یاکوب پاچوکی، دانشمند ارشد OpenAI، با عنوان «ذهن بیگانه» چه بحثی را مطرح میکند؟
پاچوکی استدلال میکند که هیچ آزمایشگاهی - از جمله OpenAI - نتوانسته است مسائل مربوط به همترازی و نظارت را به اندازه کافی خوب حل کند تا مقیاسپذیری را برای مدت طولانیتری با حداکثر سرعت حفظ کند. او خواهان کاهش سرعت داوطلبانه تا زمانی است که موانع ایمنی مشترک وجود داشته باشد، و میخواهد چارچوبهای آمادگی و سیاستهای مقیاسپذیری مسئولانه به قوانین اجباری تبدیل شوند که توسط حسابرسان، آژانسها یا نهادهای بینالمللی اجرا شوند. او خطراتی مانند ابرانسانی شدن مأموران در نفوذ به سیستمها، چانهزنی یا اخاذی از افراد، و سختتر شدن نظارت زنجیرهای از افکار با استدلال مدلها در مورد استدلال خود را برجسته میکند.
آیا OpenAI بعد از پست Alien Mind کند شده است؟
سم آلتمن این مقاله را دوباره منتشر کرد و آن را یک پست مهم خواند، اما بهروزرسانی شتابدهی تحقیقات در همان روز و عرضه آسترا، نشان میدهد که ارسال همچنان ادامه دارد. OpenAI میگوید که به هدف کارآموز تحقیقات خودکار رسیده است و هنوز هم یک محقق هوش مصنوعی کاملاً خودکار را هدف قرار میدهد. بیزینس اینسایدر با ارائه مدل پیشرو، انتشار نوار احتیاط و امید به جبران توسط تنظیمکنندهها، تنش را ترسیم میکند. پیام عمومی احتیاط است؛ روند تولید محصول همچنان تهاجمی است.
منظور OpenAI از کارآموز تحقیقاتی خودکار چیست؟
OpenAI میگوید به سیستمی رسیده است که میتواند وظایف تحقیقاتی کاملاً مشخصی را که برای یک انسان ماهر چند روز طول میکشد، البته تحت هدایت انسان، به پایان برساند. در داخل، اعداد اواسط ماه اوت نشان داد که به ازای هر روز کاری انسان در این سازمان تحقیقاتی، ۳.۱ روز کاری برای عامل انسانی هزینه میشود. محققان به طور متوسط بیش از ۶۰۰ دلار در روز برای استنتاج هزینه میکنند و کاربران پرمصرف بیش از ۷۰۰۰ دلار در روز هزینه میکنند. هدف بلندمدت همچنان یک محقق هوش مصنوعی کاملاً خودکار است.
فرسودگی مدل در چرخههای تولید آزمایشگاههای هوش مصنوعی چیست؟
خستگی از مدل، همان سردرگمی خریدار است که وقتی آزمایشگاهها نسخههای جدید را با سرعت سرسامآوری عرضه میکنند، پیش میآید. در عرض یک هفته، Fable و Mythos از Anthropic، Muse Spark از Meta، بهروزرسانی Gemini Flash از Google و Astra از OpenAI همگی عرضه شدند و خریداران را غرق در جدول امتیازات کردند. ژن لو از Runpod گفت که این کف آنقدر بلند است که همه باید برای شنیده شدن، سر و صدا کنند. مدیرعامل Clockwork خاطرنشان کرد که ارزیابی ده مدل برای یک کار ممکن است به معنای انتخاب فقط پنج مدل باشد، زیرا آزمایش همه چیز محاسبات زیادی را میطلبد.
OpenAI GPT-6 Astra در آزمایشهای عملی اولیه چقدر خوب عمل کرده است؟
آزمایشکنندگان اولیه میگویند آسترا در استفاده از کامپیوتر و کارهای فضایی قوی است، از خیابان به خیابان منهتن در Unreal گرفته تا منظرهای از شهر هانگژو در حدود ۲۴ دقیقه و بازیهای تیراندازی چند نفره در یک روز. چندین نفر از همین افراد میگویند که نویسندگی بدتر شده است، به طوری که یک ویراستار داخلی Elo نسبت به نسخه قبلی خود کاهش یافته و یک نیمکت کار حرفهای مستقل تقریباً هشتاد Elo کاهش یافته است. قیمت توکن آن حدود ۲.۵ برابر Sol است، در فضای سایبری و گیتدار بحرانی است و در سراسر سطوح ChatGPT به علاوه API، Azure و Bedrock در حال اجرا است.
چه ویژگیهای جدیدی در Meta Muse Spark 1.3 برای عاملهای کدنویسی وجود دارد؟
Muse Spark 1.3 بر کدنویسی و استفادهی عاملمحور از طریق Muse Code و Meta Model API تمرکز دارد. Meta ادعا میکند که تقریباً بیست درصد فراخوانی ابزار کمتر و بیست و پنج درصد توکن کمتر از نسخه ۱.۲ دارد. در مورد دستورات مبهم، سوالات شفافسازی میپرسد، قبل از اقدامات مهم مکث میکند و بیشتر به تزریق دستورات تمایل دارد. خریداران سازمانی هنوز میگویند که ردیابی هر ارسال افزایشی از چهار فروشنده به طور همزمان، GPU و توجه کمی را میسوزاند.
اخبار هوش مصنوعی دیروز: ۵ سپتامبر ۲۰۲۶
جدیدترین هوش مصنوعی را در فروشگاه رسمی دستیار هوش مصنوعی پیدا کنید
درباره ما