
دن به مدت ۱۵ تا ۱۵ ساعت در هفته آزاد می شود تا با کار ChatGPT رشد کند.
October 2, 2026
“ما نمی خواهیم خودمان را در پای خود شلیک کنیم” در مورد هک کردن، می گوید که مدیر ارشد تحقیقات OpenAI
October 2, 2026فریب نخورید – آهنگ ها دلیلی ندارند
بعد از ظهر در سئول در مارس 2016، برنامه ای را دیدم که به ساخت یک سنگ در خط پنجم یک هیئت مدیره گو کمک کرد که به نظر می رسید هدیه ای برای حریف انسان باشد. حرکت 37 در بازی دو بازی پنج نفره به قدری مضحک به نظر می رسید که برخی از مفسران فکر می کردند این یک برنامه نویسی است.
نبود. آلفاگو برنده این بازی شد و در نهایت به پیروزی 4-1 بر لی Sedol، یکی از بزرگترین بازیکنان حرفه ای Go در تمام زمان. "من فکر می کردم که آلفاگو بر اساس محاسبات احتمالی است و صرفا یک ماشین بود" لی پس از آن گفت. اما وقتی این حرکت را دیدم، ذهنم را تغییر دادم. مطمئنا، آلفاگو خلاق است.»
هنگامی که Deep Blue شکست خورد و در سال 1997 قهرمان شطرنج جهانی Garry Kasparov را به سلطنت رساند، این کار را با نگاه کردن به شش تا هشت حرکت پیش روی هر بازیکن و ارزیابی 200 میلیون موقعیت شطرنج در ثانیه با استفاده از قوانین سخت کد شده توسط انسان انجام داد. Go یک بازی بسیار پیچیده تر است. ارزش سنگ بستگی به این دارد که چگونه گروه ها و سرزمین های دور بر ده ها حرکت می کنند. محاسبات حتی بخشی از نتایج احتمالی، میلیاردها سال را به یک سوپرکامپیوتر می برد. برای برنده شدن، آلفاگو باید درک کند که چه کسی در یک نگاه پیش می رود و حتی اختراع، هیچ انسانی فکر نمی کرد بازی کند.
به همین دلیل است که بسیاری از حساب های آلفاگو در برابر لی، حرکت 37 را به عنوان یک فلش از شهود ماشین خالص نشان می دهند. این یک سوء تفاهم است. در واقع قدرت های آلفاگو در استدلال بود که این انتخاب خلاقانه را انجام داد و این قدرت هایی هستند که هوش مصنوعی امروز فاقد آن است. اگر ما می خواهیم سیستم های هوش مصنوعی آینده نتایج قابل اعتماد و بینش های واقعا جدید در زمینه هایی مانند علم و پزشکی ایجاد کنند، باید آنها را با قابلیت های استدلال واقعی این نوع مجهز کنیم.
آلفاگو از دو سیستم تشکیل شده است. اولین شبکه سیاسی آن، آموزش دیده بود تا حدس بزند یک انسان قوی چه چیزی را بازی می کند. این بخش “intuitive” ۳۷ را به عنوان هیچ چیز خاص در نظر گرفته است – بازی ای که تقریبا یک در ۱۰۰۰۰ فرصت برای ساخت توسط یک بازیکن متخصص انسانی داشته است. چیزی که آلفاگو را انتخاب کرد، ماشین جستجوی برنامه بود که فراتر از تردید فوری به نظر می رسید و عواقب آینده حرکت های پیشنهادی را وزن می کرد. آن را به وضوح ساخت و جستجو یک درخت بازی با هزاران شاخه، هر کدام نشان دهنده آینده ای متفاوت است.
یک نظریه شناخته شده در علوم رفتاری که توسط دانیل کانمن محبوب شده است، بین دو حالت تفکر انسانی متمایز می شود: سیستم 1 سریع، سطح روده، بی تلاش است؛ سیستم 2 آهسته، گام به گام و مشورت. AlphaGo یک ماشین قابل توجه از این تقسیم را ارائه داد. شبکه های آن پیشنهادات را ارائه می دهند – این حرکت امیدوار کننده به نظر می رسد، این موقعیت به نظر می رسد برنده شده است – و جستجو آن را ارائه می دهد، آزمایش کسانی که در برابر حرکت و ضد حرکت که دنبال می کنند. همانطور که در شناخت انسان وجود دارد، نه نیمی به تنهایی کار می کنند. شهود به تنهایی هرگز برای حرکت 37 انتخاب نمی شد و جستجوی brute-force تلاش می کرد تا از طریق بسیاری از حرکت های احتمالی به نمایش بگذارد.
این بسیار متفاوت از شیوه ای است که مدل های AI امروز کار می کنند. یک مدل زبان بزرگ، توکن بعدی را انتخاب می کند و به پایان می رسد. این مقدار به سیستم 1 در عمل – سریع، رضایت بخش و شگفت انگیز تکمیل الگوی خوب در سراسر تقریبا هر موضوعی که مردم در مورد آن می نویسند.
مدت کوتاهی پس از شروع چتGPT، این زمینه متوجه شد که تسلط زبان به تنهایی از سودمندی واقعی کم می شود. راه حل آشکار ساخت مدل هایی بود که عمدی بودند: به جای پاسخ دادن فوری، اکنون می توانند گام های واسطه ای ایجاد کنند که یک مشکل را تجزیه می کنند، نتایج جزئی را به پیش ببرند و بر استدلال بعدی تأثیر بگذارند – فرآیندی که به عنوان زنجیره ای از اندیشه شناخته می شود.
دستاوردهای واقعی، بالاتر از همه در ریاضیات و برنامه نویسی ثابت کرده اند. اما بر خلاف جستجوی AlphaGo، این یک مکانیسم استدلال کاملا جداگانه را معرفی نمی کند: استدلال متوسط هنوز هم توسط همان فرآیند پیش بینی بعدی تولید می شود، که برای مدت طولانی تر قبل از اینکه مدل به یک پاسخ متعهد شود.
سه نقص مانع از این می شود که ربات های چت از واجد شرایط بودن به عنوان استدلال (به گونه ای که یک دانشمند ممکن است تشخیص دهد) جلوگیری کنند. اول، این مدل ها به طور معمول هیچ حالت صریح، مداوم و قابل بازرسی را حفظ نمی کنند. هیچ دفتر باز وجود ندارد که فرضیه ای را که یک مدل در نظر دارد، اعتماد به نفس آن در توضیحات مختلف، شواهدی که وزن آن است، و سوالات حل نشده آن را بر آن قرار می دهد – همه چیزهایی که باید به طور سیستماتیک اصلاح شود به عنوان اطلاعات جدید.
دوم، آنها فاقد یک جدایی تمیز بین آنچه که سیستم می داند و چگونگی دستکاری آن دانش است. دانش و استدلال به طور جدایی ناپذیر در وزن شبکه عصبی بافته شده است – هیچ گونه مستقل و به صراحت مجموعه ای از باورها وجود ندارد. سوم، در حالی که زنجیره های ربات های چت فکر تولید مانند مشورت، تحقیقات نشان داده است که ربات ها اغلب آنها را پس از این واقعیت، رسیدن به پاسخ توسط یک مسیر اما گزارش دیگری.
این یک مشکل است، زیرا در برنامه های کاربردی که همه ما به آن اهمیت می دهیم، مانند پزشکی، مهندسی و تحقیقات علمی، مهم است که نه تنها یک سیستم به پایان می رسد، بلکه چگونگی رسیدن به نتیجه آن نیز مهم است. هنگامی که خطا اتفاق می افتد – به عنوان مثال، در تشخیص پزشکی و درمان – ما باید بتوانیم تشخیص دهیم که چه اتفاقی افتاده است: آیا استدلال سیستم در اشتباه است، آیا شواهد نامعتبر را ترسیم کرده است یا فرضیه های نادرستی ایجاد کرده است؟
به همین دلیل من به تازگی موقعیت خود را در Google DeepMind رها کردم. من معتقدم که ما به یک رویکرد جدید برای استدلال ماشین نیاز داریم، که بر معماری AlphaGo تمرکز می کند. AlphaGo یک رکورد از آنچه در مورد یک موقعیت مشخص می داند را حفظ می کند: درخت بازی. این ساختار داده شامل همه تغییرات، آینده های احتمالی، که AlphaGo در نظر گرفته شده است، هر حرکت و موقعیت با قضاوت های انجام شده توسط شبکه های عصبی آن است. همانطور که استدلال آن پیشرفت می کند، AlphaGo درخت بازی را به روز می کند و در نهایت اطلاعات را در آن سنتز می کند تا تصمیم بگیرد کدام حرکت را انجام دهد.
به طور مشابه، برای استدلال کلی، یک سیستم باید یک حالت اپیدمیولوژیک را حفظ کند که نشان دهنده آن است که سیستم به عنوان حل و فصل، چه شک و تردید، چه آن را رد کرده است، که سوالات باز باقی می ماند. دلیل آن را می توان به عنوان یک توالی از حرکت درک کرد که تغییر حالت اپیستمی برای پیشبرد دانش و کاهش عدم اطمینان: کاهش عواقب، شکستن مشکلات به قطعات و – به طور ساختاری – تصمیم گیری در مورد سوال، محاسبه برای انجام، یا آزمایش برای اجرای بعدی.
البته، استدلال در دنیای باز سخت تر از بازی یک بازی تخته ای مانند Go یا شطرنج است. در دنیای واقعی، وضعیت فعلی امور تنها تا حدودی شناخته شده است، مجموعه اقدامات موجود بزرگ و متغیر است و عواقب اقدامات تصادفی یا ناشناخته است.
اما پیشرفت های اخیر در LLM ها و دیگر مدل های عصبی در حال حاضر به ما این توانایی را می دهد که چنین مشکلات استدلالی کلی را تحمل کنیم. به عنوان مثال، LLM می تواند راه هایی را برای مقابله با یک مشکل بر اساس آنچه شناخته شده و چه منابع در دسترس است، پیشنهاد کند. آنها می توانند از طریق API یا کد با ابزار ارتباط برقرار کنند و به ارزیابی اینکه آیا یک ادعا توسط شواهد موجود پشتیبانی می شود، کمک کنند.
مهم تر از همه، برای صادق نگه داشتن سیستم، بخش مستقلی از سیستم باید هر حرکت را با چگونگی حل عدم اطمینان، به روز رسانی باورها تنها زمانی که تغییر توسط شواهد پشتیبانی می شود، ارزیابی کند. هنگامی که این قوانین اجرا می شود، مدل می تواند دانش گواهی را جمع آوری کند و سیاست استدلال خود را با یادگیری از تجارب استدلال گذشته بهبود بخشد. شما می توانید به چنین سیستمی به عنوان روش علمی در مورد استروئیدها فکر کنید، با هدف تولید دانش که می تواند در برابر بررسی مقاومت کند.
فکر نمی کنم با ساخت سیستم 1 بزرگتر به هوش ماشینی قابل اعتماد برسیم. مقیاس شهود را تیز می کند، اما شهود را بیشتر نمی کند. حرکت 37 مهم است، زیرا یک ماشین یک موقعیت را در دست داشت، آینده های احتمالی را وزن کرد و حرکت غریزه های مصنوعی خود را انتخاب کرد.
جامعه نیاز به چنین حرکت های خلاقانه ای در کشف مواد مخدر، آب و هوا، تشخیص – میدان هایی که هیئت مدیره به نظر می رسد چیزی شبیه به یک هیئت مدیره Go و هیچ کس ما را به قوانین. ما این بینش ها را فقط از سیستم هایی دریافت خواهیم کرد که به همین دلیل، سیستم هایی که نتیجه گیری آنها از یک توالی قابل حسابرسی از شواهد، استنتاج و تجدید نظر باور به جای یک داستان قانع کننده که پس از این واقعیت گفته شده است، به وجود می آید.
Thore Graepel صندلی یادگیری ماشین در کالج دانشگاه لندن است. او یکی از اعضای اصلی تیم آلفاگو در DeepMind بود و کار می کرد تا اطمینان حاصل شود که AI به شکوفایی انسان کمک می کند.
💻 کدزن | طراحی سایت و سامانههای آنلاین
🚀 ایدهات رو به یک محصول آنلاین حرفهای تبدیل کن
🌐 www.codzan.ir
💬 طراحی • توسعه • پشتیبانی




