هوش مصنوعی به زبان آدمیزاد؛ راهنمای جامع برای مبتدیان

 

این‌روزها همه‌جا صحبت از هوش مصنوعی است. کافی است سری به شبکه‌های اجتماعی بزنید یا اخبار را دنبال کنید تا با کلماتی مانند «هوش مصنوعی»، «یادگیری ماشین»، «یادگیری عمیق» و این اواخر، «هوش مصنوعی مولد» بمباران شوید. چت‌بات‌هایی که دنیا را تسخیر کرده‌اند، مشکلات «حل‌نشدنی» که در حال حل شدن هستند، افرادی که بدون هیچ دانشی از کدنویسی یا آهنگسازی، در عرض چند ثانیه وب‌سایت و آهنگ می‌سازنند و ویدیوهای «دیپ‌فیک‌» که تشخیص واقعیت از خیال را دشوار کرده‌اند.

 

هوش مصنوعی چیست؟

در ساده‌ترین تعریف و به دور از تمام هیاهوی رسانه‌ای، هوش مصنوعی یا AI، چیزی نیست جز نرم‌افزاری که توانایی‌هایی شبیه به انسان را از خود نشان می‌دهد. به همین سادگی.

اما چه توانایی‌هایی؟ ما انسان‌ها توانایی دیدن داریم؛ به اطراف نگاه می‌کنیم و اشیا، چهره‌ها و صحنه‌ها را درک می‌کنیم. این، توانایی «بینایی» (Vision) در هوش مصنوعی است. ما توانایی گفتگو داریم؛ می‌توانیم متن را بفهمیم، کلمات را از دل یک تصویر بخوانیم (تحلیل متن) و به سوالات پاسخ دهیم. و شاید مهم‌تر از همه، ما براساس اطلاعاتی که از حواس مختلف (دیده‌ها، شنیده‌ها، سوالات) دریافت می‌کنیم، «تصمیم» می‌گیریم.

بنابراین، وقتی از هوش مصنوعی صحبت می‌کنیم، منظورمان نرم‌افزاری است که می‌تواند یک یا چند مورد از این قابلیت‌های انسانی را تقلید کند: «یادگیری»، «استنتاج» و «استدلال».

اما در اکثر موارد، آنچه به‌عنوان هوش مصنوعی می‌شناسیم، درواقع «اتوماسیون» یا همان فرایند خودکارسازی نام دارد و برای درک بهتر AI، ابتدا باید فرق آن را با اتوماسیون بدانیم.

در دنیای علوم کامپیوتر یک جوک قدیمی وجود دارد که می‌گوید اتوماسیون، کارهایی است که ما همین‌حالا می‌توانیم با کامپیوتر انجام دهیم، اما هوش مصنوعی کارهایی است که ما دلمان می‌خواست می‌توانستیم با کامپیوتر انجام دهیم. به‌عبارت دیگر،‌ به‌محض اینکه بفهمیم چطور کاری را با کامپیوتر انجام دهیم، از حوزه‌ی هوش مصنوعی خارج و وارد اتوماسیون می‌شویم.

 

به‌عبارت دیگر، «هوش مصنوعی» درحال‌حاضر بیشتر اصطلاحی برای بازاریابی است تا اصطلاحی فنی. دلیل اینکه شرکت‌ها به جای استفاده از واژه‌ی «اتوماسیون» از هوش مصنوعی استفاده می‌کنند این است که می‌خواهند در ذهن ما همان تصاویر علمی‌تخیلی فیلم‌های هالیوودی را تداعی کنند. اما این کار کاملا هم فریبکاری نیست؛ اگر بخواهیم دست‌ودل‌بازی به خرج دهیم، می‌توان گفت این شرکت‌ها قصد دارند بگویند درست است که تا رسیدن به هوش مصنوعی قوی راه درازی در پیش داریم، اما AI ضعیف کنونی را هم نباید دست‌کم گرفت، چون به‌مراتب از چند سال پیش، قوی‌تر شده است که خب، این حرف کاملاً درست است.

 

آنچه از هوش مصنوعی تابه‌حال دیده‌ایم از نوع هوش مصنوعی ضعیف است

 

در برخی زمینه‌ها، تغییرات شگرفی در توانایی ماشین‌ها صورت گرفته و آن هم به‌خاطر پیشرفت‌هایی است که در چند سال اخیر، در دو زمینه‌ی مرتبط با هوش مصنوعی، یعنی یادگیری ماشین و یادگیری عمیق به‌دست‌ آمده است. این دو اصطلاح را هم احتمالا بسیار شنیده‌اید و در ادامه درباره‌‌ی سازوکارشان توضیح خواهیم داد. اما پیش از آن، اجازه دهید کمی درباره‌ی تاریخچه‌ی جالب و خواندنی هوش مصنوعی با شما صحبت کنیم.

تاریخچه هوش مصنوعی

در نیمه‌ی اول قرن بیستم، داستان‌های علمی‌تخیلی، مردم را با مفهوم ربات‌های هوشمند آشنا کردند که اولین آن‌ها، شخصیت مرد حلبی در رمان «جادوگر شهر اُز» (۱۹۰۰) بود. تا اینکه در دهه‌ی ۱۹۵۰، نسلی از دانشمندان، ریاضیدانان و فیلسوفانی را داشتیم که ذهنشان با مفهوم هوش مصنوعی درگیر شد. یکی از این افراد، ریاضیدان و دانشمند کامپیوتر انگلیسی به‌نام آلن تورینگ (Alan Turing) بود که سعی داشت امکان دستیابی به هوش مصنوعی را با علم ریاضی بررسی کند.

تورینگ می‌گفت انسان‌ها از اطلاعات موجود و همچنین قدرت استدلال برای تصمیم‌گیری و حل مشکلات استفاده می‌کنند، پس چرا ماشین‌ها نمی‌توانند همین کار را انجام دهند؟ این دغدغه‌ی ذهنی درنهایت به نوشتن مقاله‌ی بسیار معروفی در سال ۱۹۵۰ انجامید که با پرسش جنجالی «آیا ماشین ها می توانند فکر کنند؟» شروع می‌شد. تورینگ در این مقاله به شرح چگونگی ساخت ماشین‌های هوشمند و آزمایش سطح هوشمندی آن‌ها پرداخت و با پرسش «آیا ماشین‌ها می‌توانند از بازی تقلید سربلند بیرون آیند؟»، آغازگر آزمون بسیار معروف «تست تورینگ» شد.

 

نمونه‌های​ هوش مصنوعی

این روزها هوش مصنوعی را می‌توان تقریبا در هر چیزی دید؛ از دستیارهای صوتی مثل Siri گرفته تا الگوریتم‌های پیشنهاد فیلم و آهنگ در نتفلیکس و اسپاتیفای و خودروهای خودران و ربات‌هایی که در خط تولید مشغول به کارند. اما در چند وقت اخیر، عرضه‌ی برخی از نمونه‌های هوش مصنوعی، صحبت درباره‌ی این حوزه‌ از تکنولوژی را سر زبان‌ها انداخته‌اند که در ادامه به‌طور مختصر به آن‌ها اشاره می‌کنیم.

چت‌جی‌پی‌تی

این چت‌بات، که اکنون توسط مدل‌های پیشرفته‌تری مانند GPT-4o (با قابلیت‌های چندوجهی) و حتی مدل‌های جدیدتر مانند GPT-5 پشتیبانی می‌شود، در حال حاضر یک دستیار «همه‌منظوره» محسوب می‌شود که می‌تواند به‌طور یکپارچه متن، صدا و تصویر را درک و تحلیل کند. از چت‌جی‌پی‌تی برای تحلیل داده‌های پیچیده، کدنویسی پیشرفته، تولید محتوای خلاقانه و دستیار صوتی هوشمند استفاده می‌شود.

 

جمنای

جمنای (Gemini) پیشرفته‌ترین مدل هوش مصنوعی گوگل تا به امروز است که به عنوان جایگزین مدل قبلی یعنی «بارد» و رقیب ChatGPT معرفی شد. این پلتفرم هم مانند ChatGPT می‌تواند به صورت همزمان متن، تصویر، صدا، ویدیو و کدهای برنامه‌نویسی را درک، ترکیب و پردازش کند.

درحال‌حاضر، جدیدترین نسل این هوش مصنوعی سری جمنای ۳ است که شامل نسخه‌های مختلفی از جمله Pro (برای استدلال‌های پیچیده) و Flash (برای سرعت و کارایی بالا) می‌شود. ویژگی متمایز نسخه ۳، «پنجره محتوایی» بسیار وسیع آن است که به مدل اجازه می‌دهد حجم عظیمی از اطلاعات،‌ مانند ساعت‌ها ویدیو، چندین کتاب کامل یا هزاران خط کد را به یکباره دریافت کرده و با دقت بالا تحلیل کند.

 

نانو بنانا

نانو بنانا (Nano Banana) مولد تصویر گوگل است که پیشرفته‌ترین نسخه‌ی آن مبتنی‌بر جمنای ۳ در اواخر سال ۲۰۲۵ معرفی شد.

نقطه قوت نانو بنانا، «ثبات شخصیت» و قابلیت ویرایش دقیق است. برخلاف بسیاری از مدل‌ها که با تغییر دستور، چهره سوژه را کاملا عوض می‌کنند، نانو بنانا می‌تواند هویت یک کاراکتر را در تصاویر و زاویه‌های مختلف ثابت نگه دارد. علاوه بر این، این مدل توانایی بالایی در نوشتن صحیح متن‌ها داخل تصویر دارد و به کاربران اجازه می‌دهد با زبانی ساده، تغییرات پیچیده‌ای مثل تغییر لباس یا محیط را بدون به هم ریختن کل عکس اعمال کنند.

 

مایکروسافت کوپایلت

مایکروسافت کوپایلت تکامل‌یافته‌ترین دستیار هوش مصنوعی این شرکت است که ریشه در پروژه «بینگ چت» دارد. این سرویس حاصل سرمایه‌گذاری کلان مایکروسافت در شرکت OpenAI است و از همان ابتدا بر پایه مدل‌های GPT بنا شد.

نقطه قوت کوپایلت، یکپارچگی عمیق آن با اکوسیستم کاری مایکروسافت است. این هوش مصنوعی در نرم‌افزارهایی مثل ورد، اکسل و پاورپوینت حضور دارد. نسخه تخصصی کوپایلت گیت‌هاب به عنوان دستیار هوشمندی برای برنامه‌نویسان شناخته می‌شود.

 

سورا

سورا (Sora) مدل هوش مصنوعی شرکت OpenAI برای تولید ویدیو است که اولین بار در اوایل سال ۲۰۲۴ به عنوان یک پروژه تحقیقاتی معرفی شد. رونمایی اولیه آن با ویدیوهایی از «قدم زدن زنی در خیابان‌های نئونی توکیو» یا «موجودات پشمالوی بامزه»، شوک بزرگی به دنیای فناوری وارد کرد؛ چرا که تا پیش از آن، مدل‌های ویدیویی کیفیت پایین و پرش‌های تصویری زیادی داشتند.

درحال‌حاضر، جدیدترین و قدرتمندترین نسخه این خانواده Sora 2 است. این نسخه جهش بزرگی نسبت به مدل اولیه داشته و اکنون نه تنها ویدیو، بلکه «صدا» را نیز همزمان با تصویر تولید می‌کند.

 

منبع: وبسایت زومیت (مرجان شیخی)