رقابت میان شرکتهای بزرگ هوش مصنوعی در سال ۲۰۲۶ وارد مرحله تازهای شده است. با معرفی GPT-6 Astra از سوی OpenAI و Claude Fable 5.1 از سوی Anthropic، دو مدل قدرتمند جدید وارد رقابت شدهاند؛ مدلهایی که هر دو برای کارهای حرفهای، برنامهنویسی، استدلال و انجام وظایف پیچیده طراحی شدهاند.
اما نکته جالب اینجاست که نمیتوان بهسادگی گفت یکی از این دو مدل در همه زمینهها بهتر است. حتی نتایج بنچمارکها نیز پاسخ یکسانی نمیدهند. در برخی آزمونها GPT-6 Astra عملکرد بهتری دارد و در برخی دیگر Claude Fable 5.1 جلوتر است.
GPT-6 Astra چیست؟
GPT-6 Astra جدیدترین مدل پرچمدار OpenAI در این مقایسه است و بیشتر با هدف انجام کارهای حرفهای و «عاملمحور» طراحی شده است.
تفاوت مهم این مدل با یک چتبات معمولی این است که قرار نیست فقط به سؤال کاربر پاسخ دهد. Astra میتواند در برخی محیطها با رایانه و نرمافزارها کار کند، وظایف چندمرحلهای را انجام دهد و برای انجام یک کار، از ابزارهای مختلف استفاده کند.
این موضوع نشان میدهد مسیر توسعه هوش مصنوعی چت جی پی تی به سمت سیستمهایی حرکت کرده که فقط متن تولید نمیکنند، بلکه میتوانند بخشی از یک فرایند کاری را نیز انجام دهند.
GPT-6 Astra همچنین پنجره متنی حدود ۱.۰۵ میلیون توکن دارد و میتواند تا ۱۲۸ هزار توکن خروجی تولید کند.
Claude Fable 5.1 چه تفاوتی دارد؟
Claude Fable 5.1 نیز مدل پرچمدار Anthropic است و تمرکز زیادی روی استدلال پیچیده و انجام وظایف طولانیمدت دارد.
این مدل پنجره متنی یک میلیون توکنی و حداکثر خروجی ۱۲۸ هزار توکنی دارد. یکی از ویژگیهای آن نیز استفاده از قابلیت استدلال تطبیقی است؛ یعنی مدل میتواند برای مسائل دشوارتر زمان و منابع بیشتری برای رسیدن به پاسخ صرف کند.
بنابراین اگر بخواهیم خیلی ساده تفاوت این دو را بیان کنیم، Astra بیشتر روی کار با رایانه، انجام وظایف عملی و بهرهوری تمرکز دارد، در حالی که Fable 5.1 در استدلال عمیق و برخی مسائل پیچیده عملکرد قابلتوجهی دارد.
کدام مدل در برنامهنویسی بهتر است؟
در بخش کدنویسی، رقابت بسیار نزدیک است.
GPT-6 Astra در برخی آزمونهای منتشرشده توسط OpenAI عملکرد بهتری نسبت به Fable 5.1 داشته است. برای مثال، در DeepSWE v1.1 امتیاز Astra برابر با ۷۴.۱ درصد و امتیاز Fable 5.1 برابر با ۶۷.۴ درصد گزارش شده است.
با این حال، یک ارزیابی مستقل تصویر متفاوتی ارائه میدهد. Artificial Analysis در شاخص مربوط به عاملهای برنامهنویسی، Fable 5.1 را با امتیاز ۷۰ و Astra را با امتیاز ۶۷ قرار داده است.
البته این مقایسه کاملاً مستقیم نیست، زیرا دو مدل در محیطهای متفاوتی آزمایش شدهاند. بنابراین نمیتوان تنها با تکیه بر این اعداد، یک برنده قطعی تعیین کرد.
یکی از مزیتهای Astra در این بخش، مصرف کمتر توکن است. طبق اندازهگیری Artificial Analysis، Astra برای رسیدن به عملکرد خود در برخی شرایط به توکنهای بسیار کمتری نیاز دارد.
در ریاضیات و علوم کدام مدل بهتر است؟
در این بخش Astra عملکرد بسیار خوبی نشان داده است.
GPT-6 Astra در آزمون FrontierMath Tier 4 امتیاز ۹۷.۶ درصد را کسب کرده، در حالی که امتیاز Fable 5.1 برابر با ۸۷.۸ درصد گزارش شده است.
در برخی آزمونهای علمی نیز Astra عملکرد بالاتری داشته است. بنابراین برای کارهایی که به ریاضیات پیشرفته، علوم و حل مسائل فنی نیاز دارند، Astra گزینه قدرتمندی محسوب میشود.
با این حال، Fable 5.1 در آزمون Humanity’s Last Exam با ابزارها عملکرد بهتری داشته است. امتیاز این مدل ۶۵ درصد و امتیاز Astra برابر با ۵۷.۲ درصد بوده است.
این تفاوت نشان میدهد که «استدلال» یک مفهوم واحد نیست و ممکن است یک مدل در نوع خاصی از مسائل بهتر عمل کند.
کار با رایانه؛ نقطه قوت GPT-6 Astra
یکی از مهمترین نقاط قوت Astra توانایی کار با رایانه است.
این مدل میتواند در برخی محیطها با نرمافزارها و رابطهای کاربری تعامل داشته باشد. برای مثال، انجام کارهایی که نیازمند کلیک، جابهجایی بین نرمافزارها یا تولید فایلهای حرفهای هستند، از کاربردهای مهم آن محسوب میشوند.
در آزمون OSWorld 2.0، OpenAI برای Astra امتیاز ۷۲.۶ درصد را گزارش کرده است. این موضوع نشان میدهد که مدلهای جدید در حال نزدیک شدن به مرحلهای هستند که میتوانند برخی کارهای دیجیتال روزمره را بهصورت خودکار انجام دهند.
قیمت؛ تفاوت اصلی کجاست؟
در نگاه اول، قیمت هر دو مدل یکسان است. هر دو مدل برای هر یک میلیون توکن ورودی ۱۰ دلار و برای هر یک میلیون توکن خروجی ۵۰ دلار قیمتگذاری شدهاند.
اما هزینه واقعی همیشه فقط به قیمت هر توکن بستگی ندارد.
برای مثال، قیمت خواندن توکنهای ذخیرهشده در حافظه یا Cache در Claude Fable 5.1 بسیار کمتر است. این هزینه در Fable 5.1 حدود ۰.۲۵ دلار به ازای یک میلیون توکن است، در حالی که برای Astra یک دلار اعلام شده است.
همچنین در Astra، اگر ورودی از ۲۷۲ هزار توکن بیشتر شود، هزینه بیشتری دریافت میشود؛ در حالی که Claude Fable 5.1 برای استفاده از پنجره یک میلیون توکنی خود چنین هزینه اضافی ندارد.
بنابراین برای پروژههایی که دائماً حجم زیادی از اطلاعات را به مدل ارسال میکنند، Claude میتواند از نظر قیمت مزیت داشته باشد.
هوش مصنوعی کلود یا هوش مصنوعی چت جی پی تی؟
اگر بخواهیم نتیجه مقاله را به زبان ساده بیان کنیم، انتخاب بین هوش مصنوعی کلود و هوش مصنوعی چت جی پی تی به نوع کار بستگی دارد.
اگر هدف شما کار با رایانه، تولید فایلهای حرفهای، ریاضیات، علوم، برخی کاربردهای امنیت سایبری و کاهش هزینه واقعی هر وظیفه باشد، GPT-6 Astra انتخاب قدرتمندی است.
در مقابل، اگر استدلال عمیق، کار با حجم بسیار زیاد اطلاعات و استفاده طولانیمدت از عاملهای هوش مصنوعی برای شما اهمیت دارد، Claude Fable 5.1 میتواند گزینه مناسبتری باشد.
آیا بنچمارکها میتوانند برنده را مشخص کنند؟
یکی از مهمترین نکات مقاله DataCamp این است که نباید فقط به جدولهای بنچمارک اعتماد کرد.
OpenAI در جدولهای خود Astra را در بسیاری از آزمونها بالاتر از Fable 5.1 نشان میدهد، اما ارزیابی مستقل Artificial Analysis در برخی شاخصهای مهم Claude را بالاتر قرار داده است.
این اختلاف نشان میدهد که روش آزمایش، ابزارهایی که در اختیار مدل قرار میگیرند و نحوه اجرای آزمون میتوانند روی نتیجه تأثیر بگذارند.
به همین دلیل، برای انتخاب یک مدل بهتر است علاوه بر بنچمارکها، آن را با کارهای واقعی خودتان نیز آزمایش کنید.
جمعبندی
GPT-6 Astra و Claude Fable 5.1 هر دو از قدرتمندترین مدلهای نسل جدید هستند، اما نقاط قوت یکسانی ندارند.
Astra بیشتر برای کار با رایانه، کدنویسی، ریاضیات، علوم، تولید خروجیهای حرفهای و انجام وظایف بهصورت عاملمحور مناسب است. Claude Fable 5.1 نیز در استدلال عمیق، برخی آزمونهای عمومی و کار با حافظه و ورودیهای طولانی مزیتهایی دارد.
بنابراین نمیتوان گفت یکی از این دو مدل در همه زمینهها برنده است. انتخاب بین هوش مصنوعی کلود و هوش مصنوعی چت جی پی تی باید بر اساس نوع کار، هزینه، حجم اطلاعات و میزان خودکارسازی موردنیاز انجام شود.
مهمتر از رتبه یک مدل در جدولهای بنچمارک، این است که کدام مدل بتواند کار واقعی شما را با کیفیت، سرعت و هزینه مناسب انجام دهد.

2 Comments
کیا جهانمردی
برای یک برنامهنویس، بهتر نیست قبل از انتخاب مدل چند پروژه واقعی خودش را با هر دو مدل آزمایش کند؟
کارشناس روابط عمومی
بله، این کار میتواند معیار عملیتری نسبت به تکیه صرف بر نتایج بنچمارکها باشد، مخصوصاً وقتی نوع پروژه مشخص است.