عملکرد جمینای 2.5 Deep Think در بنچمارک‌ها

مدل جمینای 2.5 Deep Think در آزمون Humanity’s Last Exam (HLE) که شامل هزاران سؤال در حوزه‌های ریاضی، علوم انسانی و علوم پایه می‌شود، عملکرد بهتری نسبت به رقبا داشته و بدون استفاده از ابزار امتیاز 34.8 درصد را کسب کرده است. برای مقایسه، Grok 4 از xAI امتیاز 25.4 درصد و مدل o3 از OpenAI امتیاز 20.3 درصد را کسب کرده‌اند.

در زمینه برنامه‌نویسی نیز این مدل در آزمون LiveCodeBench6 با امتیاز 87.6 درصد عملکرد بهتری نسبت به Grok 4 (با 79 درصد) و o3 (با 72 درصد) داشته است.

Gemini 2.5 Deep Think به‌صورت خودکار از ابزارهایی مانند اجرای کد و موتور جستجوی گوگل استفاده می‌کند و قادر است پاسخ‌هایی بسیار طولانی‌تر و دقیق‌تر نسبت به مدل‌های سنتی ارائه دهد. گوگل می‌گوید این مدل در تولید پروژه‌های توسعه وب هم از نظر بصری و هم جزئیات، نسبت به رقبا برتری داشته و می‌تواند به فرایند کشف و پژوهش سرعت بیشتری بدهد.

گوگل همچنین قصد دارد نسخه‌ای از مدل هوش مصنوعی Gemini 2.5 Deep Think که در المپیاد جهانی ریاضی (IMO) امسال توانسته بود مدال طلا کسب کند را در اختیار گروهی از ریاضی‌دانان و پژوهشگران قرار دهد.

گوگل در هفته‌های آینده این مدل را از طریق API در اختیار گروهی از توسعه‌دهندگان و شرکت‌ها قرار می‌دهد تا کاربردهای تجاری و تحقیقاتی آن بررسی شود.




.: Weblog Themes By Pichak :.