Skip to content

Latest commit

 

History

History
154 lines (86 loc) · 11.2 KB

File metadata and controls

154 lines (86 loc) · 11.2 KB

🏆 حصاد الذكاء الاصطناعي 2025: ترتيب أقوى النماذج عالمياً

The 2025 AI Model Leaderboard: Global Rankings based on Composite Intelligence Index (CII)

ملاحظة: هذا الترتيب يعتمد على 50 معيار تقييم من أوثق الاختبارات العالمية، وتمت تصفيتها عبر خوارزمية CII التي تتحيز للذكاء العميق والاستنتاج على حساب السرعة والتكلفة.

📺 الفيديو الشامل: حصاد الذكاء الاصطناعي 2025

شاهد التحليل العميق للصراع بين Google و OpenAI والنماذج الصينية

شاهد الفيديو على يوتيوب


Watch on YouTube Subscribe

## 📺 شاهد التحليل الكامل (فيديو الحصاد)

لمعرفة تفاصيل الصراع بين العمالقة (Google, OpenAI, Anthropic) وثورة النماذج الصينية المفتوحة، شاهد الحلقة الكاملة:

🧠 ما هو مؤشر الذكاء المركّب (CII)؟

Composite Intelligence Index هو المعيار الفاصل لعام 2025. على عكس التقييمات التقليدية، تم هندسة هذا المؤشر للإجابة على سؤال واحد: "أيهم أذكى؟" وليس "أيهم أسرع؟".

  • الوزن الأكبر (30%): لاختبار Humanity's Last Exam (HLE) (أصعب اختبار عرفته البشرية).

  • التركيز: القدرات الاستنتاجية، الموسوعية، والعمل كوكيل (Agent).

  • التفاصيل التقنية .

🥇 أولاً: النماذج المغلقة المصدر (Closed Source Models)

صراع العروش بين عمالقة التكنولوجيا. شهد هذا العام عودة جوجل للانتقام، وتميز OpenAI في الرياضيات، وحكمة Claude في المهام الحساسة.

النموذج (Model) CII Score HLE Intelligence Index Omniscience Index GPQA Diamond AIME 2025 Terminal-Bench τ²-Bench AA-LCR MMLU-Pro LiveCodeBench SciCode IFBench CritPt MMMU Pro Context Price (1M) Speed (T/s) Latency Company Link
Gemini 3 Pro (high) 👑 96.2% 37.2% 73 13 91% 96% 39% 87% 71% 90% 92% 56% 70% 9% 80% 1M $4.50 134 29.34s Google Try
GPT-5.2 (xhigh) 92.1% 31.4% 73 -4 90% 99% 44% 85% 73% 87% 89% 52% 75% -- -- 400k $4.81 117 39.20s OpenAI Try
Claude Opus 4.5 (Thinking) 89.4% 28% 70 10 87% 91% 44% 90% 74% 90% 87% 50% 58% 5% 74% 200k $10.00 43 1.63s Anthropic Try
Grok 4 85.2% 25.4% 73 1 88% 95% 38% 75% 68% 87% 82% 46% 54% 2% 69% 256k $6.00 75 5.78s xAI Try
GPT-5.1 Codex (high) 84.9% 23% 67 -7 86% 96% 33% 83% 67% 86% 85% 40% 70% 0% 73% 400k $3.44 287 9.62s OpenAI Try
o3 83.0% 20% 65 -17 83% 88% 35% 81% 69% 85% 81% 41% 71% 0% 70% 200k $3.50 350 9.23s OpenAI Try
Claude 4.5 Sonnet 78.0% 17% 63 -2 83% 88% 33% 78% 66% 88% 71% 45% 57% 1% 69% 1M $6.00 65 2.01s Anthropic Try
GPT-5.1 Codex mini 77.5% 17% 62 -18 81% 92% 31% 63% 63% 82% 84% 43% 68% 0% 69% 400k $0.69 167 10.38s OpenAI Try
Grok 4.1 Fast 74.8% 18% 64 -31 85% 89% 23% 93% 68% 85% 82% 44% 53% 3% 63% 2M $0.28 152 5.38s xAI Try
Nova 2.0 Pro (medium) 71.2% 9% 62 -50 79% 89% 23% 93% 54% 83% 73% 43% 79% 0% 65% 256k $3.44 134 19.76s Amazon Try
Claude Opus 4.5 (base) 70.5% 13% 60 -6 81% 63% 38% 86% 65% 89% 74% 47% 43% 0% 71% 200k $10.00 48 1.35s Anthropic Try
Qwen3 Max Thinking 69.8% 12% 56 -40 78% 82% 16% 84% 58% 82% 54% 39% 54% 0% -- 262k $2.40 39 1.58s Alibaba Try
Gemini 2.5 Pro 69.2% 21% 60 -18 84% 88% 25% 54% 66% 86% 80% 43% 49% 3% 75% 1M $3.44 164 35.74s Google Try
Claude 4.5 Haiku 66.4% 10% 55 -6 67% 84% 26% 55% 70% 76% 62% 43% 54% 0% 58% 200k $2.00 89 0.39s Anthropic Try

💡 رؤى تحليلية (Closed Source Insights)

  • Gemini 3 Pro (الملك الجديد): اكتسح الجميع بنسبة 96.2% في المؤشر المركب، وسياق ضخم (1M)، وتفوق بـ 10 نقاط كاملة في أصعب اختبار بشري (HLE 37.2%). إنه الخيار الأول للباحثين والمؤلفين.

  • GPT-5.2 (عبقري الرياضيات): حقق 99% في AIME 2025. إذا كانت لديك مشكلة فيزياء نووية أو رياضيات معقدة، فهذا هو نموذجك، لكنه يعاني من ضعف الذاكرة الموسوعية.

  • Claude Opus 4.5 (الحكيم): الأبطأ والأغلى، لكنه الأكثر أماناً وأخلاقية. هو الخيار للقرارات الحساسة وعقود المحاماة والبرمجة الآمنة.

🥈 ثانياً: النماذج المفتوحة المصدر (Open Source Models)

ثورة "النمور الصينية". النماذج المفتوحة لم تعد مجرد ظلال، بل أصبحت تتفوق على نظيراتها المغلقة في استخدام الأدوات والكفاءة الاقتصادية.

النموذج (Model) Company Intelligence Index Omniscience Index Terminal-Bench τ²-Bench AA-LCR HLE MMLU-Pro GPQA Diamond LiveCodeBench SciCode IFBench AIME 2025 CritPt MMMU Pro Price (1M) Speed (T/s) Latency CII Score Link
GLM-4.7 🥇 Zhipu AI 68 -- 30% 96% 64% 25% 86% 86% 89% 45% 68% 95% -- -- $0.88 121 0.74 81.4% Repo
DeepSeek V3.2 🥈 DeepSeek 66 -23 33% 91% 65% 22% 86% 86% 86% 39% 61% 92% 3% -- $0.32 30 1.33 78.8% Chat
Kimi K2 Thinking 🥉 Moonshot 67 -23 29% 93% 66% 22% 85% 84% 85% 42% 68% 95% 3% -- $1.07 101 0.63 78.5% Web
MiMo-V2-Flash Xiaomi 66 -42 26% 95% 63% 21% 84% 85% 87% 39% 64% 96% 0% -- $0.15 124 1.42 77.2% Link
gpt-oss-120B OpenAI 61 -52 22% 66% 51% 19% 81% 78% 88% 39% 69% 93% 1% -- $0.26 348 0.40 72.9% Repo
MiniMax-M2.1 MiniMax 64 -18 27% 85% 59% 22% 83% 81% 70% 83% 0% -- -- -- $0.53 65 1.27 71.5% Web
Qwen3 235B Alibaba 57 -48 13% 53% 67% 15% 79% 79% 51% 91% 0% -- 0% -- $2.63 75 1.07 63.8% Repo

💡 رؤى تحليلية (Open Source Insights)

  • GLM-4.7 (الإمبراطور): كسر حاجز الـ 25% في اختبار HLE، وتفوق على النماذج المغلقة في استخدام الأدوات (96% في τ²-Bench). إنه الخيار الأول لبناء الوكلاء (AI Agents).

  • DeepSeek V3.2 (المعجزة الاقتصادية): يقدم 90% من أداء العمالقة بسعر أقل بـ 30 مرة! مثالي للشركات الناشئة ومعالجة البيانات الضخمة (Batch Processing).

  • Kimi K2 (المفارقة التقنية): نموذج بتريليون بارامتر يعمل بذكاء الخبراء (MoE). قوي جداً في السياق الطويل والمهام القانونية.

🛠 التوثيق التقني: مؤشر الذكاء المركّب (CII)

Composite Intelligence Index v1.0

تم تصميم هذا المؤشر ليكون "متحيزاً للذكاء" (Intelligence-Biased)، ومهمته تقليل ضجيج مقاييس السرعة والتكلفة لصالح القدرات العقلية الصرفة.

1. المعادلة الهندسية (The Algorithm)

يعتمد المؤشر على الوسط الحسابي المرجح بعد معايرة القيم (Normalization) إلى نطاق (0-1).

$$CII = (W_{HLE} \cdot S_{HLE}) + (W_{Core} \cdot S_{Core}) + (W_{Agent} \cdot S_{Agent}) + (W_{Eff} \cdot S_{Eff})$$

2. توزيع الأوزان (Weights Distribution)

  • 🟢 30% - قدرات الذكاء الخارق (Humanity's Last Exam): المعيار الأهم لعام 2025 لقياس حل المشكلات غير المسبوقة.

  • 🔵 35% - القدرات المعرفية الأساسية (Core Intelligence): يشمل الرياضيات (AIME)، العلوم (GPQA)، والمعرفة العامة.

  • 🟣 30% - القدرات الوكيلية والتخصصية (Agentic): البرمجة (LiveCode)، استخدام الأدوات (τ²-Bench)، والسياق الطويل.

  • 🔴 5% - الكفاءة التشغيلية (Efficiency): السرعة والسعر (وزن منخفض لضمان التركيز على الجودة).

3. شرح المعايير الرئيسية

اضغط هنا لعرض تفاصيل الاختبارات (HLE, AIME, GPQA...)

أ. مجموعة "الذكاء الحرج"

  • Humanity's Last Exam (HLE): أصعب اختبار تم تصميمه حتى الآن، يقيس القدرة على حل مشاكل لم تكن موجودة في بيانات التدريب.

ب. مجموعة "المعرفة والاستنتاج"

  • Omniscience Index: يقيس اتساع المعرفة الموسوعية.

  • GPQA Diamond: اختبار مستوى الدكتوراه في العلوم (بيولوجيا، فيزياء، كيمياء).

  • AIME 2025: أولمبياد الرياضيات، يقيس التفكير المنطقي المتسلسل.

ج. مجموعة "القدرات الوكيلية"

  • Terminal-Bench Hard: القدرة على العمل داخل سطر الأوامر (Command Line).

  • τ²-Bench (Telecom): مهارة استخدام الأدوات والواجهات البرمجية (APIs).

  • SciCode: كتابة أكواد لمحاكاة مشاكل علمية.

تم إعداد هذا التقرير بواسطة مجتمع بايثون العربي © 2025

شارك الصفحة وادعم المحتوى العربي التقني

YouTube | Patreon