ملاحظة: هذا الترتيب يعتمد على 50 معيار تقييم من أوثق الاختبارات العالمية، وتمت تصفيتها عبر خوارزمية CII التي تتحيز للذكاء العميق والاستنتاج على حساب السرعة والتكلفة.
لمعرفة تفاصيل الصراع بين العمالقة (Google, OpenAI, Anthropic) وثورة النماذج الصينية المفتوحة، شاهد الحلقة الكاملة:
Composite Intelligence Index هو المعيار الفاصل لعام 2025. على عكس التقييمات التقليدية، تم هندسة هذا المؤشر للإجابة على سؤال واحد: "أيهم أذكى؟" وليس "أيهم أسرع؟".
-
الوزن الأكبر (30%): لاختبار Humanity's Last Exam (HLE) (أصعب اختبار عرفته البشرية).
-
التركيز: القدرات الاستنتاجية، الموسوعية، والعمل كوكيل (Agent).
-
التفاصيل التقنية .
صراع العروش بين عمالقة التكنولوجيا. شهد هذا العام عودة جوجل للانتقام، وتميز OpenAI في الرياضيات، وحكمة Claude في المهام الحساسة.
| النموذج (Model) | CII Score | HLE | Intelligence Index | Omniscience Index | GPQA Diamond | AIME 2025 | Terminal-Bench | τ²-Bench | AA-LCR | MMLU-Pro | LiveCodeBench | SciCode | IFBench | CritPt | MMMU Pro | Context | Price (1M) | Speed (T/s) | Latency | Company | Link |
| Gemini 3 Pro (high) 👑 | 96.2% | 37.2% | 73 | 13 | 91% | 96% | 39% | 87% | 71% | 90% | 92% | 56% | 70% | 9% | 80% | 1M | $4.50 | 134 | 29.34s | Try | |
| GPT-5.2 (xhigh) | 92.1% | 31.4% | 73 | -4 | 90% | 99% | 44% | 85% | 73% | 87% | 89% | 52% | 75% | -- | -- | 400k | $4.81 | 117 | 39.20s | OpenAI | Try |
| Claude Opus 4.5 (Thinking) | 89.4% | 28% | 70 | 10 | 87% | 91% | 44% | 90% | 74% | 90% | 87% | 50% | 58% | 5% | 74% | 200k | $10.00 | 43 | 1.63s | Anthropic | Try |
| Grok 4 | 85.2% | 25.4% | 73 | 1 | 88% | 95% | 38% | 75% | 68% | 87% | 82% | 46% | 54% | 2% | 69% | 256k | $6.00 | 75 | 5.78s | xAI | Try |
| GPT-5.1 Codex (high) | 84.9% | 23% | 67 | -7 | 86% | 96% | 33% | 83% | 67% | 86% | 85% | 40% | 70% | 0% | 73% | 400k | $3.44 | 287 | 9.62s | OpenAI | Try |
| o3 | 83.0% | 20% | 65 | -17 | 83% | 88% | 35% | 81% | 69% | 85% | 81% | 41% | 71% | 0% | 70% | 200k | $3.50 | 350 | 9.23s | OpenAI | Try |
| Claude 4.5 Sonnet | 78.0% | 17% | 63 | -2 | 83% | 88% | 33% | 78% | 66% | 88% | 71% | 45% | 57% | 1% | 69% | 1M | $6.00 | 65 | 2.01s | Anthropic | Try |
| GPT-5.1 Codex mini | 77.5% | 17% | 62 | -18 | 81% | 92% | 31% | 63% | 63% | 82% | 84% | 43% | 68% | 0% | 69% | 400k | $0.69 | 167 | 10.38s | OpenAI | Try |
| Grok 4.1 Fast | 74.8% | 18% | 64 | -31 | 85% | 89% | 23% | 93% | 68% | 85% | 82% | 44% | 53% | 3% | 63% | 2M | $0.28 | 152 | 5.38s | xAI | Try |
| Nova 2.0 Pro (medium) | 71.2% | 9% | 62 | -50 | 79% | 89% | 23% | 93% | 54% | 83% | 73% | 43% | 79% | 0% | 65% | 256k | $3.44 | 134 | 19.76s | Amazon | Try |
| Claude Opus 4.5 (base) | 70.5% | 13% | 60 | -6 | 81% | 63% | 38% | 86% | 65% | 89% | 74% | 47% | 43% | 0% | 71% | 200k | $10.00 | 48 | 1.35s | Anthropic | Try |
| Qwen3 Max Thinking | 69.8% | 12% | 56 | -40 | 78% | 82% | 16% | 84% | 58% | 82% | 54% | 39% | 54% | 0% | -- | 262k | $2.40 | 39 | 1.58s | Alibaba | Try |
| Gemini 2.5 Pro | 69.2% | 21% | 60 | -18 | 84% | 88% | 25% | 54% | 66% | 86% | 80% | 43% | 49% | 3% | 75% | 1M | $3.44 | 164 | 35.74s | Try | |
| Claude 4.5 Haiku | 66.4% | 10% | 55 | -6 | 67% | 84% | 26% | 55% | 70% | 76% | 62% | 43% | 54% | 0% | 58% | 200k | $2.00 | 89 | 0.39s | Anthropic | Try |
-
Gemini 3 Pro (الملك الجديد): اكتسح الجميع بنسبة 96.2% في المؤشر المركب، وسياق ضخم (1M)، وتفوق بـ 10 نقاط كاملة في أصعب اختبار بشري (HLE 37.2%). إنه الخيار الأول للباحثين والمؤلفين.
-
GPT-5.2 (عبقري الرياضيات): حقق 99% في AIME 2025. إذا كانت لديك مشكلة فيزياء نووية أو رياضيات معقدة، فهذا هو نموذجك، لكنه يعاني من ضعف الذاكرة الموسوعية.
-
Claude Opus 4.5 (الحكيم): الأبطأ والأغلى، لكنه الأكثر أماناً وأخلاقية. هو الخيار للقرارات الحساسة وعقود المحاماة والبرمجة الآمنة.
ثورة "النمور الصينية". النماذج المفتوحة لم تعد مجرد ظلال، بل أصبحت تتفوق على نظيراتها المغلقة في استخدام الأدوات والكفاءة الاقتصادية.
| النموذج (Model) | Company | Intelligence Index | Omniscience Index | Terminal-Bench | τ²-Bench | AA-LCR | HLE | MMLU-Pro | GPQA Diamond | LiveCodeBench | SciCode | IFBench | AIME 2025 | CritPt | MMMU Pro | Price (1M) | Speed (T/s) | Latency | CII Score | Link |
| GLM-4.7 🥇 | Zhipu AI | 68 | -- | 30% | 96% | 64% | 25% | 86% | 86% | 89% | 45% | 68% | 95% | -- | -- | $0.88 | 121 | 0.74 | 81.4% | Repo |
| DeepSeek V3.2 🥈 | DeepSeek | 66 | -23 | 33% | 91% | 65% | 22% | 86% | 86% | 86% | 39% | 61% | 92% | 3% | -- | $0.32 | 30 | 1.33 | 78.8% | Chat |
| Kimi K2 Thinking 🥉 | Moonshot | 67 | -23 | 29% | 93% | 66% | 22% | 85% | 84% | 85% | 42% | 68% | 95% | 3% | -- | $1.07 | 101 | 0.63 | 78.5% | Web |
| MiMo-V2-Flash | Xiaomi | 66 | -42 | 26% | 95% | 63% | 21% | 84% | 85% | 87% | 39% | 64% | 96% | 0% | -- | $0.15 | 124 | 1.42 | 77.2% | Link |
| gpt-oss-120B | OpenAI | 61 | -52 | 22% | 66% | 51% | 19% | 81% | 78% | 88% | 39% | 69% | 93% | 1% | -- | $0.26 | 348 | 0.40 | 72.9% | Repo |
| MiniMax-M2.1 | MiniMax | 64 | -18 | 27% | 85% | 59% | 22% | 83% | 81% | 70% | 83% | 0% | -- | -- | -- | $0.53 | 65 | 1.27 | 71.5% | Web |
| Qwen3 235B | Alibaba | 57 | -48 | 13% | 53% | 67% | 15% | 79% | 79% | 51% | 91% | 0% | -- | 0% | -- | $2.63 | 75 | 1.07 | 63.8% | Repo |
-
GLM-4.7 (الإمبراطور): كسر حاجز الـ 25% في اختبار HLE، وتفوق على النماذج المغلقة في استخدام الأدوات (96% في τ²-Bench). إنه الخيار الأول لبناء الوكلاء (AI Agents).
-
DeepSeek V3.2 (المعجزة الاقتصادية): يقدم 90% من أداء العمالقة بسعر أقل بـ 30 مرة! مثالي للشركات الناشئة ومعالجة البيانات الضخمة (Batch Processing).
-
Kimi K2 (المفارقة التقنية): نموذج بتريليون بارامتر يعمل بذكاء الخبراء (MoE). قوي جداً في السياق الطويل والمهام القانونية.
Composite Intelligence Index v1.0
تم تصميم هذا المؤشر ليكون "متحيزاً للذكاء" (Intelligence-Biased)، ومهمته تقليل ضجيج مقاييس السرعة والتكلفة لصالح القدرات العقلية الصرفة.
يعتمد المؤشر على الوسط الحسابي المرجح بعد معايرة القيم (Normalization) إلى نطاق (0-1).
-
🟢 30% - قدرات الذكاء الخارق (Humanity's Last Exam): المعيار الأهم لعام 2025 لقياس حل المشكلات غير المسبوقة.
-
🔵 35% - القدرات المعرفية الأساسية (Core Intelligence): يشمل الرياضيات (AIME)، العلوم (GPQA)، والمعرفة العامة.
-
🟣 30% - القدرات الوكيلية والتخصصية (Agentic): البرمجة (LiveCode)، استخدام الأدوات (τ²-Bench)، والسياق الطويل.
-
🔴 5% - الكفاءة التشغيلية (Efficiency): السرعة والسعر (وزن منخفض لضمان التركيز على الجودة).
اضغط هنا لعرض تفاصيل الاختبارات (HLE, AIME, GPQA...)
- Humanity's Last Exam (HLE): أصعب اختبار تم تصميمه حتى الآن، يقيس القدرة على حل مشاكل لم تكن موجودة في بيانات التدريب.
-
Omniscience Index: يقيس اتساع المعرفة الموسوعية.
-
GPQA Diamond: اختبار مستوى الدكتوراه في العلوم (بيولوجيا، فيزياء، كيمياء).
-
AIME 2025: أولمبياد الرياضيات، يقيس التفكير المنطقي المتسلسل.
-
Terminal-Bench Hard: القدرة على العمل داخل سطر الأوامر (Command Line).
-
τ²-Bench (Telecom): مهارة استخدام الأدوات والواجهات البرمجية (APIs).
-
SciCode: كتابة أكواد لمحاكاة مشاكل علمية.
تم إعداد هذا التقرير بواسطة مجتمع بايثون العربي © 2025
شارك الصفحة وادعم المحتوى العربي التقني
YouTube | Patreon
