ArabicNLP 2026 · Final Results
AISA-ArabicFC — Final Leaderboard
Official final results on the held-out test set (1,125 samples), computed with the open scorer. Track A & B are the core rankings; Track C is a dialect-robustness diagnostic (how evenly a system handles all five Arabic dialects). Top systems verified for reproducibility. 🎉
🥈
2nd place
Yalla
0.9273
Overall
🥇
1st place
Ṣaqr (صقر)
0.9279
Overall
🥉
3rd place
QMUL_AK
0.9253
Overall
Overall (Track A) = 0.40 · FnAcc + 0.60 · ArgEM
| Rank | Team | Overall | FnAcc | ArgEM ★ |
|---|---|---|---|---|
| 🥇 1 | Ṣaqr (صقر) | 0.9279 | 0.9973 | 0.8816 |
| 🥈 2 | Yalla | 0.9273 | 0.9973 | 0.8806 |
| 🥉 3 | QMUL_AK | 0.9253 | 0.9938 | 0.8796 |
| 4 | الشاهق | 0.9189 | 0.9973 | 0.8666 |
| 5 | Arabic Function Forge | 0.9169 | 0.9893 | 0.8686 |
| 6 | Thaka | 0.9163 | 0.9893 | 0.8676 |
| 7 | PuDyDG | 0.9111 | 0.9973 | 0.8536 |
| 8 | ArgTune Arabs | 0.9089 | 0.9964 | 0.8506 |
| 9 | Durham-Jazan | 0.8928 | 0.9938 | 0.8255 |
| 10 | وكلاء العربية | 0.8870 | 0.9778 | 0.8265 |
| 11 | MOSKA-LLM | 0.8780 | 0.9689 | 0.8175 |
| 12 | Saudi Legal FC | 0.8729 | 0.9831 | 0.7994 |
| 13 | farah | 0.8690 | 0.8862 | 0.8576 |
| 14 | GymMinds | 0.8614 | 0.9964 | 0.7713 |
| 15 | ToolCallers | 0.8506 | 0.9636 | 0.7753 |
| 16 | واجه | 0.7904 | 0.9138 | 0.7081 |
| 17 | Optimal | 0.7232 | 0.9324 | 0.5838 |
🥈
2nd place
Yalla
0.9395
Overall
🥇
1st place
Ṣaqr (صقر)
0.9400
Overall
🥉
3rd place
QMUL_AK
0.9380
Overall
Overall (Track B) = 0.30 · FnAcc + 0.50 · ArgEM + 0.20 · ThinkRate
| Rank | Team | Overall | FnAcc | ArgEM ★ | ThinkRate |
|---|---|---|---|---|---|
| 🥇 1 | Ṣaqr (صقر) | 0.9400 | 0.9973 | 0.8816 | 1.0000 |
| 🥈 2 | Yalla | 0.9395 | 0.9973 | 0.8806 | 1.0000 |
| 🥉 3 | QMUL_AK | 0.9380 | 0.9938 | 0.8796 | 1.0000 |
| 4 | Arabic Function Forge | 0.9311 | 0.9893 | 0.8686 | 1.0000 |
| 5 | Thaka | 0.9306 | 0.9893 | 0.8676 | 1.0000 |
| 6 | PuDyDG | 0.9260 | 0.9973 | 0.8536 | 1.0000 |
| 7 | Sa74ll | 0.9149 | 0.9947 | 0.8455 | 0.9689 |
| 8 | Durham-Jazan | 0.9109 | 0.9938 | 0.8255 | 1.0000 |
| 9 | مَكين | Makeen | 0.9106 | 0.9911 | 0.8265 | 1.0000 |
| 10 | Siraj | 0.9101 | 0.9929 | 0.8245 | 1.0000 |
| 11 | وكلاء العربية | 0.9066 | 0.9778 | 0.8265 | 1.0000 |
| 12 | Saudi Legal FC | 0.8946 | 0.9831 | 0.7994 | 1.0000 |
| 13 | farah | 0.8936 | 0.8862 | 0.8576 | 0.9947 |
| 14 | GymMinds | 0.8718 | 0.9964 | 0.7713 | 0.9360 |
| 15 | واجه | 0.8282 | 0.9138 | 0.7081 | 1.0000 |
| 16 | TIGER | 0.8037 | 0.9929 | 0.6690 | 0.8569 |
| 17 | Optimal | 0.7137 | 0.9324 | 0.5838 | 0.7102 |
🥈
2nd place
الشاهق
0.9031
Macro-dialect
🥇
1st place
QMUL_AK
0.9075
Macro-dialect
🥉
3rd place
Ṣaqr (صقر)
0.8994
Macro-dialect
Track C = macro-average of per-dialect Overall (equal weight per dialect) · gap = max−min
| Rank | Team | Macro | MSA | Gulf | Egy | Lev | Maghrebi | Gap |
|---|---|---|---|---|---|---|---|---|
| 🥇 1 | QMUL_AK | 0.9075 | 0.935 | 0.915 | 0.932 | 0.897 | 0.859 | 0.077 |
| 🥈 2 | الشاهق | 0.9031 | 0.924 | 0.934 | 0.925 | 0.891 | 0.841 | 0.093 |
| 🥉 3 | Ṣaqr (صقر) | 0.8994 | 0.942 | 0.913 | 0.935 | 0.902 | 0.806 | 0.136 |
| 4 | Thaka | 0.8978 | 0.929 | 0.910 | 0.903 | 0.901 | 0.847 | 0.082 |
| 5 | Yalla | 0.8957 | 0.946 | 0.892 | 0.928 | 0.907 | 0.806 | 0.140 |
| 6 | Arabic Function Forge | 0.8847 | 0.933 | 0.890 | 0.933 | 0.880 | 0.788 | 0.145 |
| 7 | PuDyDG | 0.8800 | 0.930 | 0.902 | 0.904 | 0.876 | 0.788 | 0.142 |
| 8 | ArgTune Arabs | 0.8754 | 0.920 | 0.918 | 0.918 | 0.886 | 0.735 | 0.184 |
| 9 | Sa74ll | 0.8751 | 0.922 | 0.923 | 0.891 | 0.862 | 0.776 | 0.147 |
| 10 | Siraj | 0.8703 | 0.906 | 0.922 | 0.852 | 0.883 | 0.788 | 0.134 |
| 11 | Durham-Jazan | 0.8678 | 0.911 | 0.901 | 0.856 | 0.883 | 0.788 | 0.123 |
| 12 | وكلاء العربية | 0.8658 | 0.894 | 0.919 | 0.859 | 0.904 | 0.753 | 0.166 |
| 13 | مَكين | Makeen | 0.8647 | 0.905 | 0.870 | 0.901 | 0.878 | 0.771 | 0.134 |
| 14 | MOSKA-LLM | 0.8592 | 0.888 | 0.877 | 0.869 | 0.874 | 0.788 | 0.100 |
| 15 | Saudi Legal FC | 0.8547 | 0.884 | 0.913 | 0.836 | 0.864 | 0.776 | 0.136 |
| 16 | farah | 0.8464 | 0.868 | 0.872 | 0.916 | 0.859 | 0.718 | 0.198 |
| 17 | GymMinds | 0.8335 | 0.876 | 0.865 | 0.828 | 0.881 | 0.718 | 0.163 |
| 18 | ToolCallers | 0.8247 | 0.868 | 0.841 | 0.821 | 0.858 | 0.735 | 0.132 |
| 19 | TIGER | 0.7804 | 0.810 | 0.807 | 0.779 | 0.788 | 0.718 | 0.092 |
| 20 | واجه | 0.7661 | 0.797 | 0.798 | 0.798 | 0.791 | 0.647 | 0.151 |
| 21 | Optimal | 0.6950 | 0.739 | 0.685 | 0.726 | 0.713 | 0.612 | 0.128 |
Metrics
- FnAcc — function-name accuracy (all rows). ArgEM ★ — exact argument match (positive rows, Arabic normalization). ThinkRate — Track B reasoning-trace rate.
- Track A =
0.40·FnAcc + 0.60·ArgEM· Track B =0.30·FnAcc + 0.50·ArgEM + 0.20·ThinkRate. - Track C (dialect robustness) = the macro-average of each system's per-dialect Overall across MSA, Gulf, Egyptian, Levantine and Maghrebi — equal weight per dialect, so it rewards handling all dialects (not just the frequent ones).
gap= max−min across dialects (lower = more consistent). - Fair Arabic normalization is applied identically to predictions and gold; the scorer is open in this Space. Top submissions were verified via model + code.
Next
System-description papers due August 22, 2026. Dataset: TuwaiqAcademy/AISA-ArabicFC · Questions → trdc@tuwaiq.edu.sa. Organized by Tuwaiq Academy · ArabicNLP 2026.