FinLLM @ IJCAI 2026 · Bremen · 15 August 2026
Benchmarking 20 frontier & open-weight LLMs on long-context annual-report QA
Jan Spörer · University of St. Gallen, Switzerland · jan.spoerer@whu.edu
| # | Model | Acc. | Hall. | Type |
|---|---|---|---|---|
| 1 | Claude Opus 4.6 | 88.4% | 6.4% | closed |
| 2 | Claude Sonnet 4.6 | 86.7% | 6.4% | closed |
| 3 | Kimi K2.6 · Moonshot | 83.5% | 0.13% | open |
| human baseline 82.8% accuracy | ||||
| 4 | GLM 5 · Zhipu | 82.0% | 2.5% | open non-reas. |
| 5 | Mistral 3 | 81.3% | 13.0% | open non-reas. |
| 6 | Grok 4.1 | 80.9% | 5.2% | closed |
| 13 | Gemini 2.5 Pro · lowest hall. | 76.6% | 0.08% | closed |
| Model | Route | Ref. | Companies |
|---|---|---|---|
| Kimi K2.6 | Moonshot | 20 | Kw. Moutai, Nintendo, Ind. Bank, R. Lauren |
| Kimi K2.6 | NanoGPT* | 0 | same 20 Q: all answered |
| DeepSeek R1 | DeepSeek | 5 | Kw. Moutai (CN) |
| DeepSeek V3.1 | DeepSeek | 5 | Kw. Moutai (CN) |
| DeepSeek V3.2 | DeepSeek | 5 | Kw. Moutai (CN) |
| GLM 5 | Zhipu | 3 | R. Lauren (US), PTT Public (TH) |
| GLM-4.7 | OpenRouter* | 0 | none |
| Qwen3-Max | OpenRouter* | 0 | none |
| ERNIE 5.1 | NanoGPT* | 0 | none |