gpt-5.6-luna · Released 09 July 2026
| Provider | OpenAI |
|---|---|
| Family | GPT-5.6 |
| Modality | multimodal |
| Context | 1,050,000 tokens |
| Max output | 128,000 tokens |
| Reasoning | Yes |
| Tool calling | Yes |
| Structured output | Yes |
| Open weights | No / not recorded |
| Licence | — |
No verified Cybatar-run benchmark result has been published for this model yet.
Versioned observations tied to the exact deployment and source date.
Price reduction effective July 30, 2026.
Evidence ↗Official-source release record for the exact GPT-5.6 Luna model version.
Evidence ↗Reported by independent evaluators or the model provider. These are contextual research observations, not Cybatar-run scores.
| Benchmark | Score | Configuration / harness | Provenance | Source |
|---|---|---|---|---|
| Artificial Analysis Intelligence Index v4.1.1 | 52 | Model evaluation · reasoning effort: max | Independent | Artificial Analysis |
| GPQA Diamond 2026 | 92.3 % | Model evaluation · provider reported configuration: OpenAI launch evaluation | Provider Reported | OpenAI |
| FrontierMath Tier 1-3 v2 | 78.6 % | Model evaluation · provider reported configuration: OpenAI launch evaluation | Provider Reported | OpenAI |
| FrontierMath Tier 4 v2 | 58.5 % | Model evaluation · provider reported configuration: OpenAI launch evaluation | Provider Reported | OpenAI |
| MMMU-Pro (no tools) 2026 | 78.4 % | Model evaluation · provider reported configuration: OpenAI launch evaluation | Provider Reported | OpenAI |
| MMMU-Pro (with tools) 2026 | 79.5 % | Model evaluation · provider reported configuration: OpenAI launch evaluation | Provider Reported | OpenAI |
| AutomationBench 2026 | 14.9 % | Model evaluation · provider reported configuration: OpenAI launch evaluation | Provider Reported | OpenAI |
| GDP.pdf 2026 | 22.7 % | Model evaluation · provider reported configuration: OpenAI launch evaluation | Provider Reported | OpenAI |
| HealthBench Professional 2026 | 55.7 % | Model evaluation · provider reported configuration: OpenAI launch evaluation | Provider Reported | OpenAI |
| Terminal-Bench 2.1 | 84.7 % | Model evaluation · provider reported configuration: OpenAI launch evaluation | Provider Reported | OpenAI |
| DeepSWE 1.1 | 67.2 % | Model evaluation · provider reported configuration: OpenAI launch evaluation | Provider Reported | OpenAI |