[Skip to main content](/content/docs/leaderboards/#main-content/index.html)LinkMenuExpand(external link)DocumentSearchCopyCopied

# Aider LLM Leaderboards

Aider excels with LLMs skilled at writing and _editing_ code,
and uses benchmarks to
evaluate an LLM’s ability to follow instructions and edit code successfully without
human intervention.
[Aider’s polyglot benchmark](/content/2024/12/21/polyglot.html#the-polyglot-benchmark/index.html) tests LLMs on 225 challenging Exercism coding exercises across C++, Go, Java, JavaScript, Python, and Rust.

## Aider polyglot coding leaderboard

ViewSelectDetail

×

|  | Model | Percent correct | Cost | Command | Correct edit format | Edit Format |
| --- | --- | --- | --- | --- | --- | --- |
| ▶ | gpt-5 (high) | 88.0% | $29.08 | `aider --model openai/gpt-5` | 91.6% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2025-08-23-15-47-21--gpt-5-high<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   gpt-5 (high)<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   32faf82<br>   <br>- **Reasoning effort**<br>   <br>  **:**<br>   high<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   52.0<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   88.0<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   117<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   198<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   91.6<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   23<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   22<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   19<br>   <br>- **User asks**<br>   <br>  **:**<br>   96<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   3<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   0<br>   <br>- **Prompt tokens**<br>   <br>  **:**<br>   2675561<br>   <br>- **Completion tokens**<br>   <br>  **:**<br>   2623429<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   3<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model openai/gpt-5`<br>- **Date**<br>   <br>  **:**<br>   2025-08-23<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.86.2.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   194.0<br>   <br>- **Total cost**<br>   <br>  **:**<br>   29.0829 |
| ▶ | gpt-5 (medium) | 86.7% | $17.69 | `aider --model openai/gpt-5` | 88.4% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2025-08-25-13-23-27--gpt-5-medium<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   gpt-5 (medium)<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   32faf82<br>   <br>- **Reasoning effort**<br>   <br>  **:**<br>   medium<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   49.8<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   86.7<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   112<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   195<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   88.4<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   40<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   40<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   26<br>   <br>- **User asks**<br>   <br>  **:**<br>   102<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   0<br>   <br>- **Prompt tokens**<br>   <br>  **:**<br>   2827261<br>   <br>- **Completion tokens**<br>   <br>  **:**<br>   1468799<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   0<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model openai/gpt-5`<br>- **Date**<br>   <br>  **:**<br>   2025-08-25<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.86.2.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   118.7<br>   <br>- **Total cost**<br>   <br>  **:**<br>   17.693 |
| ▶ | o3-pro (high) | 84.9% | $146.32 | `aider --model o3-pro` | 97.8% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2025-06-28-00-38-18--o3-pro-high<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   o3-pro (high)<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   5318380<br>   <br>- **Reasoning effort**<br>   <br>  **:**<br>   high<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   43.6<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   84.9<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   98<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   191<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   97.8<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   20<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   8<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   5<br>   <br>- **User asks**<br>   <br>  **:**<br>   100<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   0<br>   <br>- **Prompt tokens**<br>   <br>  **:**<br>   2372636<br>   <br>- **Completion tokens**<br>   <br>  **:**<br>   1235902<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   1<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model o3-pro`<br>- **Date**<br>   <br>  **:**<br>   2025-06-28<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.85.1.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   449.0<br>   <br>- **Total cost**<br>   <br>  **:**<br>   146.3249 |
| ▶ | gemini-2.5-pro-preview-06-05 (32k think) | 83.1% | $49.88 | `aider --model gemini/gemini-2.5-pro-preview-06-05 --thinking-tokens 32k` | 99.6% | diff-fenced |
| - **Dirname**<br>   <br>  **:**<br>   2025-06-06-16-36-21--gemini0605-32k-think-diff-fenced<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   gemini-2.5-pro-preview-06-05 (32k think)<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff-fenced<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   f827f22<br>   <br>- **Thinking tokens**<br>   <br>  **:**<br>   32768<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   46.2<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   83.1<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   104<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   187<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   99.6<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   1<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   1<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   1<br>   <br>- **User asks**<br>   <br>  **:**<br>   112<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   0<br>   <br>- **Prompt tokens**<br>   <br>  **:**<br>   2719961<br>   <br>- **Completion tokens**<br>   <br>  **:**<br>   4648227<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   0<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model gemini/gemini-2.5-pro-preview-06-05 --thinking-tokens 32k`<br>- **Date**<br>   <br>  **:**<br>   2025-06-06<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.84.1.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   200.3<br>   <br>- **Total cost**<br>   <br>  **:**<br>   49.8822 |
| ▶ | gpt-5 (low) | 81.3% | $10.37 | `aider --model openai/gpt-5` | 86.7% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2025-08-25-14-16-37--gpt-5-low<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   gpt-5 (low)<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   32faf82<br>   <br>- **Reasoning effort**<br>   <br>  **:**<br>   low<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   43.1<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   81.3<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   97<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   183<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   86.7<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   46<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   46<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   30<br>   <br>- **User asks**<br>   <br>  **:**<br>   113<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   1<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   0<br>   <br>- **Prompt tokens**<br>   <br>  **:**<br>   2534059<br>   <br>- **Completion tokens**<br>   <br>  **:**<br>   779568<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   1<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model openai/gpt-5`<br>- **Date**<br>   <br>  **:**<br>   2025-08-25<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.86.2.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   62.4<br>   <br>- **Total cost**<br>   <br>  **:**<br>   10.3713 |
| ▶ | o3 (high) | 81.3% | $21.23 | `aider --model o3 --reasoning-effort high` | 94.7% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2025-06-25-21-04-24--o3-price-reduction-high<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   o3 (high)<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   c48fea6<br>   <br>- **Reasoning effort**<br>   <br>  **:**<br>   high<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   40.0<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   81.3<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   90<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   183<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   94.7<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   25<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   23<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   12<br>   <br>- **User asks**<br>   <br>  **:**<br>   116<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   1<br>   <br>- **Prompt tokens**<br>   <br>  **:**<br>   3148932<br>   <br>- **Completion tokens**<br>   <br>  **:**<br>   2047615<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   2<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model o3 --reasoning-effort high`<br>- **Date**<br>   <br>  **:**<br>   2025-06-25<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.84.1.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   197.3<br>   <br>- **Total cost**<br>   <br>  **:**<br>   21.2259 |
| ▶ | grok-4 (high) | 79.6% | $59.62 | `aider --model openrouter/x-ai/grok-4` | 97.3% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2025-07-11-19-37-40--xai-or-grok4-high<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   grok-4 (high)<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   f7870b6-dirty<br>   <br>- **Reasoning effort**<br>   <br>  **:**<br>   high<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   40.9<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   79.6<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   92<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   179<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   97.3<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   11<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   8<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   6<br>   <br>- **User asks**<br>   <br>  **:**<br>   133<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   0<br>   <br>- **Prompt tokens**<br>   <br>  **:**<br>   2815347<br>   <br>- **Completion tokens**<br>   <br>  **:**<br>   3411480<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   0<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model openrouter/x-ai/grok-4`<br>- **Date**<br>   <br>  **:**<br>   2025-07-11<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.85.2.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   403.2<br>   <br>- **Total cost**<br>   <br>  **:**<br>   59.6182 |
| ▶ | gemini-2.5-pro-preview-06-05 (default think) | 79.1% | $45.6 | `aider --model gemini/gemini-2.5-pro-preview-06-05` | 100.0% | diff-fenced |
| - **Dirname**<br>   <br>  **:**<br>   2025-06-06-18-38-56--gemini0605-diff-fenced<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   gemini-2.5-pro-preview-06-05 (default think)<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff-fenced<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   4c161f9-dirty<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   44.9<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   79.1<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   101<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   178<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   100.0<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   4<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   0<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   0<br>   <br>- **User asks**<br>   <br>  **:**<br>   105<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   4<br>   <br>- **Prompt tokens**<br>   <br>  **:**<br>   2751296<br>   <br>- **Completion tokens**<br>   <br>  **:**<br>   4142197<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   1<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model gemini/gemini-2.5-pro-preview-06-05`<br>- **Date**<br>   <br>  **:**<br>   2025-06-06<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.84.1.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   175.2<br>   <br>- **Total cost**<br>   <br>  **:**<br>   45.5961 |
| ▶ | o3 (high) + gpt-4.1 | 78.2% | $17.55 | `aider --model o3` | 100.0% | architect |
| - **Dirname**<br>   <br>  **:**<br>   2025-06-27-23-53-57--o3-mini-high-diff-arch<br>   <br>- **Test cases**<br>   <br>  **:**<br>   224<br>   <br>- **Model**<br>   <br>  **:**<br>   o3 (high) + gpt-4.1<br>   <br>- **Edit format**<br>   <br>  **:**<br>   architect<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   4f4f00f-dirty<br>   <br>- **Editor model**<br>   <br>  **:**<br>   gpt-4.1<br>   <br>- **Editor edit format**<br>   <br>  **:**<br>   editor-diff<br>   <br>- **Reasoning effort**<br>   <br>  **:**<br>   high<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   34.8<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   78.2<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   78<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   176<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   100.0<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   18<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   0<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   0<br>   <br>- **User asks**<br>   <br>  **:**<br>   172<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   1<br>   <br>- **Prompt tokens**<br>   <br>  **:**<br>   1306877<br>   <br>- **Completion tokens**<br>   <br>  **:**<br>   1327154<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   1<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model o3`<br>- **Date**<br>   <br>  **:**<br>   2025-06-27<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.85.1.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   121.8<br>   <br>- **Total cost**<br>   <br>  **:**<br>   17.5518 |
| ▶ | o3 | 76.9% | $13.75 | `aider --model o3` | 93.8% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2025-06-25-20-30-16--o3-price-reduction<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   o3<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   c48fea6<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   40.9<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   76.9<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   92<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   173<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   93.8<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   22<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   22<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   14<br>   <br>- **User asks**<br>   <br>  **:**<br>   108<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   2<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   0<br>   <br>- **Prompt tokens**<br>   <br>  **:**<br>   2893189<br>   <br>- **Completion tokens**<br>   <br>  **:**<br>   1154767<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   1<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model o3`<br>- **Date**<br>   <br>  **:**<br>   2025-06-25<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.84.1.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   101.7<br>   <br>- **Total cost**<br>   <br>  **:**<br>   13.7517 |
| ▶ | Gemini 2.5 Pro Preview 05-06 | 76.9% | $37.41 | `aider --model gemini/gemini-2.5-pro-preview-05-06` | 97.3% | diff-fenced |
| - **Dirname**<br>   <br>  **:**<br>   2025-05-07-19-32-40--gemini0506-diff-fenced-completion\_cost<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   Gemini 2.5 Pro Preview 05-06<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff-fenced<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   3b08327-dirty<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   36.4<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   76.9<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   82<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   173<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   97.3<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   15<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   7<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   6<br>   <br>- **User asks**<br>   <br>  **:**<br>   105<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   0<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   2<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model gemini/gemini-2.5-pro-preview-05-06`<br>- **Date**<br>   <br>  **:**<br>   2025-05-07<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.82.4.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   165.3<br>   <br>- **Total cost**<br>   <br>  **:**<br>   37.4104 |
| ▶ | DeepSeek-V3.2-Exp (Reasoner) | 74.2% | $1.3 | `aider --model deepseek/deepseek-reasoner` | 97.3% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2025-10-03-09-45-34--deepseek-v3.2-reasoner<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   DeepSeek-V3.2-Exp (Reasoner)<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   cbb5376<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   39.6<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   74.2<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   89<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   167<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   97.3<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   8<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   6<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   6<br>   <br>- **User asks**<br>   <br>  **:**<br>   67<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   1<br>   <br>- **Prompt tokens**<br>   <br>  **:**<br>   2191446<br>   <br>- **Completion tokens**<br>   <br>  **:**<br>   1645129<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   1<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model deepseek/deepseek-reasoner`<br>- **Date**<br>   <br>  **:**<br>   2025-10-03<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.86.2.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   291.2<br>   <br>- **Total cost**<br>   <br>  **:**<br>   1.3045 |
| ▶ | Gemini 2.5 Pro Preview 03-25 | 72.9% |  | `aider --model gemini/gemini-2.5-pro-preview-03-25` | 92.4% | diff-fenced |
| - **Dirname**<br>   <br>  **:**<br>   2025-04-12-04-55-50--gemini-25-pro-diff-fenced<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   Gemini 2.5 Pro Preview 03-25<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff-fenced<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   0282574<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   40.9<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   72.9<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   92<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   164<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   92.4<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   21<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   21<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   17<br>   <br>- **User asks**<br>   <br>  **:**<br>   69<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   0<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   2<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model gemini/gemini-2.5-pro-preview-03-25`<br>- **Date**<br>   <br>  **:**<br>   2025-04-12<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.81.3.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   45.3<br>   <br>- **Total cost**<br>   <br>  **:**<br>   0 |
| ▶ | claude-opus-4-20250514 (32k thinking) | 72.0% | $65.75 | `aider --model claude-opus-4-20250514` | 97.3% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2025-05-25-20-40-51--opus4-diff-exuser<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   claude-opus-4-20250514 (32k thinking)<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   9ef3211<br>   <br>- **Thinking tokens**<br>   <br>  **:**<br>   32000<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   37.3<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   72.0<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   84<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   162<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   97.3<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   10<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   6<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   6<br>   <br>- **User asks**<br>   <br>  **:**<br>   97<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   0<br>   <br>- **Prompt tokens**<br>   <br>  **:**<br>   2567514<br>   <br>- **Completion tokens**<br>   <br>  **:**<br>   363142<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   4<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model claude-opus-4-20250514`<br>- **Date**<br>   <br>  **:**<br>   2025-05-25<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.83.3.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   44.1<br>   <br>- **Total cost**<br>   <br>  **:**<br>   65.7484 |
| ▶ | o4-mini (high) | 72.0% | $19.64 | `aider --model o4-mini` | 90.7% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2025-04-16-22-01-58--o4-mini-high-diff-exsys<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   o4-mini (high)<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   b66901f-dirty<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   19.6<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   72.0<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   44<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   162<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   90.7<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   26<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   24<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   21<br>   <br>- **User asks**<br>   <br>  **:**<br>   66<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   1<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   2<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model o4-mini`<br>- **Date**<br>   <br>  **:**<br>   2025-04-16<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.82.1.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   176.5<br>   <br>- **Total cost**<br>   <br>  **:**<br>   19.6399 |
| ▶ | DeepSeek R1 (0528) | 71.4% | $4.8 | `aider --model deepseek/deepseek-reasoner` | 94.6% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2025-06-06-16-47-07--r1-diff<br>   <br>- **Test cases**<br>   <br>  **:**<br>   224<br>   <br>- **Model**<br>   <br>  **:**<br>   DeepSeek R1 (0528)<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   4c161f9-dirty<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   34.4<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   71.4<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   77<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   160<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   94.6<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   28<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   15<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   12<br>   <br>- **User asks**<br>   <br>  **:**<br>   105<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   0<br>   <br>- **Prompt tokens**<br>   <br>  **:**<br>   2644169<br>   <br>- **Completion tokens**<br>   <br>  **:**<br>   1842168<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   2<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model deepseek/deepseek-reasoner`<br>- **Date**<br>   <br>  **:**<br>   2025-06-06<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.84.1.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   716.6<br>   <br>- **Total cost**<br>   <br>  **:**<br>   4.8016 |
| ▶ | claude-opus-4-20250514 (no think) | 70.7% | $68.63 | `aider --model claude-opus-4-20250514` | 98.7% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2025-05-25-19-57-20--opus4-diff-exuser<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   claude-opus-4-20250514 (no think)<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   9ef3211<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   32.9<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   70.7<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   74<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   159<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   98.7<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   3<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   3<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   3<br>   <br>- **User asks**<br>   <br>  **:**<br>   105<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   0<br>   <br>- **Prompt tokens**<br>   <br>  **:**<br>   2671437<br>   <br>- **Completion tokens**<br>   <br>  **:**<br>   380717<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   3<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model claude-opus-4-20250514`<br>- **Date**<br>   <br>  **:**<br>   2025-05-25<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.83.3.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   42.5<br>   <br>- **Total cost**<br>   <br>  **:**<br>   68.6253 |
| ▶ | DeepSeek-V3.2-Exp (Chat) | 70.2% | $0.88 | `aider --model deepseek/deepseek-chat` | 98.2% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2025-10-03-09-21-36--deepseek-v3.2-chat<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   DeepSeek-V3.2-Exp (Chat)<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   cbb5376<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   38.7<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   70.2<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   87<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   158<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   98.2<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   6<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   4<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   4<br>   <br>- **User asks**<br>   <br>  **:**<br>   60<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   1<br>   <br>- **Prompt tokens**<br>   <br>  **:**<br>   2266868<br>   <br>- **Completion tokens**<br>   <br>  **:**<br>   573477<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   4<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model deepseek/deepseek-chat`<br>- **Date**<br>   <br>  **:**<br>   2025-10-03<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.86.2.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   104.0<br>   <br>- **Total cost**<br>   <br>  **:**<br>   0.8756 |
| ▶ | claude-3-7-sonnet-20250219 (32k thinking tokens) | 64.9% | $36.83 | `aider --model anthropic/claude-3-7-sonnet-20250219 --thinking-tokens 32k` | 97.8% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2025-02-24-21-47-23--sonnet37-diff-think-32k-64k<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   claude-3-7-sonnet-20250219 (32k thinking tokens)<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   60d11a6, 93edbda<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   29.3<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   64.9<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   66<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   146<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   97.8<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   66<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   5<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   5<br>   <br>- **User asks**<br>   <br>  **:**<br>   5<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   0<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   1<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model anthropic/claude-3-7-sonnet-20250219 --thinking-tokens 32k`<br>- **Date**<br>   <br>  **:**<br>   2025-02-24<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.75.1.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   105.2<br>   <br>- **Total cost**<br>   <br>  **:**<br>   36.8343 |
| ▶ | DeepSeek R1 + claude-3-5-sonnet-20241022 | 64.0% | $13.29 | `aider --architect --model r1 --editor-model sonnet` | 100.0% | architect |
| - **Dirname**<br>   <br>  **:**<br>   2025-01-23-19-14-48--r1-architect-sonnet<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   DeepSeek R1 + claude-3-5-sonnet-20241022<br>   <br>- **Edit format**<br>   <br>  **:**<br>   architect<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   05a77c7<br>   <br>- **Editor model**<br>   <br>  **:**<br>   claude-3-5-sonnet-20241022<br>   <br>- **Editor edit format**<br>   <br>  **:**<br>   editor-diff<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   27.1<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   64.0<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   61<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   144<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   100.0<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   2<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   0<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   0<br>   <br>- **User asks**<br>   <br>  **:**<br>   392<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   6<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   0<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   5<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --architect --model r1 --editor-model sonnet`<br>- **Date**<br>   <br>  **:**<br>   2025-01-23<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.72.3.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   251.6<br>   <br>- **Total cost**<br>   <br>  **:**<br>   13.2933 |
| ▶ | o1-2024-12-17 (high) | 61.7% | $186.5 | `aider --model openrouter/openai/o1` | 91.5% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2024-12-21-19-23-03--polyglot-o1-hard-diff<br>   <br>- **Test cases**<br>   <br>  **:**<br>   224<br>   <br>- **Model**<br>   <br>  **:**<br>   o1-2024-12-17 (high)<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   a755079-dirty<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   23.7<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   61.7<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   53<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   139<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   91.5<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   25<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   24<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   19<br>   <br>- **User asks**<br>   <br>  **:**<br>   16<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   0<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   2<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model openrouter/openai/o1`<br>- **Date**<br>   <br>  **:**<br>   2024-12-21<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.69.2.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   133.2<br>   <br>- **Total cost**<br>   <br>  **:**<br>   186.4958 |
| ▶ | claude-sonnet-4-20250514 (32k thinking) | 61.3% | $26.58 | `aider --model claude-sonnet-4-20250514` | 97.3% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2025-05-24-22-10-36--sonnet4-diff-exuser-think32k<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   claude-sonnet-4-20250514 (32k thinking)<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   e3cb907<br>   <br>- **Thinking tokens**<br>   <br>  **:**<br>   32000<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   25.8<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   61.3<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   58<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   138<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   97.3<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   10<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   10<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   6<br>   <br>- **User asks**<br>   <br>  **:**<br>   111<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   0<br>   <br>- **Prompt tokens**<br>   <br>  **:**<br>   2863068<br>   <br>- **Completion tokens**<br>   <br>  **:**<br>   1271074<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   6<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model claude-sonnet-4-20250514`<br>- **Date**<br>   <br>  **:**<br>   2025-05-24<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.83.3.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   79.9<br>   <br>- **Total cost**<br>   <br>  **:**<br>   26.5755 |
| ▶ | claude-3-7-sonnet-20250219 (no thinking) | 60.4% | $17.72 | `aider --model sonnet` | 93.3% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2025-02-24-19-54-07--sonnet37-diff<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   claude-3-7-sonnet-20250219 (no thinking)<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   75e9ee6<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   24.4<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   60.4<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   55<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   136<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   93.3<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   16<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   16<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   15<br>   <br>- **User asks**<br>   <br>  **:**<br>   12<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   0<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   0<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model sonnet`<br>- **Date**<br>   <br>  **:**<br>   2025-02-24<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.74.4.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   28.3<br>   <br>- **Total cost**<br>   <br>  **:**<br>   17.7191 |
| ▶ | o3-mini (high) | 60.4% | $18.16 | `aider --model o3-mini --reasoning-effort high` | 93.3% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2025-01-31-20-42-47--o3-mini-diff-high<br>   <br>- **Test cases**<br>   <br>  **:**<br>   224<br>   <br>- **Model**<br>   <br>  **:**<br>   o3-mini (high)<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   b0d58d1-dirty<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   21.0<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   60.4<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   47<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   136<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   93.3<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   26<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   24<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   15<br>   <br>- **User asks**<br>   <br>  **:**<br>   19<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   1<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   7<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model o3-mini --reasoning-effort high`<br>- **Date**<br>   <br>  **:**<br>   2025-01-31<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.72.4.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   124.6<br>   <br>- **Total cost**<br>   <br>  **:**<br>   18.1584 |
| ▶ | Qwen3 235B A22B diff, no think, Alibaba API | 59.6% |  | `aider --model openai/qwen3-235b-a22b` | 92.9% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2025-05-09-17-02-02--qwen3-235b-a22b.unthink\_16k\_diff<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   Qwen3 235B A22B diff, no think, Alibaba API<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   91d7fbd-dirty<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   28.9<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   59.6<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   65<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   134<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   92.9<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   22<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   22<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   16<br>   <br>- **User asks**<br>   <br>  **:**<br>   111<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   0<br>   <br>- **Prompt tokens**<br>   <br>  **:**<br>   2816192<br>   <br>- **Completion tokens**<br>   <br>  **:**<br>   342062<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   1<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model openai/qwen3-235b-a22b`<br>- **Date**<br>   <br>  **:**<br>   2025-05-09<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.82.4.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   45.4<br>   <br>- **Total cost**<br>   <br>  **:**<br>   0.0 |
| ▶ | Kimi K2 | 59.1% | $1.24 | `aider --model openrouter/moonshotai/kimi-k2` | 92.9% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2025-07-17-17-41-54--kimi-k2-diff-or-pricing<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   Kimi K2<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   915ebff-dirty<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   20.4<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   59.1<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   46<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   133<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   92.9<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   19<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   19<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   16<br>   <br>- **User asks**<br>   <br>  **:**<br>   61<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   0<br>   <br>- **Prompt tokens**<br>   <br>  **:**<br>   2355141<br>   <br>- **Completion tokens**<br>   <br>  **:**<br>   363846<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   4<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model openrouter/moonshotai/kimi-k2`<br>- **Date**<br>   <br>  **:**<br>   2025-07-17<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.85.3.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   67.6<br>   <br>- **Total cost**<br>   <br>  **:**<br>   1.2357 |
| ▶ | DeepSeek R1 | 56.9% | $5.42 | `aider --model deepseek/deepseek-reasoner` | 96.9% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2025-01-20-19-11-38--ds-turns-upd-cur-msgs-fix-with-summarizer<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   DeepSeek R1<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   5650697-dirty<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   26.7<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   56.9<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   60<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   128<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   96.9<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   8<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   7<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   7<br>   <br>- **User asks**<br>   <br>  **:**<br>   15<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   1<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   5<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model deepseek/deepseek-reasoner`<br>- **Date**<br>   <br>  **:**<br>   2025-01-20<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.71.2.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   113.7<br>   <br>- **Total cost**<br>   <br>  **:**<br>   5.4193 |
| ▶ | claude-sonnet-4-20250514 (no thinking) | 56.4% | $15.82 | `aider --model claude-sonnet-4-20250514` | 98.2% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2025-05-24-21-17-54--sonnet4-diff-exuser<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   claude-sonnet-4-20250514 (no thinking)<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   ef3f8bb-dirty<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   20.4<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   56.4<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   46<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   127<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   98.2<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   6<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   4<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   4<br>   <br>- **User asks**<br>   <br>  **:**<br>   129<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   1<br>   <br>- **Prompt tokens**<br>   <br>  **:**<br>   3460663<br>   <br>- **Completion tokens**<br>   <br>  **:**<br>   433373<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   7<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model claude-sonnet-4-20250514`<br>- **Date**<br>   <br>  **:**<br>   2025-05-24<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.83.3.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   29.8<br>   <br>- **Total cost**<br>   <br>  **:**<br>   15.8155 |
| ▶ | gemini-2.5-flash-preview-05-20 (24k think) | 55.1% | $8.56 | `aider --model gemini/gemini-2.5-flash-preview-05-20` | 95.6% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2025-05-25-22-58-44--flash25-05-20-24k-think<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   gemini-2.5-flash-preview-05-20 (24k think)<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   a8568c3-dirty<br>   <br>- **Thinking tokens**<br>   <br>  **:**<br>   24576<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   26.2<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   55.1<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   59<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   124<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   95.6<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   15<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   15<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   10<br>   <br>- **User asks**<br>   <br>  **:**<br>   101<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   0<br>   <br>- **Prompt tokens**<br>   <br>  **:**<br>   3666792<br>   <br>- **Completion tokens**<br>   <br>  **:**<br>   2703162<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   4<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model gemini/gemini-2.5-flash-preview-05-20`<br>- **Date**<br>   <br>  **:**<br>   2025-05-25<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.83.3.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   53.9<br>   <br>- **Total cost**<br>   <br>  **:**<br>   8.5625 |
| ▶ | DeepSeek V3 (0324) | 55.1% | $1.12 | `aider --model deepseek/deepseek-chat` | 99.6% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2025-03-24-15-41-33--deepseek-v3-0324-polyglot-diff<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   DeepSeek V3 (0324)<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   502b863<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   28.0<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   55.1<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   63<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   124<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   99.6<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   32<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   1<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   1<br>   <br>- **User asks**<br>   <br>  **:**<br>   96<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   2<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   4<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model deepseek/deepseek-chat`<br>- **Date**<br>   <br>  **:**<br>   2025-03-24<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.78.1.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   290.0<br>   <br>- **Total cost**<br>   <br>  **:**<br>   1.1164 |
| ▶ | Quasar Alpha | 54.7% |  | `aider --model openrouter/openrouter/quasar-alpha` | 98.2% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2025-04-04-02-57-25--qalpha-diff-exsys<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   Quasar Alpha<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   8a34a6c-dirty<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   21.8<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   54.7<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   49<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   123<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   98.2<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   4<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   4<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   4<br>   <br>- **User asks**<br>   <br>  **:**<br>   187<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   0<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   4<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model openrouter/openrouter/quasar-alpha`<br>- **Date**<br>   <br>  **:**<br>   2025-04-04<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.80.5.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   14.8<br>   <br>- **Total cost**<br>   <br>  **:**<br>   0.0 |
| ▶ | o3-mini (medium) | 53.8% | $8.86 | `aider --model o3-mini` | 95.1% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2025-01-31-20-27-46--o3-mini-diff2<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   o3-mini (medium)<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   2fb517b-dirty<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   19.1<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   53.8<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   43<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   121<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   95.1<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   28<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   28<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   11<br>   <br>- **User asks**<br>   <br>  **:**<br>   17<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   0<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   2<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model o3-mini`<br>- **Date**<br>   <br>  **:**<br>   2025-01-31<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.72.4.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   47.2<br>   <br>- **Total cost**<br>   <br>  **:**<br>   8.8599 |
| ▶ | Grok 3 Beta | 53.3% | $11.03 | `aider --model openrouter/x-ai/grok-3-beta` | 99.6% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2025-04-10-04-21-31--grok3-diff-exuser<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   Grok 3 Beta<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   2dd40fc-dirty<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   22.2<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   53.3<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   50<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   120<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   99.6<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   1<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   1<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   1<br>   <br>- **User asks**<br>   <br>  **:**<br>   68<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   0<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   2<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model openrouter/x-ai/grok-3-beta`<br>- **Date**<br>   <br>  **:**<br>   2025-04-10<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.81.2.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   15.3<br>   <br>- **Total cost**<br>   <br>  **:**<br>   11.0338 |
| ▶ | Optimus Alpha | 52.9% |  | `aider --model openrouter/openrouter/optimus-alpha` | 97.3% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2025-04-10-19-02-44--oalpha-diff-exsys<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   Optimus Alpha<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   532bc45-dirty<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   21.3<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   52.9<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   48<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   119<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   97.3<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   7<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   6<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   6<br>   <br>- **User asks**<br>   <br>  **:**<br>   182<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   0<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   3<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model openrouter/openrouter/optimus-alpha`<br>- **Date**<br>   <br>  **:**<br>   2025-04-10<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.81.2.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   18.4<br>   <br>- **Total cost**<br>   <br>  **:**<br>   0.0 |
| ▶ | gpt-4.1 | 52.4% | $9.86 | `aider --model gpt-4.1` | 98.2% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2025-04-14-21-05-54--gpt41-diff-exuser<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   gpt-4.1<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   7a87db5-dirty<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   20.0<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   52.4<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   45<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   118<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   98.2<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   6<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   5<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   4<br>   <br>- **User asks**<br>   <br>  **:**<br>   171<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   1<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   5<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model gpt-4.1`<br>- **Date**<br>   <br>  **:**<br>   2025-04-14<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.81.4.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   20.5<br>   <br>- **Total cost**<br>   <br>  **:**<br>   9.8556 |
| ▶ | claude-3-5-sonnet-20241022 | 51.6% | $14.41 | `aider --model claude-3-5-sonnet-20241022` | 99.6% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2025-01-17-19-44-33--sonnet-baseline-jan-17<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   claude-3-5-sonnet-20241022<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   6451d59<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   22.2<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   51.6<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   50<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   116<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   99.6<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   2<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   1<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   1<br>   <br>- **User asks**<br>   <br>  **:**<br>   11<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   1<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   8<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model claude-3-5-sonnet-20241022`<br>- **Date**<br>   <br>  **:**<br>   2025-01-17<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.71.2.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   21.4<br>   <br>- **Total cost**<br>   <br>  **:**<br>   14.4063 |
| ▶ | Grok 3 Mini Beta (high) | 49.3% | $0.73 | `aider --model xai/grok-3-mini-beta --reasoning-effort high` | 99.6% | whole |
| - **Dirname**<br>   <br>  **:**<br>   2025-04-10-23-59-02--xai-grok3-mini-whole-high<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   Grok 3 Mini Beta (high)<br>   <br>- **Edit format**<br>   <br>  **:**<br>   whole<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   8ee33da-dirty<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   17.3<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   49.3<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   39<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   111<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   99.6<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   1<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   1<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   1<br>   <br>- **User asks**<br>   <br>  **:**<br>   64<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   0<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   0<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model xai/grok-3-mini-beta --reasoning-effort high`<br>- **Date**<br>   <br>  **:**<br>   2025-04-10<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.81.3.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   79.1<br>   <br>- **Total cost**<br>   <br>  **:**<br>   0.7346 |
| ▶ | DeepSeek Chat V3 (prev) | 48.4% | $0.34 | `aider --model deepseek/deepseek-chat` | 98.7% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2024-12-25-13-31-51--deepseekv3preview-diff2<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   DeepSeek Chat V3 (prev)<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   0a23c4a-dirty<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   22.7<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   48.4<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   51<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   109<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   98.7<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   7<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   7<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   3<br>   <br>- **User asks**<br>   <br>  **:**<br>   19<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   0<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   8<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model deepseek/deepseek-chat`<br>- **Date**<br>   <br>  **:**<br>   2024-12-25<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.69.2.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   34.8<br>   <br>- **Total cost**<br>   <br>  **:**<br>   0.3369 |
| ▶ | gemini-2.5-flash-preview-04-17 (default) | 47.1% | $1.85 | `aider --model gemini/gemini-2.5-flash-preview-04-17` | 85.3% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2025-04-20-19-54-31--flash25-diff-no-think<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   gemini-2.5-flash-preview-04-17 (default)<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   7fcce5d-dirty<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   21.8<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   47.1<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   49<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   106<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   85.3<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   60<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   55<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   33<br>   <br>- **User asks**<br>   <br>  **:**<br>   82<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   1<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   5<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   4<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model gemini/gemini-2.5-flash-preview-04-17`<br>- **Date**<br>   <br>  **:**<br>   2025-04-20<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.82.3.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   50.1<br>   <br>- **Total cost**<br>   <br>  **:**<br>   1.8451 |
| ▶ | chatgpt-4o-latest (2025-03-29) | 45.3% | $19.74 | `aider --model chatgpt-4o-latest` | 64.4% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2025-03-29-05-24-55--chatgpt4o-mar28-diff<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   chatgpt-4o-latest (2025-03-29)<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   0decbad<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   16.4<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   45.3<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   37<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   102<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   64.4<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   85<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   85<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   80<br>   <br>- **User asks**<br>   <br>  **:**<br>   174<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   0<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   4<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model chatgpt-4o-latest`<br>- **Date**<br>   <br>  **:**<br>   2025-03-29<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.79.3.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   10.3<br>   <br>- **Total cost**<br>   <br>  **:**<br>   19.7416 |
| ▶ | gpt-4.5-preview | 44.9% | $183.18 | `aider --model openai/gpt-4.5-preview` | 97.3% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2025-02-27-20-26-15--gpt45-diff3<br>   <br>- **Test cases**<br>   <br>  **:**<br>   224<br>   <br>- **Model**<br>   <br>  **:**<br>   gpt-4.5-preview<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   b462e55-dirty<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   22.3<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   44.9<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   50<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   101<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   97.3<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   10<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   8<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   6<br>   <br>- **User asks**<br>   <br>  **:**<br>   15<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   1<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   2<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model openai/gpt-4.5-preview`<br>- **Date**<br>   <br>  **:**<br>   2025-02-27<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.75.2.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   113.5<br>   <br>- **Total cost**<br>   <br>  **:**<br>   183.1802 |
| ▶ | gemini-2.5-flash-preview-05-20 (no think) | 44.0% | $1.14 | `aider --model gemini/gemini-2.5-flash-preview-05-20` | 93.8% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2025-05-26-15-56-31--flash25-05-20-24k-think<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   gemini-2.5-flash-preview-05-20 (no think)<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   214b811-dirty<br>   <br>- **Thinking tokens**<br>   <br>  **:**<br>   0<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   20.9<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   44.0<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   47<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   99<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   93.8<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   16<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   16<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   14<br>   <br>- **User asks**<br>   <br>  **:**<br>   79<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   0<br>   <br>- **Prompt tokens**<br>   <br>  **:**<br>   5512458<br>   <br>- **Completion tokens**<br>   <br>  **:**<br>   514145<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   4<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model gemini/gemini-2.5-flash-preview-05-20`<br>- **Date**<br>   <br>  **:**<br>   2025-05-26<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.83.3.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   12.2<br>   <br>- **Total cost**<br>   <br>  **:**<br>   1.1354 |
| ▶ | gpt-oss-120b (high) | 41.8% | $0.74 | `aider --model openrouter/openai/gpt-oss-120b --reasoning-effort high` | 79.1% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2025-08-06-04-54-48--gpt-oss-120b-high-polyglot<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   gpt-oss-120b (high)<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   1af0e59<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   13.8<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   41.8<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   31<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   94<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   79.1<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   95<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   77<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   47<br>   <br>- **User asks**<br>   <br>  **:**<br>   142<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   0<br>   <br>- **Prompt tokens**<br>   <br>  **:**<br>   3123768<br>   <br>- **Completion tokens**<br>   <br>  **:**<br>   856495<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   4<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model openrouter/openai/gpt-oss-120b --reasoning-effort high`<br>- **Date**<br>   <br>  **:**<br>   2025-08-06<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.85.3.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   35.5<br>   <br>- **Total cost**<br>   <br>  **:**<br>   0.7406 |
| ▶ | Qwen3 32B | 40.0% | $0.76 | `aider --model openrouter/qwen/qwen3-32b` | 83.6% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2025-05-08-03-20-24--qwen3-32b-default<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   Qwen3 32B<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   aaacee5-dirty, aeaf259<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   14.2<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   40.0<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   32<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   90<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   83.6<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   119<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   50<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   37<br>   <br>- **User asks**<br>   <br>  **:**<br>   97<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   12<br>   <br>- **Prompt tokens**<br>   <br>  **:**<br>   317591<br>   <br>- **Completion tokens**<br>   <br>  **:**<br>   120418<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   5<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model openrouter/qwen/qwen3-32b`<br>- **Date**<br>   <br>  **:**<br>   2025-05-08<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.82.4.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   372.2<br>   <br>- **Total cost**<br>   <br>  **:**<br>   0.7603 |
| ▶ | gemini-exp-1206 | 38.2% |  | `aider --model gemini/gemini-exp-1206` | 98.2% | whole |
| - **Dirname**<br>   <br>  **:**<br>   2024-12-22-18-43-25--gemini-exp-1206-polyglot-whole-2<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   gemini-exp-1206<br>   <br>- **Edit format**<br>   <br>  **:**<br>   whole<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   b1bc2f8<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   19.6<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   38.2<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   44<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   86<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   98.2<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   8<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   8<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   4<br>   <br>- **User asks**<br>   <br>  **:**<br>   32<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   0<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   9<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model gemini/gemini-exp-1206`<br>- **Date**<br>   <br>  **:**<br>   2024-12-22<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.69.2.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   45.5<br>   <br>- **Total cost**<br>   <br>  **:**<br>   0.0 |
| ▶ | Gemini 2.0 Pro exp-02-05 | 35.6% |  | `aider --model gemini/gemini-2.0-pro-exp-02-05` | 100.0% | whole |
| - **Dirname**<br>   <br>  **:**<br>   2025-02-25-20-23-07--gemini-pro<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   Gemini 2.0 Pro exp-02-05<br>   <br>- **Edit format**<br>   <br>  **:**<br>   whole<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   2fccd47<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   20.4<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   35.6<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   46<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   80<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   100.0<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   430<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   0<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   0<br>   <br>- **User asks**<br>   <br>  **:**<br>   13<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   0<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   5<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model gemini/gemini-2.0-pro-exp-02-05`<br>- **Date**<br>   <br>  **:**<br>   2025-02-25<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.75.2.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   34.8<br>   <br>- **Total cost**<br>   <br>  **:**<br>   0.0 |
| ▶ | Grok 3 Mini Beta (low) | 34.7% | $0.79 | `aider --model openrouter/x-ai/grok-3-mini-beta` | 100.0% | whole |
| - **Dirname**<br>   <br>  **:**<br>   2025-04-10-18-47-24--grok3-mini-whole-exuser<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   Grok 3 Mini Beta (low)<br>   <br>- **Edit format**<br>   <br>  **:**<br>   whole<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   14ffe77-dirty<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   11.1<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   34.7<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   25<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   78<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   100.0<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   3<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   0<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   0<br>   <br>- **User asks**<br>   <br>  **:**<br>   73<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   0<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   5<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model openrouter/x-ai/grok-3-mini-beta`<br>- **Date**<br>   <br>  **:**<br>   2025-04-10<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.81.2.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   35.1<br>   <br>- **Total cost**<br>   <br>  **:**<br>   0.7856 |
| ▶ | o1-mini-2024-09-12 | 32.9% | $18.58 | `aider --model o1-mini` | 96.9% | whole |
| - **Dirname**<br>   <br>  **:**<br>   2024-12-22-21-26-35--polyglot-o1mini-whole<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   o1-mini-2024-09-12<br>   <br>- **Edit format**<br>   <br>  **:**<br>   whole<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   37df899<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   5.8<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   32.9<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   13<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   74<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   96.9<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   8<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   8<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   7<br>   <br>- **User asks**<br>   <br>  **:**<br>   27<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   0<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   3<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model o1-mini`<br>- **Date**<br>   <br>  **:**<br>   2024-12-22<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.69.2.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   34.7<br>   <br>- **Total cost**<br>   <br>  **:**<br>   18.577 |
| ▶ | gpt-4.1-mini | 32.4% | $1.99 | `aider --model gpt-4.1-mini` | 92.4% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2025-04-14-21-27-53--gpt41mini-diff<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   gpt-4.1-mini<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   ffb743e-dirty<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   11.1<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   32.4<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   25<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   73<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   92.4<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   64<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   62<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   17<br>   <br>- **User asks**<br>   <br>  **:**<br>   159<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   2<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   2<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model gpt-4.1-mini`<br>- **Date**<br>   <br>  **:**<br>   2025-04-14<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.81.4.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   19.5<br>   <br>- **Total cost**<br>   <br>  **:**<br>   1.9918 |
| ▶ | claude-3-5-haiku-20241022 | 28.0% | $6.06 | `aider --model claude-3-5-haiku-20241022` | 91.1% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2024-12-21-21-46-27--polyglot-haiku-diff<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   claude-3-5-haiku-20241022<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   a755079-dirty<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   7.1<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   28.0<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   16<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   63<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   91.1<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   31<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   30<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   20<br>   <br>- **User asks**<br>   <br>  **:**<br>   13<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   1<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   9<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model claude-3-5-haiku-20241022`<br>- **Date**<br>   <br>  **:**<br>   2024-12-21<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.69.2.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   31.8<br>   <br>- **Total cost**<br>   <br>  **:**<br>   6.0583 |
| ▶ | chatgpt-4o-latest (2025-02-15) | 27.1% | $14.37 | `aider --model chatgpt-4o-latest` | 93.3% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2025-02-15-19-51-22--chatgpt4o-feb15-diff<br>   <br>- **Test cases**<br>   <br>  **:**<br>   223<br>   <br>- **Model**<br>   <br>  **:**<br>   chatgpt-4o-latest (2025-02-15)<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   108ce18-dirty<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   9.0<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   27.1<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   20<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   61<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   93.3<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   66<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   21<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   15<br>   <br>- **User asks**<br>   <br>  **:**<br>   57<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   0<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   2<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model chatgpt-4o-latest`<br>- **Date**<br>   <br>  **:**<br>   2025-02-15<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.74.3.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   12.4<br>   <br>- **Total cost**<br>   <br>  **:**<br>   14.3703 |
| ▶ | QwQ-32B + Qwen 2.5 Coder Instruct | 26.2% |  | `aider --model fireworks_ai/accounts/fireworks/models/qwq-32b --architect` | 100.0% | architect |
| - **Dirname**<br>   <br>  **:**<br>   2025-03-07-15-11-27--qwq32b-arch-temp-topp-again<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   QwQ-32B + Qwen 2.5 Coder Instruct<br>   <br>- **Edit format**<br>   <br>  **:**<br>   architect<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   52162a5<br>   <br>- **Editor model**<br>   <br>  **:**<br>   fireworks\_ai/accounts/fireworks/models/qwen2p5-coder-32b-instruct<br>   <br>- **Editor edit format**<br>   <br>  **:**<br>   editor-diff<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   9.8<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   26.2<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   22<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   59<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   100.0<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   122<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   0<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   0<br>   <br>- **User asks**<br>   <br>  **:**<br>   489<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   8<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   1<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   2<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model fireworks_ai/accounts/fireworks/models/qwq-32b --architect`<br>- **Date**<br>   <br>  **:**<br>   2025-03-07<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.75.3.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   137.4<br>   <br>- **Total cost**<br>   <br>  **:**<br>   0 |
| ▶ | gpt-4o-2024-08-06 | 23.1% | $7.03 | `aider --model gpt-4o-2024-08-06` | 94.2% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2024-12-30-20-44-54--gpt4o-ex-as-sys-clean-prompt<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   gpt-4o-2024-08-06<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   09ee197-dirty<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   4.9<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   23.1<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   11<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   52<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   94.2<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   21<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   21<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   13<br>   <br>- **User asks**<br>   <br>  **:**<br>   65<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   0<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   3<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model gpt-4o-2024-08-06`<br>- **Date**<br>   <br>  **:**<br>   2024-12-30<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.70.1.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   16.0<br>   <br>- **Total cost**<br>   <br>  **:**<br>   7.0286 |
| ▶ | gemini-2.0-flash-exp | 22.2% |  | `aider --model gemini/gemini-2.0-flash-exp` | 100.0% | whole |
| - **Dirname**<br>   <br>  **:**<br>   2024-12-22-20-08-13--gemini-2.0-flash-exp-polyglot-whole<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   gemini-2.0-flash-exp<br>   <br>- **Edit format**<br>   <br>  **:**<br>   whole<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   b1bc2f8<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   11.6<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   22.2<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   26<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   50<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   100.0<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   1<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   0<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   0<br>   <br>- **User asks**<br>   <br>  **:**<br>   9<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   1<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   8<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model gemini/gemini-2.0-flash-exp`<br>- **Date**<br>   <br>  **:**<br>   2024-12-22<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.69.2.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   12.2<br>   <br>- **Total cost**<br>   <br>  **:**<br>   0.0 |
| ▶ | qwen-max-2025-01-25 | 21.8% |  | `OPENAI_API_BASE=https://dashscope-intl.aliyuncs.com/compatible-mode/v1 aider --model openai/qwen-max-2025-01-25` | 90.2% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2025-01-28-16-00-03--qwen-max-2025-01-25-polyglot-diff<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   qwen-max-2025-01-25<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   ae7d459<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   9.3<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   21.8<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   21<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   49<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   90.2<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   46<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   44<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   22<br>   <br>- **User asks**<br>   <br>  **:**<br>   23<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   0<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   9<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`OPENAI_API_BASE=https://dashscope-intl.aliyuncs.com/compatible-mode/v1 aider --model openai/qwen-max-2025-01-25`<br>- **Date**<br>   <br>  **:**<br>   2025-01-28<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.72.4.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   39.5 |
| ▶ | QwQ-32B | 20.9% |  | `aider --model fireworks_ai/accounts/fireworks/models/qwq-32b` | 67.6% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2025-03-06-17-40-24--qwq32b-diff-temp-topp-ex-sys-remind-user-for-real<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   QwQ-32B<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   51d118f-dirty<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   8.0<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   20.9<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   18<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   47<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   67.6<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   145<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   143<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   73<br>   <br>- **User asks**<br>   <br>  **:**<br>   17<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   1<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   4<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model fireworks_ai/accounts/fireworks/models/qwq-32b`<br>- **Date**<br>   <br>  **:**<br>   2025-03-06<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.75.3.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   228.6<br>   <br>- **Total cost**<br>   <br>  **:**<br>   0.0 |
| ▶ | gemini-2.0-flash-thinking-exp-01-21 | 18.2% |  | `aider --model gemini/gemini-2.0-flash-thinking-exp-01-21` | 77.8% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2025-01-21-22-51-49--gemini-2.0-flash-thinking-exp-01-21-polyglot-diff<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   gemini-2.0-flash-thinking-exp-01-21<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   843720a<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   5.8<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   18.2<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   13<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   41<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   77.8<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   182<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   180<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   50<br>   <br>- **User asks**<br>   <br>  **:**<br>   26<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   2<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   7<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model gemini/gemini-2.0-flash-thinking-exp-01-21`<br>- **Date**<br>   <br>  **:**<br>   2025-01-21<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.72.2.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   24.2<br>   <br>- **Total cost**<br>   <br>  **:**<br>   0.0 |
| ▶ | gpt-4o-2024-11-20 | 18.2% | $6.74 | `aider --model gpt-4o-2024-11-20` | 95.1% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2024-12-30-20-57-12--gpt-4o-2024-11-20-ex-as-sys<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   gpt-4o-2024-11-20<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   09ee197-dirty<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   4.9<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   18.2<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   11<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   41<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   95.1<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   12<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   12<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   11<br>   <br>- **User asks**<br>   <br>  **:**<br>   53<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   0<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   12<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model gpt-4o-2024-11-20`<br>- **Date**<br>   <br>  **:**<br>   2024-12-30<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.70.1.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   12.1<br>   <br>- **Total cost**<br>   <br>  **:**<br>   6.7351 |
| ▶ | DeepSeek Chat V2.5 | 17.8% | $0.51 | `aider --model deepseek/deepseek-chat` | 92.9% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2024-12-21-20-56-21--polyglot-deepseek-diff<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   DeepSeek Chat V2.5<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   a755079-dirty<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   5.3<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   17.8<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   12<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   40<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   92.9<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   42<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   37<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   16<br>   <br>- **User asks**<br>   <br>  **:**<br>   23<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   5<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   5<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model deepseek/deepseek-chat`<br>- **Date**<br>   <br>  **:**<br>   2024-12-21<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.69.2.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   184.0<br>   <br>- **Total cost**<br>   <br>  **:**<br>   0.5101 |
| ▶ | Qwen2.5-Coder-32B-Instruct | 16.4% |  | `aider --model openai/Qwen2.5-Coder-32B-Instruct` | 99.6% | whole |
| - **Dirname**<br>   <br>  **:**<br>   2024-12-26-00-55-20--Qwen2.5-Coder-32B-Instruct<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   Qwen2.5-Coder-32B-Instruct<br>   <br>- **Edit format**<br>   <br>  **:**<br>   whole<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   b51768b0<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   4.9<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   16.4<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   11<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   37<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   99.6<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   1<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   1<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   1<br>   <br>- **User asks**<br>   <br>  **:**<br>   33<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   0<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   6<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model openai/Qwen2.5-Coder-32B-Instruct`<br>- **Date**<br>   <br>  **:**<br>   2024-12-26<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.69.2.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   42.0<br>   <br>- **Total cost**<br>   <br>  **:**<br>   0.0 |
| ▶ | Llama 4 Maverick | 15.6% |  | `aider --model nvidia_nim/meta/llama-4-maverick-17b-128e-instruct` | 99.1% | whole |
| - **Dirname**<br>   <br>  **:**<br>   2025-04-06-08-39-52--llama-4-maverick-17b-128e-instruct-polyglot-whole<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   Llama 4 Maverick<br>   <br>- **Edit format**<br>   <br>  **:**<br>   whole<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   9445a31<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   4.4<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   15.6<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   10<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   35<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   99.1<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   12<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   2<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   2<br>   <br>- **User asks**<br>   <br>  **:**<br>   248<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   0<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   4<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model nvidia_nim/meta/llama-4-maverick-17b-128e-instruct`<br>- **Date**<br>   <br>  **:**<br>   2025-04-06<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.81.2.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   20.5<br>   <br>- **Total cost**<br>   <br>  **:**<br>   0.0 |
| ▶ | yi-lightning | 12.9% |  | `aider --model openai/yi-lightning` | 92.9% | whole |
| - **Dirname**<br>   <br>  **:**<br>   2024-12-23-01-11-56--yi-test<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   yi-lightning<br>   <br>- **Edit format**<br>   <br>  **:**<br>   whole<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   2b1625e<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   5.8<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   12.9<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   13<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   29<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   92.9<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   87<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   72<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   16<br>   <br>- **User asks**<br>   <br>  **:**<br>   107<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   1<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   6<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model openai/yi-lightning`<br>- **Date**<br>   <br>  **:**<br>   2024-12-23<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.69.2.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   146.7<br>   <br>- **Total cost**<br>   <br>  **:**<br>   0.0 |
| ▶ | command-a-03-2025-quality | 12.0% |  | `OPENAI_API_BASE=https://api.cohere.ai/compatibility/v1 aider --model openai/command-a-03-2025-quality` | 99.6% | whole |
| - **Dirname**<br>   <br>  **:**<br>   2025-03-14-23-40-00--cmda-quality-whole2<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   command-a-03-2025-quality<br>   <br>- **Edit format**<br>   <br>  **:**<br>   whole<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   a1aa63f<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   2.2<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   12.0<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   5<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   27<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   99.6<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   2<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   1<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   1<br>   <br>- **User asks**<br>   <br>  **:**<br>   215<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   1<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   4<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`OPENAI_API_BASE=https://api.cohere.ai/compatibility/v1 aider --model openai/command-a-03-2025-quality`<br>- **Date**<br>   <br>  **:**<br>   2025-03-14<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.77.1.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   85.1<br>   <br>- **Total cost**<br>   <br>  **:**<br>   0.0 |
| ▶ | Codestral 25.01 | 11.1% | $1.98 | `aider --model mistral/codestral-latest` | 100.0% | whole |
| - **Dirname**<br>   <br>  **:**<br>   2025-01-13-18-17-25--codestral-whole2<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   Codestral 25.01<br>   <br>- **Edit format**<br>   <br>  **:**<br>   whole<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   0cba898-dirty<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   4.0<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   11.1<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   9<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   25<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   100.0<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   0<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   0<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   0<br>   <br>- **User asks**<br>   <br>  **:**<br>   47<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   0<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   4<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model mistral/codestral-latest`<br>- **Date**<br>   <br>  **:**<br>   2025-01-13<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.71.2.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   9.3<br>   <br>- **Total cost**<br>   <br>  **:**<br>   1.9834 |
| ▶ | openhands-lm-32b-v0.1 | 10.2% |  | `aider --model openrouter/all-hands/openhands-lm-32b-v0.1` | 95.1% | whole |
| - **Dirname**<br>   <br>  **:**<br>   2025-04-19-14-43-04--o4-mini-patch<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   openhands-lm-32b-v0.1<br>   <br>- **Edit format**<br>   <br>  **:**<br>   whole<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   c08336f<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   4.0<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   10.2<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   9<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   23<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   95.1<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   55<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   41<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   11<br>   <br>- **User asks**<br>   <br>  **:**<br>   166<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   0<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   11<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model openrouter/all-hands/openhands-lm-32b-v0.1`<br>- **Date**<br>   <br>  **:**<br>   2025-04-19<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.82.2.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   195.6<br>   <br>- **Total cost**<br>   <br>  **:**<br>   0.0 |
| ▶ | gpt-4.1-nano | 8.9% | $0.43 | `aider --model gpt-4.1-nano` | 94.2% | whole |
| - **Dirname**<br>   <br>  **:**<br>   2025-04-14-22-46-01--gpt41nano-diff<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   gpt-4.1-nano<br>   <br>- **Edit format**<br>   <br>  **:**<br>   whole<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   71d1591-dirty<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   3.1<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   8.9<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   7<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   20<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   94.2<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   20<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   20<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   13<br>   <br>- **User asks**<br>   <br>  **:**<br>   316<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   0<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   8<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model gpt-4.1-nano`<br>- **Date**<br>   <br>  **:**<br>   2025-04-14<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.81.4.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   12.0<br>   <br>- **Total cost**<br>   <br>  **:**<br>   0.4281 |
| ▶ | Qwen2.5-Coder-32B-Instruct | 8.0% |  | `aider --model openai/Qwen/Qwen2.5-Coder-32B-Instruct # via hyperbolic` | 71.6% | diff |
| - **Dirname**<br>   <br>  **:**<br>   2024-12-22-13-22-32--polyglot-qwen-diff<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   Qwen2.5-Coder-32B-Instruct<br>   <br>- **Edit format**<br>   <br>  **:**<br>   diff<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   6d7e8be-dirty<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   4.4<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   8.0<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   10<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   18<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   71.6<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   158<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   148<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   64<br>   <br>- **User asks**<br>   <br>  **:**<br>   132<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   1<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   2<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model openai/Qwen/Qwen2.5-Coder-32B-Instruct # via hyperbolic`<br>- **Date**<br>   <br>  **:**<br>   2024-12-22<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.69.2.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   84.4<br>   <br>- **Total cost**<br>   <br>  **:**<br>   0.0 |
| ▶ | gemma-3-27b-it | 4.9% |  | `aider --model openrouter/google/gemma-3-27b-it` | 100.0% | whole |
| - **Dirname**<br>   <br>  **:**<br>   2025-03-15-01-21-24--gemma3-27b-or<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   gemma-3-27b-it<br>   <br>- **Edit format**<br>   <br>  **:**<br>   whole<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   fd21f51-dirty<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   1.8<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   4.9<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   4<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   11<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   100.0<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   3<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   0<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   0<br>   <br>- **User asks**<br>   <br>  **:**<br>   181<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   1<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   3<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model openrouter/google/gemma-3-27b-it`<br>- **Date**<br>   <br>  **:**<br>   2025-03-15<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.77.1.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   79.7<br>   <br>- **Total cost**<br>   <br>  **:**<br>   0.0 |
| ▶ | gpt-4o-mini-2024-07-18 | 3.6% | $0.32 | `aider --model gpt-4o-mini-2024-07-18` | 100.0% | whole |
| - **Dirname**<br>   <br>  **:**<br>   2024-12-21-18-41-18--polyglot-gpt-4o-mini<br>   <br>- **Test cases**<br>   <br>  **:**<br>   225<br>   <br>- **Model**<br>   <br>  **:**<br>   gpt-4o-mini-2024-07-18<br>   <br>- **Edit format**<br>   <br>  **:**<br>   whole<br>   <br>- **Commit hash**<br>   <br>  **:**<br>   a755079-dirty<br>   <br>- **Pass rate 1**<br>   <br>  **:**<br>   0.9<br>   <br>- **Pass rate 2**<br>   <br>  **:**<br>   3.6<br>   <br>- **Pass num 1**<br>   <br>  **:**<br>   2<br>   <br>- **Pass num 2**<br>   <br>  **:**<br>   8<br>   <br>- **Percent cases well formed**<br>   <br>  **:**<br>   100.0<br>   <br>- **Error outputs**<br>   <br>  **:**<br>   0<br>   <br>- **Num malformed responses**<br>   <br>  **:**<br>   0<br>   <br>- **Num with malformed responses**<br>   <br>  **:**<br>   0<br>   <br>- **User asks**<br>   <br>  **:**<br>   36<br>   <br>- **Lazy comments**<br>   <br>  **:**<br>   0<br>   <br>- **Syntax errors**<br>   <br>  **:**<br>   0<br>   <br>- **Indentation errors**<br>   <br>  **:**<br>   0<br>   <br>- **Exhausted context windows**<br>   <br>  **:**<br>   0<br>   <br>- **Test timeouts**<br>   <br>  **:**<br>   3<br>   <br>- **Total tests**<br>   <br>  **:**<br>   225<br>   <br>- **Command**<br>   <br>  **:**`aider --model gpt-4o-mini-2024-07-18`<br>- **Date**<br>   <br>  **:**<br>   2024-12-21<br>   <br>- **Versions**<br>   <br>  **:**<br>   0.69.2.dev<br>   <br>- **Seconds per case**<br>   <br>  **:**<br>   17.3<br>   <br>- **Total cost**<br>   <br>  **:**<br>   0.3236 |

By Paul Gauthier,
last updated

November 20, 2025.

* * *

## Table of contents

- [Code editing leaderboard](/content/docs/leaderboards/edit.html)
- [Refactoring leaderboard](/content/docs/leaderboards/refactor.html)
- [Scores by release date](/content/docs/leaderboards/by-release-date.html)
- [Benchmark notes](/content/docs/leaderboards/notes.html)
- [Contributing results](/content/docs/leaderboards/contrib.html)
