AIモデルランキング
チャット、コードベースの分野では、ChatGPTやGeminiを抑えClaudeのOpus 4.6の評価が一番高くなっています(あくまで投稿時点での評価です)。
コーディング(プロプライエタリ + オープンソース)
View overall rankings across AI models on agentic coding tasks involving multi-step reasoning and tool use.
コーディング(オープンソースに限定)
| Rank |
Overall Rank |
Model |
Score |
Price $/M |
Context |
| 1 |
9 |
glm-5 Z.ai · MIT |
1441+10/-10 |
$1 / $3.20 |
202.8K |
| 2 |
10 |
glm-4.7 Z.ai · MIT |
1439+10/-10 |
$0.39 / $1.75 |
202.8K |
| 3 |
14 |
kimi-k2.5-thinking Moonshot · Modified MIT |
1429+8/-8 |
$0.60 / $3 |
N/A |
| 4 |
17 |
kimi-k2.5-instant Moonshot · Modified MIT |
1408+11/-11 |
$0.38 / $1.72 |
262.1K |
| 5 |
20 |
minimax-m2.5 MiniMax · Modified MIT |
1396+8/-8 |
$0.12 / $0.99 |
196.6K |
| 6 |
22 |
minimax-m2.1-preview MiniMax · MIT |
1391+8/-8 |
$0.27 / $0.95 |
196.6K |
| 7 |
26 |
qwen3.5-397b-a17b Alibaba · Apache 2.0 |
1386+9/-9 |
$0.39 / $2.34 |
262.1K |
| 8 |
31 |
deepseek-v3.2-thinking DeepSeek · MIT |
1368+8/-8 |
$0.26 / $0.38 |
163.8K |
| 9 |
32 |
qwen3.5-122b-a10b Alibaba · Apache 2.0 |
1362+10/-10 |
$0.26 / $2.08 |
262.1K |
| 10 |
33 |
glm-4.6 Z.ai · MIT |
1354+9/-9 |
$0.39 / $1.90 |
204.8K |
チャット(テキストベース、プロプライエタリ + オープンソース)
チャット(テキストベース、オープンソース限定)
| Rank |
Overall Rank |
Model |
Score |
Price $/M |
Context |
| 1 |
14 |
glm-5.1 Z.ai · MIT |
1467±9 |
$1.40 / $4.40 |
202.8K |
| 2 |
23 |
glm-5 Z.ai · MIT |
1456±6 |
$1 / $3.20 |
202.8K |
| 3 |
25 |
kimi-k2.5-thinking Moonshot · Modified MIT |
1452±5 |
$0.60 / $3 |
N/A |
| 4 |
29 |
gemma-4-31b Google · Apache 2.0 |
1451±8 Preliminary |
$0.14 / $0.40 |
262.1K |
| 5 |
33 |
qwen3.5-397b-a17b Alibaba · Apache 2.0 |
1448±5 |
$0.39 / $2.34 |
262.1K |
| 6 |
39 |
glm-4.7 Z.ai · MIT |
1443±6 |
$0.39 / $1.75 |
202.8K |
| 7 |
43 |
gemma-4-26b-a4b Google · Apache 2.0 |
1438±8 Preliminary |
N/A |
N/A |
| 8 |
47 |
kimi-k2.5-instant Moonshot · Modified MIT |
1433±7 |
$0.38 / $1.72 |
262.1K |
| 9 |
50 |
kimi-k2-thinking-turbo Moonshot · Modified MIT |
1430±4 |
$1.15 / $8 |
262.1K |
| 10 |
53 |
glm-4.6 Z.ai · MIT |
1426±4 |
$0.39 / $1.90 |
204.8K |