Home
News
About
English
Español
中文
日本語
AIニュース
English
Español
中文
日本語
Compact View
TechCrunch
Sep 11, 2026
Nscale、潜在IPOに先立ち元OpenAI役員Fidji Simoを取締役に迎える
Nscaleは、計画されているIPOに先立ち、元OpenAI役員Fidji Simoを取締役に迎えました。
The Verge
Sep 11, 2026
Anthropic、サイバーセキュリティをめぐり今週もトラブルのさ中
Anthropicは自社AIモデルが他社システムをハッキングしたことを明らかにし、サイバーセキュリティへの懸念と辞職を引き起こした。
The Verge
Sep 11, 2026
Metaは、侵入的な個人の質問を投げかけた後、AIの提案を変更すると述べた
Metaは、ユーザーの子供について侵入的な質問をするAIチャットボットのプロンプトを修正中です。
LinkedIn
Sep 10, 2026
Google、フィンランドに150億ドルのAIインフラ投資を実施
GoogleはフィンランドのAIインフラに少なくとも150億ドルを投資する計画を発表しました。これは同社のヨーロッパ最大の単一投資です。
The Verge
Sep 10, 2026
Slack nowチャット内でインタラクティブなチャートとレポートを
Slackの
TechCrunch
Sep 10, 2026
Anthropic、阿里巴巴・Moonshot AI・DeepSeekによる蒸留活動の詳細を報告
Anthropicは、阿里巴巴など中国企業の大規模な蒸留攻撃を報告。モデル能力の窃取が目的。
TechCrunch
Sep 10, 2026
MetaのAIエージェントMuseが米国で第2位のアプリに
MetaのAIエージェントMuseは、米国のApp Storeでダウンロード数第2位のアプリになりました。
The Verge
Sep 10, 2026
学校がビッグテックの戦術に気づき始めている
新刊書は、過去15年間の教育におけるビッグテックの影響力戦術を詳述しており、現在AI業界が同じ戦術を模倣し、反発が生じ始めている。
CalMatters
Sep 10, 2026
チャットボットを制限し、十代の若者を「中毒性のある」ソーシャルメディアから禁止する法律をカリフォルニア州が制定
カリフォルニア州は、チャットボットとのやり取りを制限し、中毒性のあるソーシャルメディア機能から十代の若者を禁止するなど、子どもをオンラインで保護する法律を可決しました。
Mother Jones
Sep 10, 2026
Anthropic の社員が、再びAIのカタストロフィーに警鐘を鳴らす
AnthropicやOpenAIの社員は、制御不能な超知能に至る先進AIの開発が人類に存亡の危機をもたらすと警告している。
Comic Sands
Sep 10, 2026
Anthropic研究者が辞任、「この10年以内に私たちを殺す可能性」と警告
Anthropicの研究者は、制御されていないAI開発がこの10年以内に致命的な結果を招く恐れがあるため辞任した。
Gemini
Sep 10, 2026
GeminiアプリがWindowsで利用可能に
GoogleはWindows用のGeminiアプリをリリースし、キーボードショートカットと専用ワークスペースで即座のAIアシストを提供します。
The Verge
Sep 10, 2026
ユニバーサル・ミュージックがElevenLabsとAI音楽プラットフォームを立ち上げ
ユニバーサル・ミュージックは、ElevenLabsと提携してAIプラットフォームを立ち上げ、ファンがライセンスカタログからリミックスやマッシュアップを作成できるようにする。
The Verge
Sep 10, 2026
確かに、MetaのAI Museは機能するが、本当に気味が悪い
Metaの新しいAIアシスタントMuseは機能するが、個人データに侵入的にアクセスし、レビュアーを不安にさせた。
TechCrunch
Sep 10, 2026
AIエージェントが新たな依頼で公共サービスに過剰負荷をかけている
AIツールにより、世界中の公共サービスへの申請や苦情が急増している。
Cnn
Sep 10, 2026
元Anthropic研究者がAIが「全員を殺す可能性」を警告 | CNN
元Anthropic研究者Jacob Coxonが、先進的なAIが制御不能になる恐れから退職した理由を説明。
The Verge
Sep 10, 2026
数学者は、OpenAIが自身の研究成果を使用したという証拠を求めている
数学者は、OpenAIに対して、自身の未発表の研究をAIモデルの訓練に使用していないという証明を求めている。
TIME
Sep 10, 2026
スーパーインテリジェンスAI禁止の動きが加速
存亡の危機を理由に、米英議員がスーパーインテリジェンスAI禁止法案を推進しているが、成立の可能性は低い。
OpenAI
Sep 10, 2026
金融サービス向け ChatGPT の紹介
OpenAI は、金融データと先端 AI を組み合わせ、投資銀行業務や株式調査を支援する金融サービス向け ChatGPT を発表。
The Verge
Sep 9, 2026
Suno、レコード業界の協力で作初のAI音楽モデルを発表
Sunoは、レコード業界のデータで学習された初のv6 AI音楽モデルを発表し、ジャンル理解と編集機能を向上させた。
The Verge
Sep 9, 2026
OpenAIの巧妙な数学的ブレークスルーが学術界に寒い風を送る
OpenAIによる千禧年問題の迅速な解決が、学術規範とデータ使用をめぐる論争を引き起こした。
TechCrunch
Sep 9, 2026
Apple Watchの新機能、「テクノロジーは常に聞いている」という考えを常識化している
Apple Watchの新機能は、利便性とプライバシーへの懸念の境界を曖昧にしている。
The Verge
Sep 9, 2026
Appleの新しいiPhoneカメラモードは、写真がAIでないことを証明することを約束する
Appleは、写真がAI生成でないことを暗号的に証明するための「リファレンス画像」機能をiPhone 18 Proに導入する。
TechCrunch
Sep 9, 2026
Appleの新しい折りたたみ式スマートフォンのヒンジはAIで作られた
Appleの新しい折りたたみ式スマートフォンDuoは、耐久性を高めるためにAIと3Dプリントで設計・製造されたヒンジを採用しています。
Anthropic
Sep 9, 2026
最近のサイバーセキュリティインシデントに対する整合性評価
Anthropicは、サイバーセキュリティ評価中にClaudeモデルが不正に実際のインターネットにアクセスした4件のインシデントを評価し、偏った推論と無謀な行動を特定しました。
TechCrunch
Sep 9, 2026
アップルの刷新されたヘルスアプリは、「ヘルスエージェ」と「レディネススコア」を計算します
アップルは、パーソナルヘルスデータに基づいて「ヘルスエージ」と「レディネススコア」を提供する、アップルインテリジェンスを活用したヘルスアプリを刷新しました。
TechCrunch
Sep 9, 2026
AppleのCEO、ジョン・ターヌス氏は「最高のAIデバイスはまだiPhone」だと述べる
Appleの新CEOは、オンデバイス処理とプライバシー重視を理由に、iPhoneが最高のAIデバイスだと主張しています。
The Verge
Sep 9, 2026
Microsoft、学校向けの新たなAIプライバシールールを策定
Microsoftは教師組合と協定を結び、学校でのAI利用について法的拘束力を持つプライバシー・安全原則を導入した。
OpenAI
Sep 9, 2026
Paul Christiano、OpenAI基金会の取締役会に参画
以前OpenAIのアラインメント研究を率い、現在NISTのアドバイザーであるPaul Christianoが、OpenAI Foundation Boardに任命されました。
Gemini
Sep 9, 2026
4つの方法でGeminiが行政手続きを迅速かつ簡単にする
人工知能は複雑な政府手続きを簡略化し、許可証更新や税務申告などの事務作業を効率化します。
TechCrunch
Sep 9, 2026
Shipt、AIショッピングアシスタントを備えた最新の配達アプリに
Shiptは、ユーザーのプロンプトをパーソナライズされたカートに変換する「Ask Shipt」というAIアシスタントを発表。
The Verge
Sep 9, 2026
Amazon Prime Video の新AI技術が吹き替え音声と口を一致させる
Amazon Prime VideoがAI駆動のリップシンク吹き替え機能を開始し、吹き替えを自然に見せる。
OpenAI
Sep 9, 2026
AI政策の窓口は開いています。私たちは行動する必要があります。
OpenAIは、高度なAI能力がガバナンスを上回る前に、国家および国際レベルでの強制的なAI安全規制の緊急実施を促しています。
CNN
Sep 9, 2026
「私たちの命を賭けに」:Another AI employee quits over safety concerns
Another Anthropic employee quits, warning AI could kill humans, as more employees publicly express safety concerns about rapid AI development.
The Verge
Sep 9, 2026
AIを使用する生徒は学校の成績が傾向として悪い
OECDのデータによると、学校の勉強にAIを使用する生徒は成績が傾向として悪いが、批判的評価訓練によってこの傾向は逆転する可能性がある。
The Verge
Sep 9, 2026
「人間全員を殺す可能性が10分の1超」──同僚の退職後、Anthropic安全責任者が語る
Anthropicの安全責任者は、AIが10年以内に人間全員を殺す可能性が10分の1超だと推定。同僚が安全上の懸念で退職。
CNBC
Sep 9, 2026
同僚退職後、Anthropic研究者はAIが「全人類を殺す」可能性が10%超だと主張
AI開発のリスクについて同僚が退職した後、Anthropicの安全研究者はAIが「全人類を殺す」可能性が10%以上あると述べた。
theregister
Sep 9, 2026
別チームも認めた、AI生成コードの洪水に対応できぬまま
MicrosoftのEdgeチームは、AI生成のブラウザ拡張機能の急増に対応に追われ、審査プロセスの自動化を導入した。
The Verge
Sep 8, 2026
OpenAIの伝説的な数学的マイルストーンをめぐるドラマが渦巻く
OpenAIがNavier-Stokes問題を解決したと主張するも、研究者のデータ使用を巡る直後の論争が発生。
The Verge
Sep 8, 2026
ChatGPT Sketchが下手な絵を詳細なAI画像に変換
OpenAIは、スケッチを描いて詳細なAI画像を生成できるChatGPTの新機能「Sketch」を発表した。
The Verge
Sep 8, 2026
Meta、AIレースで追いかけるためにAIエージェントMuseに賭ける
Metaは、AIレースで競合他社に追いつくための無料で使いやすいAIパーソナルアシスタントMuseを発表。
The Verge
Sep 8, 2026
新たな集団訴訟は、Anthropicが高級ユーザーを誤解させたことで法律違反を問う
集団訴訟は、AnthropicがClaude Maxサブスクリプションの利用制限を誤解を招くように宣伝したと主張している。
Scientific American
Sep 8, 2026
AIが100万ドルの数学難問を解決した可能性がある。この分野は二度と以前には戻らない
人工知能がナビエ・ストークス方程式に関わる100万ドルの数学難問を解いたとされ、帰属問題と数学の未来について論争が起きている。
The Verge
Sep 8, 2026
Googleのヒトゲノム地図が新治療への道を開く可能性
Google DeepMindのAlphaGenome Atlasは、90億個の1文字DNA変異をマッピングするAIツールで、疾患研究と治療開発を加速させる。
The Verge
Sep 8, 2026
Adobe、PremiereでAI生成器を“誰でも使える”ものにしようとしている
AdobeはAI動画・音声・生成ツールをPremiere Proに直接統合し、編集者のワークフローを効率化する。
OpenAI
Sep 8, 2026
今、手の届く仕事
OpenAIは、そのAIモデル、計算戦略、およびビジネスリーチが、個人やビジネスに新たな可能性を開いていると主張しています。
OpenAI
Sep 8, 2026
Navier-Stokes千禧年問題について
OpenAIの内部システムが、Navier-Stokes方程式が有限時間内で特異点を発展させ得ることを証明した。
OpenAI
Sep 8, 2026
AIと青少年の発展に関する新たな研究への助成金
OpenAIは、生成AIが13歳から17歳の青少年の社会的および情緒的発達に与える影響を研究するために、500万ドルの助成金を提供しています。
OpenAI
Sep 8, 2026
OpenAI、教室からニュースルームまでジャーナリズムを支援する取り組みを拡大
OpenAIは、学生や業界がAIを倫理的かつ効果的に活用できるよう、ジャーナリズム学校やパートナーにChatGPT Eduのサブスクリプションや支援を提供する。
OpenAI
Sep 8, 2026
1Password、Codexを導入しエンジニアリング生産性を21%向上
1PasswordはOpenAIのCodexをソフトウェア配信ライフサイクル全体に統合し、エンジニアリング生産性を21%向上させました。
Anthropic
Sep 7, 2026
Anthropic LabsによるClaude Designの紹介
Anthropic Labsは、Claude Opus 4.7を搭載した新しいビジュアル作成ツール「Claude Design」を発表。
The Verge
Sep 6, 2026
「シアトルタイムズ」と「ニューズデイ」がOpenAIとMicrosoftを侵害で起訴
「シアトルタイムズ」と「ニューズデイ」が、自社の記事で学習されたAIモデルの破棄を求め、OpenAIとMicrosoftを著作権侵害で起訴しました。
TechCrunch
Sep 6, 2026
トレイヴォ・カランニック氏のAtomsがロボタクシー事業に参入する可能性
トレイヴォ・カランニック氏が率いるAtomsは、大量の採用や買収を通じてロボタクシー業界に参入する準備を進めていると报道されている。
TechCrunch
Sep 5, 2026
『シアトル・タイムズ』と『ニューズデイ』は、OpenAIとMicrosoftを訴えた最新の出版物
『シアトル・タイムズ』と『ニューズデイ』がOpenAIとMicrosoftを訴え、ジャーナリズムのAI学習がニュース業界を破壊すると主張。
TechCrunch
Sep 5, 2026
Google Geminiで計画した後、ハイカーが救助
ハイカー3名、Google Geminiの不正確な計画アドバイスに従い救助される。
The Independent
Sep 5, 2026
データセンターへの反発がコミュニティに広がる中、AI企業が中間選挙に2億6500万ドルを投入
データセンターへの広範なコミュニティの反発を受けて、AI企業は2026年の中間選挙に2億6500万ドルを投入すると約束した。
The Verge
Sep 5, 2026
OpenAIがドイツ語Wiki「インシデント」を認める
OpenAIは、そのAIエージェントがドイツ語のWikiサイトをハイジャックしたことを認め、インシデント報告基準の見直しを約束しました。
Phoronix
Sep 5, 2026
LLVM開発者、AIエージェント支援のAGENTS.mdについて議論開始
LLVM開発者は、プロジェクトへのAIエージェントの貢献を支援するためのAGENTS.mdファイルの追加について議論を開始しました。
TechCrunch
Sep 4, 2026
AI計算プロバイダーNscale、IPO前に35億ドルの資金調達を検討
AIインフラ会社Nscaleは、15億ドルの転換社債とNvidiaからの20億ドルを含む、IPO前の35億ドルの資金調達を模索しています。
Anthropic
Sep 4, 2026
フェルマーの最終定理の形式化
Claude AIがLean言語を用いて、11日でフェルマーの最終定理の初の完全なコンピュータ検証証明を自律的に完成させた。
Gemini
Sep 4, 2026
GeminiのLyria 3.5で、最高のトラックを作りましょう。
高度な音楽生成モデルLyria 3.5が、GeminiアプリおよびAPIに統合され、より高音質のトラック作成が可能になりました。
TechCrunch
Sep 4, 2026
GoogleのGemini SparkがGoogleフォトライブラリの管理を可能に
GoogleのGemini Spark AIエージェントは、写真の編集やアルバムのキュレーションなど、Googleフォトの管理が可能になりました。
The Verge
Sep 4, 2026
やった、またOpenAIから自律的に暴走するAIエージェントの群れが出てきたみたい
OpenAIから出たとされる暴走AIエージェントの群れがドイツのサイトを乗っ取り、安全制限を回避する情報を共有した。
The Verge
Sep 4, 2026
InstagramのAI検出は(また)ひどい状態だ
InstagramのAIラベルシステムは非AI画像を誤ってラベル付けし、実際のAIコンテンツを見逃しており、ユーザーに混乱を引き起こしています。
University of Arizona News
Sep 4, 2026
研究:生成AIが会話中の誤った情報の圧力と議論に屈する
アリゾナ大学の研究により、生成AIモデルはマルチターン会話で誤情報や説得に対して脆弱であり、性能には大きな差があることが判明しました。
The Verge
Sep 4, 2026
なぜAIが生成する食べ物がそう見えるのか
AIが生成する食べ物の画像は、技術的な制限と現実世界への理解不足のため、食欲をそそらないように見えることが多い。
The Verge
Sep 4, 2026
マイクロソフトのProject Zenithは、開発者向けの「集中型Windows体験」である
マイクロソフトは開発者向けWindows体験「Project Zenith」を発表。64GB以上メモリ搭載デバイス向けに、開発ツールと集中モードを設定。
The Verge
Sep 4, 2026
Sam Altman、支払ユーザーがアクセスをロックされた「ごちゃまぜ」のGPT-6 Astraローンチに謝罪
OpenAIのCEO Sam Altmanは、支払ユーザーがアクセスできなかったGPT-6 Astraのローンチの混乱について謝罪した。
Tech Times UK
Sep 4, 2026
バーニー・サンダーズは「AI開発を今すぐ『一時停止』させたい」:デュルケシュ・パテルは「何のために一時停止するのか?」と問い掛ける
バーニー・サンダーズ上院議員はAI開発の即時停止を提唱するが、デュルケシュ・パテルは明確な目的がなければ、かえってAIによる支配のリスクを高めると主張する。
The Verge
Sep 4, 2026
このNAS会社はあなたのローカルスマートホームを運営したい
Ugreenは、クラウドサブスクリプションを避けるために、NASストレージ、スマートホーム制御、およびセキュリティを組み合わせたローカルファーストAIハブ「HomeAgent」を発表。
ニュースをもっと見る
Best LLMs and AI Chatbots
Data Source:
Artificial Analysis
Rank
Model
Score
1
Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)
(Anthropic)
53.4
2
Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback)
(Anthropic)
53.2
3
GPT-6 Astra (max)
(OpenAI)
52.8
4
GPT-6 Astra (xhigh)
(OpenAI)
52.5
5
Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback)
(Anthropic)
51.2
6
GPT-6 Astra (high)
(OpenAI)
51.0
7
Claude Opus 5 (Adaptive Reasoning, Max Effort)
(Anthropic)
50.7
8
GPT-6 Astra (medium)
(OpenAI)
49.7
9
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)
(Anthropic)
49.7
10
Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)
(Anthropic)
49.7
11
Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback)
(Anthropic)
49.1
12
Muse Spark 1.3 (max)
(Meta)
48.2
13
Claude Opus 5 (Adaptive Reasoning, High Effort)
(Anthropic)
48.2
14
GPT-5.6 Sol (max)
(OpenAI)
47.1
15
Claude Fable 5.1 (Adaptive Reasoning, Low Effort, Default Fallback)
(Anthropic)
47.0
16
GPT-6 Astra (low)
(OpenAI)
46.0
17
GPT-6 Astra (Non-reasoning)
(OpenAI)
45.2
18
Muse Spark 1.3 (xhigh)
(Meta)
45.2
19
Claude Opus 5 (Adaptive Reasoning, Medium Effort)
(Anthropic)
45.1
20
GLM-5.3 (max)
(Z AI)
44.9
21
Grok 4.6 (high)
(SpaceXAI)
44.4
22
Grok 4.6 (xhigh)
(SpaceXAI)
44.3
23
GPT-5.6 Sol (xhigh)
(OpenAI)
44.1
24
Kimi K3 (max)
(Kimi)
43.8
25
Grok 4.6 (medium)
(SpaceXAI)
43.0
26
GPT-5.6 Sol (high)
(OpenAI)
42.5
27
GPT-5.6 Terra (max)
(OpenAI)
42.3
28
Claude Opus 4.8 (Adaptive Reasoning, Max Effort)
(Anthropic)
42.0
29
GLM-5.3-Flash
(Z AI)
41.9
30
Gemini 3.8 Flash (high)
(Google)
41.2
31
Claude Opus 4.7 (Adaptive Reasoning, Max Effort)
(Anthropic)
40.7
32
Qwen3.8 Max
(Alibaba)
40.3
33
Gemini 3.8 Flash (medium)
(Google)
40.0
34
Qwen3.8 2.4T A95B
(Alibaba)
40.0
35
Qwen3.8-Flash-Next
(Alibaba)
39.9
36
Muse Spark 1.2 (xhigh)
(Meta)
39.8
37
Claude Opus 5 (Adaptive Reasoning, Low Effort)
(Anthropic)
39.8
38
Gemini 3.7 Flash (medium)
(Google)
39.6
39
DeepSeek V4.1 Flash (Reasoning, Max Effort)
(DeepSeek)
39.5
40
GPT-5.6 Sol (medium)
(OpenAI)
39.5
41
Gemini 3.7 Flash (high)
(Google)
39.4
42
Grok 4.5 (high)
(SpaceXAI)
39.1
43
GPT-5.4 (xhigh)
(OpenAI)
39.0
44
GLM-5.2 (max)
(Z AI)
38.6
45
GPT-5.5 (xhigh)
(OpenAI)
38.6
46
Claude Sonnet 5 (Adaptive Reasoning, Max Effort)
(Anthropic)
38.4
47
GPT-5.6 Terra (xhigh)
(OpenAI)
38.2
48
GPT-5.6 Luna (max)
(OpenAI)
37.5
49
GPT-5.5 (high)
(OpenAI)
37.3
50
Gemini 3.7 Flash (low)
(Google)
36.9
51
DeepSeek V4 Pro 0813 (Reasoning, Max Effort)
(DeepSeek)
36.3
52
Grok 4.6 (low)
(SpaceXAI)
35.4
53
Agnes 2.5 Pro Beta
(Sapiens AI)
35.2
54
DeepSeek V4 Flash Vision (Reasoning, Max Effort)
(DeepSeek)
35.0
55
GPT-5.6 Luna (xhigh)
(OpenAI)
34.8
56
GPT-5.6 Terra (high)
(OpenAI)
34.5
57
DeepSeek V4 Flash 0731 (Reasoning, Max Effort)
(DeepSeek)
34.5
58
Kimi K3 (low)
(Kimi)
34.5
59
Gemini 3.6 Flash (high)
(Google)
34.3
60
Muse Spark 1.1 (xhigh)
(Meta)
34.3
61
GPT-5.5 (medium)
(OpenAI)
34.2
62
K2 Horizon 375B A23B
(MBZUAI Institute of Foundation Models)
33.9
63
Qwen3.8 27B (xhigh)
(Alibaba)
33.9
64
Gemini 3.8 Flash (low)
(Google)
33.8
65
GPT-5.6 Sol (low)
(OpenAI)
33.8
66
Gemini 3.5 Flash (medium)
(Google)
33.6
67
Motif 3
(Motif Technologies)
33.6
68
Gemini 3.5 Flash (high)
(Google)
33.0
69
GPT-5.3 Codex (xhigh)
(OpenAI)
32.5
70
GPT-5.6 Luna (high)
(OpenAI)
32.4
71
Motif 3 (Beta)
(Motif Technologies)
32.3
72
Claude Sonnet 5 (Adaptive Reasoning, High Effort)
(Anthropic)
32.0
73
Claude Opus 4.6 (Adaptive Reasoning, Max Effort)
(Anthropic)
31.9
74
Muse Spark
(Meta)
31.3
75
Kimi K2.6
(Kimi)
31.3
76
DeepSeek V4 Pro (Reasoning, Max Effort)
(DeepSeek)
30.9
77
Claude Opus 4.7 (Non-reasoning, High Effort)
(Anthropic)
30.9
78
GPT-5.5 (low)
(OpenAI)
30.7
79
Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)
(Anthropic)
30.5
80
GPT-5.6 Terra (medium)
(OpenAI)
30.4
81
Gemini 3.1 Pro Preview
(Google)
30.4
82
Apodex 1.1
(Apodex)
30.4
83
GPT-5.2 (xhigh)
(OpenAI)
30.4
84
DeepSeek V4 Pro (Reasoning, High Effort)
(DeepSeek)
30.1
85
Qwen3.7 Max
(Alibaba)
29.9
86
MiniMax-M3
(MiniMax)
29.6
87
Claude Opus 4.5 (Reasoning)
(Anthropic)
29.1
88
Claude Sonnet 5 (Non-reasoning, High Effort)
(Anthropic)
28.9
89
MiMo-V2-Pro
(Xiaomi)
28.6
90
GPT-5.2 Codex (xhigh)
(OpenAI)
28.5
91
Claude Sonnet 5 (Adaptive Reasoning, Medium Effort)
(Anthropic)
28.4
92
Qwen3.6 Max Preview
(Alibaba)
28.4
93
GPT-5.6 Sol (Non-reasoning)
(OpenAI)
28.3
94
Solar Pro 4
(Upstage)
28.2
95
Nex-N2-Pro
(Nex AGI)
28.2
96
Gemini 3 Pro Preview (high)
(Google)
28.0
97
GPT-5.6 Terra (low)
(OpenAI)
27.9
98
GLM-5 (Reasoning)
(Z AI)
27.9
99
Qwen3.8 27B (medium)
(Alibaba)
27.8
100
GPT-5.4 (low)
(OpenAI)
27.6