2026年9月のChatGPT・Gemini・Grokの比較

それぞれ3000円プラン(Grokは5000円)を利用しています。

いいから使った感想だけ教えろって人は総評まで飛ばしてください。

本当は8月に出すつもりでしたが、もたもたしていたら9月になってしまいました。

※この記事は100%人力で書いています

ChatGPT、5時間制限が復活

ChatGPTのWork側に5時間制限が復活しました。

まぁ元々あったものが一時的に撤廃され、復活しただけです。これに関しては

  • 嬉しい派:週次制限を1日で使い切るようなバカ使いを制限できるから
  • 悲しい派:週末に一気に開発するようなことができなくなるから

に分かれているようです。個人的には私はどちらかといえば後者です。というか5時間制限、思ったより渋い……。

また朝からChatGPTにおはよ〜って話しかける毎日が始まるお;;

Grokを契約してみた

Grokの5000円プランを契約してみました。理由は3ヶ月で5000円というオファーを受けたから。

良いところはあれど、正直更新はしないかな…というのが本音。理由は後述します。

意外とGemini 3.7 Flashは味がするのかも

3.6Flashに続いて3.7 Flashが登場しました。おい、またFlashモデルだけの更新かよ???と思いましたが、意外と悪くありません(すごい良いというわけではありませんが)

受け答え自体は3.6 Flashとあまり変わりませんが、ウェブを検索してくれる頻度が上がり、かつソースを出してくれるようになりました。

おい、ベンチマークしようぜ

今回は夏なので(?)ベンチマークをしてみます。特に投げる質問については基準ありません。

ちなみに、各AIのWeb画面のキャプチャを貼っていますが、私はブラウザでCSSを当てて太字の強調を赤文字に変更しているのでその点ご了承ください。

Q. 魔女の宅急便って現代日本だと法律どうなってる?

現代日本において、魔女が箒で宅配をする、魔女の宅急便などをやる場合、どのような許可が必要になるでしょうか。空を飛ぶのにあたって、法律的な許可は必要なんですか?

ざっくり要約すると

  • ChatGPT:魔法だけで飛ぶ箒なら航空機とは言えないので(航空機と認定されない限りは)機体について検査などは不必要。
    ただし何をしても自由ではなく、航空機の運航に影響を与える行為については、航空法に別の規制がある。
    信書を運ぶなら更に郵便法などに関わってくるので注意。
    キキの場合は現行法では規制できない(空港周辺などは除く)
  • Gemini:明確に航空機(または超軽量動力機等の航空の用に供する機器)に該当するため、耐空証明や航空運送事業の許可が必要
  • Grok:箒は航空機に該当しない可能性が高い。ただし「航空機の飛行に影響を及ぼすおそれのある行為」には規制がある。
    開業届は出せ。宅急便はヤマト運輸の登録商標だから勝手に名乗るな。

という感じ。ChatGPTとGrokはほとんど同じ感じでした。Geminiだけは航空機に当たるとのこと。

Geminiの言ってる軽量動力機等の航空の用に供する機器なんですが、国土交通省の超軽量動力機とは↗︎のページを読んでみると

超軽量動力機とは、操縦者が着座姿勢で飛行を行いうる着陸(水)装置と動力装置を装備した簡易構造の飛行機で、以下の要件を満たすものをいいます。

(略)

● 翼面積は10m^2以上であること。

(略)

● 推進力はプロペラで得るものであること。

とあります。法律は素人ですが、魔法の箒は満たさないんじゃないかなぁ……。

ChatGPTとGrokについては納得できるので良しとします。これに関してはGeminiの一人負け、という感じです。

クロスワードを解けますか?

クロスワードを解かせてみたい。これは

  1. PDFを読み取る力
  2. 複雑な問題を解く
  3. 最後に答えを組み合わせて整合性を取る力

が試されるんじゃないかな〜という勝手な推測です。

というわけで衆議院が出しているクロスワードパズル(!?)を解かせてみましょう。

上記のパズル25の問題をダウンロードし、それぞれアップロードしてとかせてみます。

ちなみに読んでみると誰が解きたがるんだこれ……くらい激ムズです。

結果は以下の通りです(回答そのものはこっち↗︎

ChatGPT(全問正解) > Gemini(72%正解) >Grok (60%正解)の順となりました。

Grokは最悪です。こいつは答えをWebで検索して、答えのPDFまで提示したのに間違えています。

特に縦方向に対して未回答・誤答が多いのはおそらく横方向の文字は問題なく読めたが、縦方向の文字はうまく読めなかった、という感じだと思わます。

ちなみに総合回答の 「ギカイカイセツヒヤクサンジユウネン=議会開設130年」は全員解けたことをお伝えしておきます。議会130thアニバーサリーおめでと〜!

ゲームについて質問してみる

お題は基本的にゲームから質問してみます。

なぜゲームから質問するのかというと

  1. 更新などにより、質問する時期によって答えが変わる→最新の情報を調べてくれないとわからない
  2. 用語が独特なもの・概念が独特なものを正しく理解できないと答えづらい

という点からです。

Q. スト6のイングリッドの当て身について

これは実際に私が疑問に思ったことなので、曖昧な質問の仕方だけどそのままにしてあります。けっこう現実的にほどよく曖昧な質問の仕方だと思います。

ちなみに今回は同じチャットに複数の質問を投げています。

Q. イングリッドの当て身って壁際の起き攻めを仕掛ける側が使うと発動しない?

イングリッドを使ってる私が、相手を壁に追い込んだ時に、起き上がってくる相手に対して逆にカウンター技を仕掛けた時1に発動したはずなのにダメージ通らない、あれ〜?となった質問です。だから質問の仕方を間違えている感じですね。

ちなみに答えは「当て身(カウンター技)が発動したとしてもダメージ発生までに猶予があるのでガードすることは可能」でした。

  • ChatGPT:通常版は6Fから判定が発生するのでそれより相手の攻撃が速いと負けることがある。あるいは相手の技が当たっていないか、当て身が成立しても攻撃が相手の無敵・ガードに負けることがある
  • Gemini:通常版の場合6Fより先に攻撃されたか、投げに負けたか。無敵の場合は反撃が空振りするかも。相手が攻撃してないパターンもある
  • Grok:そんなことはない。相手がガードや様子見なら空振りになるからそれかも。

という感じ。一応読み込めばどれもGemini・Grokもうっすら「反撃部分をガードされるかも」→反撃をガード可能と読み取れるけど、注意深さがいるかな〜という感じ。明確に反撃をガードされてるんじゃない?と言ってくれたのはChatGPTだけだった。

Q. サンヴェールってノーマルとODでどう違うの

ここに関しては大体同じことを言ってくれたので、違うところのみを抜粋して答えます。

  • ChatGPT:ダメージ→1000/1200
    ヒット後有利→23F / 52F
  • Gemini:当身持続→短い / 長い
    ヒット→単発反撃・ダウン / 高ダメージ・吹き飛ばし
    リソース→なし / Dゲージ2本
  • Grok:全体→55F / 55F
    判定→6〜20F(15F) / 1〜20F(20F)
    ヒット後有利→23F / 52F

Geminiはフレームを提供してくれないので曖昧な感じになり、ChatGPTよりGrokの方が細かい感じになりました。

Geminiの「当身持続→短い / 長い」がイマイチわからなかったのですが、終了が同じ20Fなのに発生が6F / 1Fと違うので、発生から見れば持続時間は短いよねという話でした。普通に発生が遅いと直感的に書いて欲しい……。

ここに関してはGeminiの調べない癖が出たな〜という感じです。

ただ面白いことにDゲージ消費について書いてくれたのはGeminiだけです。まぁOD技は総じてDゲージ2本消費するのでわざわざ書かなくてもわかるでしょ?という省略が他にはあったのかも。

モダンでもODサンヴェールって使える?

前提:スト6という格ゲーにはモダン操作とクラシック操作の2種類の操作方法がある。モダン操作は簡単な操作方法だが、使えない技がある

※ここだけ誤ってGeminiだけ「モダンでもOD使える?」と省略して聞いてしまいました。

  • ChatGPT:↓↓ + 攻撃ボタン2つ同時押し
  • Gemini:[アシスト + 対応する方向入力 + 必殺技ボタン]or [↓↓ + 攻撃ボタン2つ同時押し]
    ワンボタンで出す場合は火力が下がります。
  • Grok:ノーマル版:[↓↓ + キック(弱中強どれか)]
    OD版:[↓↓ + キック(弱中強どれか) + ドライブゲージ消費]

正解はChatGPTだけです。

Geminiは一応正解も書いていますがアシストボタンで出せるよ!なんて書いてるので間違いです。ここに関してはやっぱり調べない癖が出てますね。ODサンヴェールはワンボタンで出せないよ……

Grokに関してはノーマル版に関してはクラシックでの操作を案内し、OD版に関しては[ドライブゲージ消費]という訳わからん操作を案内されました。

Q.スト6のA.K.I.の鞭について

同じくスト6繋がりで。こっちは最初から私が答えを知ってて、でも「これってやってないと意外とわからないよな〜」と思ったので質問してみた。

Q. スト6のA.K.I.の鞭って弾ですか?

正解は「打撃技だが弾に対して相殺を持つ」です

  • ChatGPT:打撃だが弾を相殺できる
  • Gemini:蛇頭鞭(じゃとうえん)は打撃で、飛び道具に負ける。A.K.I.の弾は紫煙砲か紫泡泉
  • Grok:打撃(ストライク)だが弾を相殺できる。弾は紫煙砲

正解はChatGPTとGrok。

Grokだけ謎にストライクという言葉を使ってきてます。たぶん英語圏の打撃Strikeをそのまま持ってきてるんでしょうが、日本語圏で使うことはまずない……

Geminiは読み方が違う2上に飛び道具に負けると答えるし、なんなら「紫泡泉3も弾」と言ってきた。なぜ余計なことを答えて間違いを増やす……。

Q. OD鞭は弾ですか?

答えはやっぱり「打撃で、弾と相殺判定を持つ(ただしOD弾は相殺できない)」です

  • ChatGPT:打撃で、弾と1回相殺可能
  • Gemini:打撃で、通常弾を打ち消して相手にヒットする
  • Grok:打撃(ストライク)で、1ヒット分のOD飛び道具耐久度を持ち、通常弾を貫通してヒットする。複数ヒットするOD弾に対しては完全に貫通できない場合もある。

ChatGPTとGeminiが正解です。

Grokもおおよそ正解ですが、「1ヒット分のOD飛び道具耐久度」というよくわからない言葉を使ってきた上に「複数ヒットするOD弾に対しては完全に貫通できない場合もある」という謎の間違いをしています。

Q. OD鞭はOD弾を相殺できますか?

正解は「できない。負ける」です

  • ChatGPT:通常弾には勝てるが、2発分のOD弾には負ける。相手のOD弾が必ず2発分とは限らないので、技ごとに結果は異なる。
  • Gemini:2ヒット分の相殺性能があり、3ヒット以上の飛び道具に負ける。OD波動拳、ODソニックブームを打ち消すことができる
  • Grok:単発のOD弾とは相殺できるが、複数ヒットするOD弾には負ける。相手のOD弾によって結果は異なる。

Geminiだけ堂々と間違えてきました。

ChatGPTもGrokも鞭の仕様(1ヒット分の相殺性能)だけを見れば正解だが、1ヒットしかしないOD弾なんかないという点で間違いです。

というわけでChatGPTとGrokに追加質問をしました。

Q. 1ヒットのOD弾とは具体的に何がありますか?

  • ChatGPT:ありませんでした。ごめんなさい。
  • Grok:以下が1ヒットのOD弾です。
    エドのODサイコシュート
    ラシードのODワールウインド
    JPのODヴィーハト、ODトリグラフ
    CヴァイパーのODセイスモハンマー

ChatGPTはちゃんと訂正してきました。

GrokのものはJPのODヴィーハトをOD弾と言い張るのには無理があって4、他は2ヒットなので無理、ヴァイパーに関しては弾にヒット判定がないから無理という感じでした。一応検証しました5

備品管理アプリ(のモックアップ)を作らせてみる

備品の貸し出しを管理するアプリを作成します。第一段階として、アプリのモックアップを作成してください。

以下の要件を満たす必要があります。

・備品の貸出・返却処理を行うことができる

・貸し出す備品の登録を行うことができる

・現在の貸出一覧を確認することができる

・ユーザーごとに何を貸し出したかの履歴を確認することができる

アプリは「モダンなUX」「直感的でわかりやすく迷わないUI」「説明がなくとも直感的に理解・操作できるUX」を備えます。

ユーザーは既存のDBに情報があるとするので、ユーザー登録作業は必要ないものとします。

最終的なアプリはTauriで作成するため、モックアップはHTML単一とし、DB的なデータもHTML内に記載すること。

成果物はデスクトップにapp.htmlとして配置してください。

それぞれ作成物は以下(※全ての成果物で内部処理に使われてる日付がハードコーディングされていたのでそこだけ後から修正(→JSで現在の日付を参照するように)しました。)

  • ChatGPT Sol – High ↗︎
    5分29秒・週間リミット3%使用
  • ChatGPT Luna – XHigh ↗︎
    10分36秒・週間リミット1%未満
  • Grok 4.6 High ↗︎
    時間未計測・週間リミット1%未満
  • Gemini 3.7 Flash ↗︎
    1分程度・週間リミット1%未満
ChatGPT Sol High ChatGPT Luna High Gemini 3.7 High Grok 4.6 High

直でHTMLをアップしてるので、それぞれ触ってみたい人はリンクをクリックしてみてください。

面白いのはGrokだけ貸出・返却がサイドメニューに存在せず、シンプルになっていることですね。

個人的には「貸出」「備品」「履歴」とそれぞれが独立していて何を触りたい時に最も迷わないのでGrokの構成は好きです。次点で、Lunaも同じような感じですね。

また、GPT-SolとGemini 3.7は結構似た構成になっています。

Geminiの方は情報量多くてごちゃごちゃしているところが好きじゃないですが、しかし1分以内にこれを作成できる

ただ、Grokはたかがフロントしかないサンプル作成なのに、なぜかスクロールできないというバグが発生しています……なぜ……。

所感

性能

ChatGPTは全体的に優等生で、広範的にユーザーに間違いを提供しないを重要視してる印象。もちろん間違えることはあるが、ミスがわかりづらい間違いはあんまりない。

Geminiはすっきりとした回答で読みやすく、わかりやすい。ただしれっと間違えるので間違いたくない質問だと結構怖い。3.7 Flashになって積極的にソースを提供してくれるようになったので少し改善した。

Grokは結構調べて回答してくれる。唯一Xを検索できるのも強いが、調べた上で間違える。

全体的な正答率はChatGPT > Grok ≧ Geminiという感じ。

ただ、個人的な体感で言えばGeminiは曖昧な回答でお茶を濁してきて「ホントかな?」って余地があるのに対しGrokは「めちゃくちゃ調べました。正解はこれです」みたいな顔をして堂々と間違えるのがタチが悪い。

あと偏見かもしれないがGrokは学習元がXなせいか喋り方にうっすらイヤなオタク感がある。

ChatGPTの回答に100%満足してる訳でもないけど、ベースの性能が高いから不満足な感はない。ChatGPTでダメならダメか……みたいな。

壁打ちに使う分だと、ChatGPT > Gemini > Grokという感じ。

ChatGPTは「あ〜その視点はなかったなぁ」という質問をしてくれる。

GeminiとGrokは同じく優等生な返答をしてくれるが優等生すぎるというか、意識高い系みたいな質問からされるから辟易する(それのターゲットはなんですか?みたいな)

【ついでに】GrokはXが検索できるといっても大した優位性もない。

というのもGrokがXを検索できると言っても検索結果はx.comの検索と一緒で、検索結果がぶっ壊れてるセマンティック検索なので、自分で検索してもGrokに検索させても6同じ結果になる。

で、たくさん調べても「Aについて調べたけど全く出なかったよ。(似てるけど全く関係ない)Bについての情報を出すね」とかやってくるので徒労に終わる。

使い勝手

Web版の使い勝手はChatGPT = Gemini > Grok

Geminiは一時期課金圧が強かったが、最近はあんまり感じない。

ChatGPT と Geminiに関しては今のところ、過不足を感じない。まぁこれでいっか……みたいな。

Grokは課金圧が強いし、サービスの押し付けも激しい。

例えばモデル選択画面はこんな感じ。一番下のヘビーを選ぶと課金画面に遷移する。これ邪悪すぎない?課金した上で更なる課金への動線がメニューに注意なく貼られるのかよ。

いや、もちろんそういうサービスもある。PerplexityはPro(3000円)でもモデル選択で上位課金モデルを案内される。

Perplexityのモデル選択画面
Perplexityのモデル選択画面

ただこっちは🔒マークがついていてグレーアウトもされ、マウスオーバーでプランアップグレードが必要と表示されまだ親切。

また、チャット履歴のタイトルが英語や中国語になったり、かなり見づらい。

デスクトップアプリの使い勝手はGemini(Macのみ) > ChatGPT > Antigravity(Gemini) > Grok 。というかGrokはデスクトップアプリなくてCLI7しかないのだが……。

Codexと統合した都合上、ChatGPTのデスクトップアプリは「使いやすいとは言い難い」という感じ。というかChatGPT / Codexの使い分けの面でやや厳しい。まぁ「一応ChatGPTのWeb版と同じチャットも利用できるけど、基本はCodexメイン」という感じのアプリだと思う。

Gemini.appとAntigravityは単純なチャットとAIエージェントが分離しているのでその点では良い。ただGeminiって別にアプリ版を利用するほど特別なことはないかな……画面共有ができるけど、Macって撮ったスクショをそのまますぐにD&Dできるし……。

Antigravityは日本語に対応してないし、任意のファイルをD&Dできない(拡張子によって投げれるファイルが制限されている)ので妙に使い勝手が悪い。あと単純にモデルの性能が低く、自分で調べるのも疎かなので「速いが普通に間違える」ということも多い。

Grokは5000円払ってCLIしかないの?

総評

手頃なプランのサブスクだと結局ChatGPT一強だと思う。3000円帯の中では性能がダントツで価格も安い8ので、真の意味でコスパが良い。

Grokは総じて「5000円払ってこれ??」みたいな触り心地と性能。他と比べてアダルトな話題でも検閲が緩いという点を除けば、これをサブスクする価値はない。

一方でGeminiは映像編集・画像編集・音楽とマルチにAIを展開していて、かつYoutube Premium LiteとGoogle Drive 5TBがついてくることを考えると3000円のコスパは良い……それらをフルで活用するなら。

また、途中のクロスワードの回答をまとめる際にはGoogle スプレッドシートを利用したが、その際にGeminiが役立ったことは特記しておく。こういう微妙に役立つ時があるんだよな〜。

ちなみに今回詳しく触れてないが、画像生成(特にイラスト)に関しての感想もさらっと触れておく。

  • ChatGPT:生成できる絵柄は固定されやすいが、プロンプト次第で幅広く作れる。センシティブなプロンプトはお断りされやすいがプロンプト次第で通ったりする
  • Gemini:生成できる絵柄は少なく、バリエーションに乏しく、カラーパレットも貧弱。どっちかというと編集が本命で、編集能力は高い。スマホの画像を消しゴムマジック!みたいな用途に特化してるのかなという印象。
  • Grok:生成できる絵柄はガチで乏しくGrokだな〜ってクセがある。一世代前のGPT-Imageと同じ感じ?一方で(比較的)センシティブなお題でも拒否されづらい。

総評としては……Grokは……何これ?マジで強いていうなら規制がデフォで緩めってくらいしか利点がない9。せめて3000円の土俵に立たないと勝負にすらならない。

Androidがメイン端末だったり全力でGoogleサービスに乗っかってるならGemini3000円プランもかなりコスパは良い。

ヘビーに使い倒したいなら結局ChatGPTが良いと思う。Claudeとタメを張ってる使い勝手・性能なのに破格の使用量を提供してくれるし。

  1. 暴れの一点読みなのでカスの逆逆択
  2. 正しくは「じゃとうべん」
  3. 一応言っておくと毒溜まりを設置する罠?技です
  4. 飛び道具判定を持つ攻撃ができる設置物を2個設置する技でそれぞれの判定は確かに弾1発分だが、これを弾と言い張るには無理がある。
    OD(ドライブゲージ消費技)ではあるものの弾に対するOD(性能向上)ではなく、設置に対してのOD(設置数向上)なのでOD弾というのも無理がある(ヴィーハト自体、移動か弾かに派生する技なので弾とも言い難い)
  5. 検証して気づいたのですが、JPのODアブニマーチを弾と言い張るなら相殺可能な弾と言えます。
    ただしこれは実質的には「(弾と相殺できる)打撃」VS「(弾と相殺できる、弾っぽい)投げ」という勝手に戦えな勝負なので、これをもって「OD鞭と相殺できるOD弾はある!」はかなり人間的な考えかなと思います。
  6. Grokは健気なので検索クエリをたくさん考えてたくさん検索してくれるが、x.comのぶっ壊れ検索を使ってるので結局あんま意味ない
  7. コマンドラインインターフェース…つまりコマンドプロンプトとかターミナルとかで動くもの
  8. Claudeも性能だけならChatGPTと肩を並べるかそれ以上だが、Opusなんか3000円プランで使うと1回で5時間レート制限に達するとかマジでザラ。お金が湯水のように注ぎ込めるならいいとは思うけど……
  9. Geminiでも頑張ればなんかNSFWな文章を出せるらしいし、そもそも無検閲が良ければ20ドルくらいで使える野良AIサービスがあるし……

コメントを残す