▣
Make Your Own Lab

LLMがハノイの塔で「崩壊」する本当の理由

▣ シミュレーション▣ 生成AI◆ 生成AI◆ アルゴリズム◆ インタラクティブ
更新日:2026/09/23公開中

Appleの論文「The Illusion of Thinking」は,円盤の枚数を増やすとLLMの正答率が崩壊することを示し, **「推論していない」と結論しました. 反論論文は「出力トークンの上限に当たっただけだ」**と言いました.

どちらが正しいのか.同じ問題を2通りの出し方で解かせてみます.

Apple「The Illusion of Thinking」論争推論できないのか,書ききれないだけなのか

LLMがハノイの塔で「崩壊」する本当の理由

同じ問題を2通りの出し方で解かせます。左は「手順を全部書け」,右は「手順を作る関数を書け」。

最小手数 (2ⁿ−1)
1,023手
全部書くと
33千文字
1手も間違えない確率
35.9%
先に効くのは
誤りの蓄積
出力トークン上限:
円盤の枚数 n10 枚(1,023手)
▲ 誤りの限界 10▲ トークンの限界 13
1手あたりの誤り率 e0.10%
手順を全部書かせると,2つの壁にぶつかる
出力量は 10,230トークン(上限 64K に対して 16%)。そして 1手 0.100% の誤りでも,1,023手を通すと完答確率は 35.9% まで落ちます。
関数を書かせると,どちらの壁も消える
出力は n によらず 約300トークン で一定。手順を展開するのは機械なので,1手ごとの誤りも積み上がりません。これが反論論文の指摘です。

何が起きているのか

手数は 2ⁿ−1.10枚で1,023手,20枚で104万手

円盤を1枚増やすだけで手数は倍になります.これは推論の難しさではなく,答えの長さの問題です.

スライダーで n を上げていくと,トークンメーターが一気に振り切れるのが見えます. 1手あたりのトークン見積もりを2〜3倍ずらしても,限界の n は1〜2しか動きません. 2ⁿ の前では,見積もりの精度は意味を持ちません.

でも,トークンが足りても「誤りの蓄積」で壊れる

誤り率を 0.10% にしてみてください.1,000手に1回しか間違えないという,かなり優秀な設定です.

それでも n=10(1,023手)で完答確率は36%.n=13(8,191手)では0.03%. 上限64K・誤り率0.1%という条件だと,誤りの限界(n=10)のほうがトークンの限界(n=13)より先に来ます.

つまり「トークン上限のせいだ」だけでは説明しきれない.ここは反論側が言いすぎている部分です.

出し方を変えると,同じモデルが解ける

「1手ずつ列挙させる」のではなく「手順を生成する関数を書かせる」に切り替えてみてください. 出力量は n によらずほぼ一定になり,トークンの壁が消えます.

同じ問題,同じモデル,違うのは答えの表現方法だけです.

結論:どちらの論文も,片方しか見ていない

  • Apple側の「崩壊=推論していない証拠」は,答えの長さが 2ⁿ で伸びることを評価から切り離せていません
  • 反論側の「トークン上限に当たっただけ」は,誤りの蓄積を勘定に入れていません

このシミュレーションが示すのは,2つの壁が別々に存在し,条件によってどちらが先に来るかが変わるということです. そして出題形式を変えるだけで片方の壁は消える.「推論できるか」を測るつもりの実験が,実際には「長い答えを書き切れるか」を測っていた可能性があります.


ファクトと出典

元になった2つの論文
このモデルが置いた仮定(ファクトではありません)
  • 1手を自然文で書いたときのトークン数:10トークン
  • 「手順を生成する関数を書け」の出力量:300トークン
  • 完答確率は「1手あたりの誤り率 e」から (1−e)^(2ⁿ−1) で計算

いずれも見積もりであって,特定のモデルの実測値ではありません. ただし上に書いたとおり,見積もりを2〜3倍ずらしても限界の n はほとんど動きません.