LLMがハノイの塔で「崩壊」する本当の理由
Appleの論文「The Illusion of Thinking」は,円盤の枚数を増やすとLLMの正答率が崩壊することを示し, **「推論していない」と結論しました. 反論論文は「出力トークンの上限に当たっただけだ」**と言いました.
どちらが正しいのか.同じ問題を2通りの出し方で解かせてみます.
LLMがハノイの塔で「崩壊」する本当の理由
同じ問題を2通りの出し方で解かせます。左は「手順を全部書け」,右は「手順を作る関数を書け」。
何が起きているのか
手数は 2ⁿ−1.10枚で1,023手,20枚で104万手
円盤を1枚増やすだけで手数は倍になります.これは推論の難しさではなく,答えの長さの問題です.
スライダーで n を上げていくと,トークンメーターが一気に振り切れるのが見えます. 1手あたりのトークン見積もりを2〜3倍ずらしても,限界の n は1〜2しか動きません. 2ⁿ の前では,見積もりの精度は意味を持ちません.
でも,トークンが足りても「誤りの蓄積」で壊れる
誤り率を 0.10% にしてみてください.1,000手に1回しか間違えないという,かなり優秀な設定です.
それでも n=10(1,023手)で完答確率は36%.n=13(8,191手)では0.03%. 上限64K・誤り率0.1%という条件だと,誤りの限界(n=10)のほうがトークンの限界(n=13)より先に来ます.
つまり「トークン上限のせいだ」だけでは説明しきれない.ここは反論側が言いすぎている部分です.
出し方を変えると,同じモデルが解ける
「1手ずつ列挙させる」のではなく「手順を生成する関数を書かせる」に切り替えてみてください. 出力量は n によらずほぼ一定になり,トークンの壁が消えます.
同じ問題,同じモデル,違うのは答えの表現方法だけです.
結論:どちらの論文も,片方しか見ていない
- Apple側の「崩壊=推論していない証拠」は,答えの長さが 2ⁿ で伸びることを評価から切り離せていません
- 反論側の「トークン上限に当たっただけ」は,誤りの蓄積を勘定に入れていません
このシミュレーションが示すのは,2つの壁が別々に存在し,条件によってどちらが先に来るかが変わるということです. そして出題形式を変えるだけで片方の壁は消える.「推論できるか」を測るつもりの実験が,実際には「長い答えを書き切れるか」を測っていた可能性があります.
ファクトと出典
元になった2つの論文
- Apple「The Illusion of Thinking」 Apple Machine Learning Research(一次情報)
- 反論論文「The Illusion of the Illusion of Thinking」 arXiv:2506.09250.Open PhilanthropyのAlex Lawsen氏がClaude Opus 4と共同で執筆
- 論争の整理:Simon Willison「Seven replies to the viral Apple reasoning paper」 / VentureBeat / Sean Goedecke
このモデルが置いた仮定(ファクトではありません)
- 1手を自然文で書いたときのトークン数:10トークン
- 「手順を生成する関数を書け」の出力量:300トークン
- 完答確率は「1手あたりの誤り率 e」から (1−e)^(2ⁿ−1) で計算
いずれも見積もりであって,特定のモデルの実測値ではありません. ただし上に書いたとおり,見積もりを2〜3倍ずらしても限界の n はほとんど動きません.