The Useful Question
日本語 (JP)

AIの「考える時間」では何が増える? 候補を出す・探索する・確かめる

AIの「考える時間」では、答えの候補や途中の手順を増やし、評価や修正に計算を使えます。 条件を組み合わせる問題なら推論、最新の事実が足りないなら検索、答えの正しさを確かめたいなら検証を足します。 長く待つことや長い回答を読むことだけでは、その三つのどれが行われたかは分かりません。

先に、足りないものを三つに分ける

たとえば、三人が参加できる打ち合わせの時間を決める場面です。同じ「予定を考えて」という依頼でも、困りごとで次の一手が変わります。

これは架空の例ですが、「もっと考えて」の前に何を渡すべきかを整理できます。一つの依頼で、情報を集め、案を作り、確認する三段階が必要なこともあります。

学習に使う計算と、一問に使う計算

学習時の計算は、データや評価からモデルのパラメーターを調整するために使われます。一方、推論時の計算は、学習済みモデルを使って、その場の入力に答えるためのものです。研究でいう「test-time compute」も、ここでは後者を指します。

OpenAIが2024年に公開したo1の研究紹介では、強化学習を増やすことと、回答時の推論を増やすことを分けて説明しています。これは当時の研究の例であり、現在選べる製品や料金の案内ではありません。

一問について何度か考え直すことは、その都度モデル全体を学習し直すこととは別です。会話の中で新しい条件を与えれば、その条件を使って案を直せます。ただし、その内容が以後すべての利用者への回答に学習された、という意味にはなりません。

増やし方は、長い一本道だけではない

まず、複数の候補を作る方法があります。Self-Consistencyの研究は、異なる推論経路を生成し、最終的な答えの一致を利用する方法を示しました。一回の生成が外した道を、別の候補が見つける可能性があります。

打ち合わせの例なら、午前から詰める案と、移動の少ない時間から選ぶ案を用意するイメージです。ただし、同じ抜けた予定表を使う限り、複数案が同じ見落としをすることもあります。多数決は、外部事実を確認した証拠にはなりません。

次に、途中で枝分かれさせて探索する方法があります。Tree of Thoughtsの研究では、中間の候補を評価し、先を調べたり、前の分岐へ戻ったりします。全部の完成案を作ってから比べる方法とは、計算の置き場所が違います。

さらに、一度出した案を直す方法もあります。Self-Refineの研究では、同じモデルが初稿へのフィードバックを作り、それを使って修正を繰り返します。「準備時間がない」という指摘を次の案へ反映するような流れです。指摘自体が適切かどうかは、別に確かめる必要があります。

学習済みモデルから、一回答、複数候補と選択、途中の探索、初稿と修正へ分かれる四つの模式的な経路。外部資料による確認は別の確認として示している。
本稿のために制作したオリジナル説明図
図を拡大して読む

図の中を横にスクロールできます(キーボードの左右キーにも対応)

学習済みモデルから、一回答、複数候補と選択、途中の探索、初稿と修正へ分かれる四つの模式的な経路。外部資料による確認は別の確認として示している。
図を原寸で開く

図は公開研究の方法を整理したオリジナルの模式図です。四つを必ず同時に使うという意味ではなく、特定製品の内部処理や実測した生成履歴も表していません。

「確かめる」にも二つの意味がある

候補を評価するモデルは、一般に検証器、verifierなどと呼ばれます。Let's Verify Step by Stepの研究は、数学問題で最終結果だけでなく途中の手順に評価を与える方法を調べました。怪しい段階を見つける仕組みは、候補選びにも使えます。

ここで注意したいのは、学習した評価器の高得点と、独立した確認の違いです。予定案を別のAIが「よさそう」と評しても、当人のカレンダーを読んだことにはなりません。評価器も誤る可能性があります。

読者がほしいのが確かな結果なら、元資料との照合、明示した条件の一覧、実行できるテストなど、何を使って確認したかまで見るのが近道です。説明が詳しいことより、答えが満たすべき条件を実際に満たしているかが重要になります。

計算の予算は、使い方でも差がつく

2024年の推論時計算の研究は、候補の探索や回答の修正を調べ、効率のよい配分が問題の難しさで変わると報告しました。後にICLR 2025で発表された研究です。

主な実験対象は数学の問題です。難しさを見積もるための計算も実運用では負担になり、論文はその費用を実験の比較に含めていないと説明しています。したがって、結果を「あらゆる質問は長く考えれば解ける」と読み替えることはできません。

待ち時間には通信や混雑も混ざります。また、画面に出る回答の長さから、裏で何候補を作ったか、どんな評価をしたかは読み取れません。「短い答えだから浅い」「長く待ったから正しい」と判定するより、必要な条件と根拠を見た方が役立ちます。

次の依頼では、増やしたい仕事を書く

「よく考えて」だけでなく、「この条件から二つの案を作り、採用しない案の弱点も短く示して」「不明な予定は推測せず、未確認として残して」「最後に各条件との対応を確認して」と頼むと、求める成果が明確になります。これは非公開の思考全文を求める必要のない、確認しやすい依頼です。

推論を増やす価値は、手持ちの材料から別の道を探せることにあります。材料が足りない日は情報を足し、答えを使う前には確かめる。その切り分けができれば、「考える時間」という表示を、万能の正解保証として扱わずに済みます。

文章の自信と事実の裏付けの違いは、関連記事のAIが間違いを自信ありげに言う理由で扱っています。

資料と確認範囲

一次資料は2026年10月11日、日本時間で確認。公開研究を使った原理解説で、実機・サービスの比較試験は未実施です。研究の訂正や新たなモデル固有の説明を加えるときに再確認します。