ホーム / 図書館 / 第2章 / A-02-1

棚A ことばをそろえる ── 第2章の深掘り 2026-07-25 読了 約4分

トークンと文脈の窓
長い資料は、なぜ抜けるのか

この記事について

「PDFをまるごと貼ったのに、後半を読んでいないようです」というご相談を、よくいただきます。AIが一度に扱える量には上限があり、しかもその数え方は文字数ではありません。ここを知ると、資料の渡し方が変わります。

第2章「生成AIとLLM」を深く読む 全3本A-02-1 / 全3本
  1. 入口生成AIとLLM ── 次にくる言葉を予測している
  2. A-02-1トークンと文脈の窓 ── 長い資料はなぜ抜けるのか
  3. A-02-2同じ質問なのに答えが変わる ── 揺れを止める場所
  4. A-02-3もっともらしい嘘を減らす順番

01文字数ではなく、トークンで数える

AIは文章を、文字のまま受け取っているわけではありません。まず「トークン」という単位に割ります。よく出てくる言葉はまとめて一つ、珍しい言葉は数個に割れる。この単位で数えているので、上限は「何文字まで」ではなく「何トークンまで」で決まります。

そして日本語は、英語より多くのトークンを使います。同じ内容でも消費が二倍近くになることがあります。「英語の資料は入ったのに、日本語の資料だと入らない」という差は、ここから来ています。

トークンとは

言葉を、AIが扱いやすい大きさに割った単位です。文字とも単語とも一致しません。

短い言葉 ── まとめて一つに収まることが多い。
珍しい言葉・固有名詞 ── 数個に割れる。社名や型番は、かさみやすいところです。

割り方と仕組みの解説は Google のクラッシュコースが簡潔です。Google for Developers「LLM: 大規模言語モデルとは何でしょうか」↗

02窓は、指示と資料と答えで分け合う

一度に扱える量のことを「文脈の窓」と呼びます。この窓に入るのは、渡した資料だけではありません。指示文、それまでのやりとり、そしてこれから書く答え。すべてが同じ窓を分け合います。

ですから、資料を詰め込むほど、答えに使える余地が減ります。「途中で文章が切れてしまう」という症状は、たいていこれです。

ひとつの窓を分け合う四つ

指示 ── 何をしてほしいか。短いのに、効き方は大きい。
資料 ── 読ませたいもの。ここが一番かさばります。
やりとり ── 前の質問と答え。会話が長いほど積み上がります。
答え ── これから書く分。最後に押し出されるのは、ここです。

03窓に入れば読める、とは限りません

上限に収まっていても、渡したものが均等に効くわけではありません。多くの場合、先頭と末尾は強く効き、真ん中は薄くなります。

たとえば、五十ページの手引きを貼って、二十五ページ目に「離島は別料金です」と一行だけ書いてあるとします。この一行は、しばしば効きません。前後がどれだけ整っていても、真ん中の一行は埋もれます。

「全部入れたのに、真ん中に書いた条件を無視された」という出来事は、これで説明がつきます。手当ては単純です。外せない条件は、資料の後ろにもう一度書く。それだけで通り方が変わります。

04窓の大きなモデルにすれば、済む話でしょうか

ここ数年で、扱える量はずいぶん増えました。ですから「窓の大きなものを選べば解決する」と考えたくなります。半分は当たっていて、半分は外れています。

入る量は増えます。けれど、真ん中が薄くなる性質は消えません。そして扱う量が増えるほど、返ってくるまでの時間も、請求も増えます。窓を広げることは、資料を選ばなくてよくなることとは違います。

当社は、窓の大きさを「余裕」として使い、詰め込む枠としては使わない方針にしています。入るかどうかではなく、渡す必要があるかどうかで決めるほうが、結果が安定します。

05費用も、トークンで決まります

請求は、扱ったトークンの量で決まります。長い資料を毎回貼れば、毎回その分を払います。同じ資料を十回貼れば、十回分です。「精度は足りているのに、思ったより高い」という場合、原因は貼り方にあることが多いです。

読ませた分と書かせた分で単価が違うのも、押さえておくと役に立ちます。多くの場合、書かせるほうが高くつきます。ですから長く読ませて短く書かせる使い方は、意外に安く収まります。金額の決まり方そのものは第9章 費用に分けて書きました。

06実務では、この順で渡します

渡し方の順番

1. 必要な所だけ渡す ── 全文ではなく、関係する数か所。
2. 長い作業は分ける ── 途中で要約を残し、次に引き継がせる。
3. 返す形を決める ── 項目と順番を指定すると、答えが短く済みます。

効くのは一つめです。答える前に社内の資料を調べさせるRAGは、精度を上げる仕組みだと説明されることが多いのですが、窓を節約する仕組みでもあります。

二つめは、長い議事録の要約や、何十件かの一括処理で効きます。一度に流すのではなく、区切って、区切りごとに要点を残す。人が長い会議をまとめるときと同じやり方です。

07当社の場合

当社が自社で動かしている記憶は 11,239件 あります。窓に全部は入りません。ですから毎回、質問に近いものだけを選んで渡しています。数え方は「AIの中身」に開いています。

制限があること自体は、困ったことではありません。全部を渡さない前提で組めば、費用も速度も落ち着きます。

08まとめ

次の記事は、同じ質問を二度したときの話です。答えが変わるのは、故障なのでしょうか。

第2章の枝 ── いま読んでいる位置
第2章 生成AIとLLM A-02-1 トークンと文脈の窓(いまここ) A-02-2 同じ質問なのに、答えが変わる A-02-3 嘘を減らす順番

章と記事の全体は図書館の見取り図で一枚にまとめています。

窓に入りきらない量をどう扱うかは、当社自身の課題でもあります。記憶 11,239件 から必要な数件だけを選んで渡す形にしています。実測値は「AIの中身」に開いています。

← 図書館へ戻る

/NEXT

同じ質問なのに、
答えが変わる。

二度同じことを聞くと、違う答えが返ってくる。故障ではありません。揺れる仕組みと、業務で困らないための止め方を次に。

A-02-2 を読む