
▸トークン
文字数ではなく、AIが文章を読み書きするときに使う「文章の最小単位」。
▸処理するステップ
文章を入力し、トークンに分解し、数値として処理し、次のトークンを予測して出力。入力トークンが増えるとAPI利用量とコストが増える。
▸希少な人材
何を渡さなくてよいかを決められる人が、結果的に精度もコストも最適化できる。AI時代の組織で希少なのは、現場の課題を発見し、定義できる人材。
こんにちは、ワークスアイディの奥西です。
組織で生成AIを活用する企業が増えてきましたね。
最近では、それに伴い
先日、お客様との定例会で現場のリーダーの方が少し困った顔でこう質問されました。
別のお客様からは、まったく逆方向のご相談をいただきました。
原因を一緒に分解していくと、1回の処理ごとに社内ドキュメントを丸ごと読み込ませる設計になっていました。
一見まったく別々の相談に見えますが、実はどちらも同じ一つの概念に行き着きます。
それが
AIを“便利なチャットツール”として使っている段階では、トークンを意識する必要はほとんどありません。ところが、業務に組み込む、部門横断で展開する、という段階に入った瞬間、トークンは性能・コスト・設計のすべてに直結してきます。
そこで今回は、この『トークン』について一緒に考えていきましょう!
そもそも『トークン』とは何か?
トークンとは、AIが文章を読み書きするときに使う“文章の最小単位”のようなものです。
私たち人間は文章を『文字』や『単語』として認識しますが、AIは文章を一定のかたまりに分解してから処理しています。このかたまりが『トークン』です。
たとえば英語の 「I like artificial intelligence.」という文章。
AIはこれを1つの文としてそのまま扱っているのではなく、単語や単語の一部など、複数のトークンに分割して処理しています。
OpenAIは、トークンをモデルが処理するテキストの構成要素と位置づけ、言語や文脈によって1文字ほどの短さにも、単語まるごとの長さにもなり得ると説明しています。スペースや句読点、単語の断片もすべてトークン数に含まれます。
英語での大まかな目安
| 1トークン | およそ4文字 |
| 100トークン | およそ75語 |
ここで最初に押さえていただきたいのは、
AIは文章をどう処理しているのか?
もう一歩だけ、仕組みに踏み込んでみます。
AIは、入力された文章を次のようなステップで扱っています。
- 文章を入力
- トークンに分解
- 数値として処理
- 次のトークンを予測して出力
ChatGPTが文章を生成するとき、完成した答えを最初から考えているわけではありません。「ここまでの文章から考えると、次に来る可能性が高いトークンは何か?」をひたすら繰り返しているのです。
この
トークンは、AIにとって“文章を扱うための重要な部品” といえます。
ここは、お客様から最もよく質問をいただくポイントです。
先ほどお伝えした通り、英語には[約4文字=1トークン]という目安がありますが、日本語については[1トークン=◯文字]と固定的に換算することができません。
分割のされ方が次のような条件で変わるからです。
- 使用するAIモデル
- トークナイザー(分割の仕組み)
- 言語の種類
- 漢字・ひらがな・カタカナの違い
- 数字や記号、単語の並び方
Googleも、Geminiにおけるトークンは文字や単語などの単位にあたり、長い単語が複数のトークンに分かれる場合があると説明しています。
研修の場では、「生成AI」「生成AIを企業で活用する」といった短い日本語を実際にトークナイザーにかけて見てみると、少しずつ感覚が掴めていきますよ。
トークンの種類:『入力』と『出力』だけじゃない?
トークンは大きく二つに分かれます。
| 入力トークン | ユーザーがAIに渡した文章・指示・資料など |
| 出力トークン | AIが生成した回答 |
さらにモデルやサービスによっては、これ以外の区分もあります。これらはいずれも記録と課金の対象です。
| キャッシュ済みトークン | 会話履歴などで再利用されるトークン (割安な料金が適用されることが多い) |
| 推論トークン | 一部の高度なモデルが最終回答を出す前に、内部的に行う“思考ステップ”にあたるトークン (出力トークンとして課金され、コンテキストウィンドウも消費) |
お伝えしたい重要なポイントは、“AIに送った文章だけがトークンなのではない” ということです。
AIが考えた分も、参照した分も、すべて数えられています。
トークンが『コスト』『精度』に直結する2つの理由
理由(1)API利用料金(コスト)にダイレクトに響く
AIのAPIは、処理したトークン数を基準の一つとして料金が決まります。
大量の資料を毎回入力する ⇒ 入力トークンが増える ⇒ API利用量とコストが増える
加えて、入力トークンと出力トークンで単価が異なるケースがほとんどです。多くのモデルで出力トークンのほうが数倍高く設定されています。
企業でAIシステムを設計するときは、「何回AIを呼び出すか」だけでなく、
私たちが伴走支援に入る際、PoC(概念実証)の段階で必ず[1リクエストあたりのトークン数]を計測するようにしているのはこのためです。ここを見ずに本番展開すると、想定の数倍のコストになることが珍しくありません。
理由(2)コンテキストウィンドウの上限と精度低下
AIが一度に参照できるトークン量には、基盤モデルによって上限があります。これが『コンテキストウィンドウ』です。
私はよく、AIの
机が小さければ、一度に広げられる資料は限られます。机が大きければ、大量の資料や長い会話を見ながら答えることができます。
Anthropicも、コンテキストウィンドウをモデルが新しい文章を生成する際に参照できる『作業メモリ』のようなものだと説明しています。
そして、この机の上に載っているのは、自分が打ち込んだプロンプトだけではありません。
入力したプロンプト + 過去の会話 + 読み込ませた資料 + システム側の指示 + AIが生成する回答
これらすべてが、コンテキストウィンドウを共有しています。
冒頭のお客様が感じた「途中から精度が落ちる」現象は、
『100万トークン対応』の誤解
ここからは誤解を防ぐために、少し解説しておきます。
『100万トークン対応』などの最新モデルと聞くと、「100万トークン分を完全に記憶して、いつでも正確に答えてくれる」と思われがちですが、必ずしもそうではありません。
コンテキストウィンドウはあくまで、
コンテキストが大きい = 回答精度が必ず上がる、というケースばかりではありません。
だからこそ、必要な情報だけを検索して渡すRAG(検索拡張生成)のような仕組みが、いまも重要であり続けているのですね。
長い会話には『コンテキスト圧縮』という考え方
会話が非常に長くなる場合、過去の内容をそのまま保持するのではなく、
〈例〉コンテキスト圧縮の流れ
100ページの会議録
↓
重要な決定事項・人物・前提条件だけを数ページに要約
↓
以後、その要約を参照する
技術的な詳細は割愛しますが、押さえていただきたい方向性はシンプルです。
AI技術は、“情報を全部持つ”のではなく、“必要な情報を残す” 方向へ進化しています。
これって実は、組織のナレッジマネジメントと発想が似ているんですよね。
「この業務では、どの資料を、どこまで渡す必要があるのか」を判断するには、業務そのものへの深い理解が不可欠です。全部渡せばいい、というものではない。
「何を渡さなくてよいか」を決められる人が、結果的に精度もコストも最適化できるのです。
AI時代の組織で本当に希少なのは、単にAIを操作できる人材ではなく、
まとめ
今回は、AIを活用するうえで欠かせない『トークン』についてご紹介しました。
トークンは単なる技術用語ではありません。AIがどれだけの情報を読み込み、どれだけの文章を生成し、どれくらいのコストがかかるのか。さらに、どこまでの情報を一度に参照できるのか。
つまり、
AIを個人で使っているうちは、トークンを細かく意識する必要はないかもしれません。しかし、AIを業務に組み込んだり、社内システムと連携したり、多くの社員が利用する環境を構築する場合には、「どれだけ情報をAIに渡すのか」という設計が、精度とコストを大きく左右します。
トークンを理解することは、AIの仕組みを知ることだけではありません。
今後のAI進化に伴い、トークンの考え方や単位が変化していくかもしれませんので、引き続き要チェックしていきましょう!
ぜひ皆さまの会社でも、「どれだけAIに情報を渡しているか」という観点で、トークンについて議論してみてください。
それでは、本日もGOOD JOB!!
▼こちらもおすすめ

