チャンクとは?意味・仕組み・使い方を初心者向けにわかりやすく解説

チャンクとは、長い文章やデータを扱いやすい大きさに分けた、一つひとつのまとまりのことです。生成AIの分野では、特にRAGや文書検索の仕組みを説明するときによく使われます。

たとえば、100ページある社内マニュアルを丸ごと一つのデータとして扱うのではなく、「経費精算」「休暇申請」「情報セキュリティ」などの小さなまとまりへ分けるイメージです。それぞれのまとまりがチャンクになります。

長い文書をチャンクへ分割する処理は、「チャンク分割」や「チャンキング(chunking)」と呼ばれます。

ただし、細かく分ければ分けるほど良いわけではありません。チャンクが小さすぎると前後の文脈が失われ、大きすぎると不要な情報まで含みやすくなります。

そこで、この記事では生成AIにおけるチャンクの意味から仕組み、トークンとの違い、分け方、RAGでの使い方まで初心者向けに解説します。

目次

チャンクとは?

このように、生成AIやRAGで使われるチャンクとは、文書などを検索・処理しやすい単位へ分割したデータのまとまりです。

なお、英語の「chunk」には「かたまり」「まとまり」といった意味があります。

生成AI・RAGにおけるチャンクの意味

また、生成AIに関連してチャンクという言葉が登場する代表的な場面がRAGです。

具体的には、RAGでは外部の文書やデータから質問に関連する情報を探し、その内容を生成AIへ渡して回答を作ります。

そのため、長い文書を丸ごと検索対象にせず、複数の小さなチャンクへ分割しておく方法があります。

たとえば、次のようなマニュアルがあるとします。

  • 第1章:アカウントの作成方法
  • 第2章:パスワードの変更方法
  • 第3章:退会方法

利用者が「パスワードを変更するには?」と質問した場合、文書全体ではなく第2章に相当するチャンクを見つけられれば、必要な情報を絞って生成AIへ渡しやすくなります。

チャンクで長い文章を扱いやすい単位に分割するイメージ

チャンクとトークンの違い

チャンクと混同しやすい言葉が「トークン」です。

両者は同じものではありません。

用語意味イメージ
チャンク文書などを分割した情報のまとまり数行、数段落、1セクションなど
トークンAIが文章を処理するときの基本単位文字や単語の一部などに分割された単位

つまり、一つのチャンクの中に複数のトークンが含まれると考えると分かりやすいでしょう。

チャンクの大きさを「○トークン」と指定するシステムもあります。そのため両方の言葉が同じ設定画面に登場することがありますが、役割は異なります。

トークン自体については、トークンとは?意味・仕組み・使い方で詳しく解説しています。

なぜ文書をチャンクに分けるの?

つまり、チャンクへ分割する主な目的は、長い文書の中から必要な情報を見つけやすくすることです。

その結果、文書全体では範囲が広すぎる場合でも、小さな単位へ分ければ関連部分を個別に検索できます。

必要な部分を検索しやすくする

たとえば、就業規則全体を一つのデータとして登録するより、

  • 勤務時間
  • 有給休暇
  • 出張
  • 経費精算
  • 休職

といったまとまりへ適切に分けたほうが、質問に関連する部分を探しやすくなる場合があります。

「出張時の宿泊費について知りたい」という質問なら、出張規程に関連するチャンクを検索するイメージです。

AIへ不要な情報を渡しすぎない

生成AIが一度に扱える情報量には上限があります。

また、検索対象の文書が非常に長い場合、質問に不要な情報まで生成AIへ渡すより、関連性の高い部分を絞って渡す設計が適している場合があります。

このように、チャンク化は長い文書を細かく検索できる状態にするための前処理の一つです。

チャンクはどのような仕組みで使われる?

また、RAGを例にすると、チャンクは「文書の準備」と「質問への回答」の間をつなぐ役割を持ちます。

基本的な流れを4段階で見てみましょう。

1. 文書を準備する

最初に、生成AIから参照したい資料を用意します。

たとえば、

  • 社内規程
  • 業務マニュアル
  • FAQ
  • 商品説明書
  • 技術資料

などです。

2. 文書をチャンクへ分割する

次に、文書を複数のまとまりへ分割します。

なお、文章量を基準に機械的に分ける方法もあれば、段落や見出しなどの構造を考慮する方法もあります。

ここで作られた一つひとつのデータがチャンクです。

3. チャンクを検索できる状態にする

次に、チャンクを作ったら、質問に関連する情報を検索できるようにします。

たとえば、RAGでは文章を数値として表現する埋め込みを作り、意味の近い情報を検索する方法があります。

このように、チャンクそのものと、その意味を表したベクトルを組み合わせて利用します。

4. 関連するチャンクを生成AIへ渡す

その後、利用者から質問を受けると、システムは関連性の高いチャンクを検索します。

そして、見つけた情報を質問と一緒にLLMへ渡し、その内容を参考に回答を生成します。

RAGでチャンクを検索して生成AIへ渡す仕組み

たとえば、

「交通費の申請期限は?」

という質問に対し、経費精算マニュアルの該当するチャンクを探して生成AIへ渡す流れです。

チャンクの主な分け方

チャンクの作り方は一つではありません。

代表的な考え方を整理すると、次のようになります。

分け方特徴向いている例
一定の大きさ文字数・トークン数などで区切る形式がそろった大量の文章
文章・段落単位文や段落の境界を利用する一般的な文章
見出し・構造単位章や見出しなどを考慮するマニュアル、規程、Webページ
内容のまとまり意味や話題の切り替わりを考慮する複数テーマを含む長文

一定の文字数・トークン数で分ける

比較的シンプルなのが、一定の大きさで文書を分割する方法です。

たとえば、設定したトークン数などを上限として、長い文章を順番に区切っていきます。

実装しやすい一方、区切る位置によっては文章の途中や、関連する説明同士が別々のチャンクへ分かれる可能性があります。

文章や段落の区切りで分ける

句点や改行、段落などを利用する方法もあります。

文章のまとまりをある程度維持できるため、単純に文字数だけで切る場合より自然な単位を作りやすくなります。

ただし、短い段落が大量に続く文書などでは、別の方法との組み合わせが必要になる場合があります。

見出しや文書構造に沿って分ける

マニュアルやWebページのように構造が明確な文書なら、タイトルや見出しを利用して分割する方法があります。

たとえば、

「第3章 パスワード管理」

という見出しと、その下にある説明を一つのまとまりとして扱う方法です。

見出しなどの情報をチャンクへ残せば、「この文章は何について説明しているのか」という文脈を維持しやすくなります。

チャンクサイズとオーバーラップとは?

チャンクを理解するときに重要なのが「チャンクサイズ」と「オーバーラップ」です。

チャンクサイズは、一つのチャンクをどの程度の大きさにするかを示します。

一方、オーバーラップは、隣り合うチャンクへ一部の内容を重複して含める考え方です。

小さすぎるチャンクの注意点

チャンクを細かくしすぎると、一つのまとまりだけでは意味が分かりにくくなることがあります。

たとえば、

「この場合は申請できません。」

という一文だけがチャンクになっても、「この場合」が何を指しているのか分かりません。

前の文章と切り離されたことで重要な文脈を失っています。

大きすぎるチャンクの注意点

反対に、大きなチャンクなら必ず良いわけでもありません。

一つのチャンクへ複数のテーマが混在すると、質問と無関係な文章まで検索結果に含まれやすくなります。

そのため、必要な情報を残しつつ、無関係な情報を増やしすぎない大きさを検討する必要があります。

オーバーラップで前後の文脈を残す

文章の境界で情報が途切れる問題への対策として使われるのがオーバーラップです。

たとえば、

  • チャンクAの末尾
  • チャンクBの先頭

に同じ文章を一部含めます。

こうすると、区切り付近の情報が完全に切り離されるのを防ぎやすくなります。

ただし、重複を増やしすぎると保存・検索する情報も重複します。オーバーラップも大きければ良いわけではありません。

チャンクサイズとオーバーラップの設定例

チャンクの使い方・活用例

チャンクは、大量の情報から必要な部分を探したい場面で利用できます。

代表的なのが次のような用途です。

社内マニュアルの検索

業務マニュアルを章や手順ごとのチャンクへ分割し、社員からの質問に関連する部分を検索する方法です。

「アカウントを再発行するには?」

と質問された場合、該当する操作手順を含むチャンクを探せます。

社内規程の検索

就業規則や経費規程などを適切な単位へ分割し、RAGの検索対象として利用する方法があります。

ただし、規程は前後の条文や例外条件が重要になる場合があります。細かく分けすぎて条件部分を切り離さない設計が必要です。

FAQ・問い合わせ対応

大量のFAQを質問・回答のまとまりとして管理し、問い合わせに関連する情報を検索する使い方もあります。

商品名やカテゴリなどの情報をチャンクと一緒に管理すれば、検索対象を絞る設計も可能です。

長いPDFや技術資料の検索

ページ数の多いPDFや技術資料では、必要な情報を人が毎回探すだけでも時間がかかります。

文書を検索に適したチャンクへ分割しておけば、質問に関連する部分を探して生成AIへ渡す仕組みを構築できます。

チャンクを設計するときの注意点

チャンクには、すべての文書に共通する「唯一の正しいサイズ」があるわけではありません。

重要なのは、実際に検索したい情報のまとまりを考えることです。

特に次の点を確認しましょう。

  • 一つのチャンクだけを読んでも意味が理解できるか
  • 見出しと本文が分離していないか
  • 条件と例外が別々になっていないか
  • 表の途中で不自然に分割されていないか
  • チャンクが大きすぎて複数の話題が混在していないか
  • オーバーラップが多すぎないか
  • 実際の質問で必要な情報を検索できるか

サービスの初期設定をそのまま使うだけでなく、想定する質問を使って検索結果を確認することも重要です。

チャンクと一緒に覚えたい関連用語

チャンクを理解するなら、次の用語も押さえておくと生成AIの仕組みを理解しやすくなります。

RAG

RAGは、外部の文書やデータから関連情報を検索し、その内容を参考に生成AIが回答する仕組みです。

チャンクは、その検索対象となる情報を適切な大きさへ分けるために使われます。

トークン

トークンは、LLMが文章を処理するときの基本単位です。

チャンクとトークンは同じものではありませんが、チャンクサイズをトークン数で指定する場合があります。

埋め込み(Embedding)

埋め込み(Embedding)は、文章などの意味や特徴を数値の並びへ変換した表現です。

RAGでは、チャンクごとに埋め込みを作り、質問と意味の近い情報を探す方法があります。

ベクトル

ベクトルは、意味や特徴を表す数値の並びです。

埋め込みによって作られたベクトル同士を比較することで、意味が近い文章を探せます。

ナレッジベース

ナレッジベースは、組織や用途ごとの知識を蓄積し、検索・活用できるようにした情報基盤です。

RAGではナレッジベースに保存された文書をチャンクへ分割し、検索対象として利用することがあります。

よくある質問|チャンク

チャンクとは簡単にいうと何ですか?

長い文章やデータを、検索や処理をしやすい大きさへ分けた「情報のまとまり」です。

生成AIでは、特にRAGで長い文書を小さな検索単位へ分割するときに使われます。

チャンクとチャンキングの違いは何ですか?

チャンクは「分割された一つひとつのまとまり」です。

チャンキングは「文書をチャンクへ分ける処理」を指します。

チャンクとトークンは同じですか?

同じではありません。

トークンはAIが文章を処理する基本単位です。一方、チャンクは文書を検索・処理しやすいまとまりへ分けたものです。

一つのチャンクには、通常、複数のトークンが含まれます。

チャンクは何文字にすればよいですか?

すべての用途に共通する最適な文字数はありません。

文章の種類、検索方法、使用する埋め込みモデル、質問内容などによって適したサイズは変わります。

数字だけで決めるのではなく、「一つの情報のまとまりとして意味が通じるか」を確認することが大切です。

チャンクは小さいほど検索精度が上がりますか?

必ずしもそうではありません。

細かくしすぎると必要な前後関係が失われます。一方、大きすぎると質問に無関係な情報まで含みやすくなります。

そのため、実際の検索結果を確認しながら調整します。

オーバーラップとは何ですか?

隣り合うチャンクに、一部の文章を重複させる方法です。

チャンクの境界で重要な文章や文脈が途切れることを防ぐために利用されます。

まとめ

チャンクとは、長い文章やデータを扱いやすい大きさへ分割した情報のまとまりです。

初心者がまず覚えておきたいポイントは次のとおりです。

  • チャンクは文書を分割した一つひとつのまとまり
  • 文書を分割する処理をチャンキングという
  • RAGでは関連情報を検索する単位として利用される
  • チャンクとトークンは同じものではない
  • 文字数やトークン数だけでなく、段落や見出しを基準に分ける方法もある
  • チャンクが小さすぎると文脈を失うことがある
  • 大きすぎると不要な情報まで含みやすい
  • オーバーラップを使って前後の文脈を残す方法もある
  • すべての用途に共通する最適なチャンクサイズはない

「長い資料を、小さな検索カードへ分けておく」と考えると、チャンクの役割をイメージしやすいでしょう。

RAG、埋め込み、ベクトル検索などを学ぶ際にも頻繁に登場するため、生成AIのデータ活用を理解するうえで押さえておきたい用語です。

関連用語

出典・参考情報

この記事を書いた人

田中和馬のアバター 田中和馬 株式会社エヌ・ケーパートナーズ/AIスクールガイド|AWL編集長

株式会社エヌ・ケーパートナーズが運営する「AIスクールガイド|AWL」編集長。10年以上にわたり、SEOメディアの立ち上げ・構築・運用に携わってきました。

2024年頃から生成AIを独学で学び始め、その後、生成AIスクールでも体系的に学習。現在はChatGPT、Gemini、Claudeなどを活用し、ディープリサーチによる情報収集、マーケティング企画、記事構成・文書作成、メール作成、業務自動化などに日常的に取り組んでいます。

また、生成AIをWebサイトの企画・制作、コーディング、デザインにも活用。エンジニアやデザイナーの業務領域を理解しながら、自らディレクションを行い、メディアの設計から制作・運用まで一貫して担当しています。生成AIスクール・講座の調査、比較基準の設計、記事編集・品質管理も担当しています。

目次