Clicked Gallery
「トークン化」とは?
実際の技術ドキュメントでハイライトされた言葉を、Clickedが解説します。
例文
Engineering Notes · AI Systems
During preprocessing, tokenization splits the raw text into subword units the model actually reads.
読者がドキュメント内の単語をハイライトすると、Clickedが技術用語「tokenization」をシンプルに解説しました:
3段階での解説
●○○
Overview
トークン化は、AIモデルがテキストを読む前に細かく刻む処理だ。刻まれた断片はトークンと呼ばれ、たいてい単語まるごとではなく単語の一部になる。モデルはトークン単位で見て、数えて、課金する。
●●○
Detail
トークナイザは5万〜20万項目ほどの固定語彙を持ち、訓練テキストで頻出する文字の組み合わせから作られる。よく使う語は1トークンのまま残り、珍しい語は分割される。英語では平均して1トークンが単語の約4分の3だが、同じ文でも日本語やヒンディー語では2〜3倍のトークンを消費することがある。語彙が主に英語のテキストから作られたためだ。APIは100万トークン単位で課金されるので、同じ質問が言語によって文字どおり割高になる。有名な失敗もこれで説明がつく。「strawberry」の文字数を数えられないモデルは、文字を見ておらず、2〜3個の塊を見ている。数字も変な場所で切られるため、計算でつまずく一因になっている。
●●●
Analogy
レゴで作る城。ひとかたまりで成形されるのではなく、決まったカタログの標準ブロックから組み上げられ、作り手はブロック単位でしか考えない。ブロック内部のプラスチックの模様を尋ねてもぽかんとされるのは、彼らにとってブロックが存在する最小単位だからだ。
AIによる解説には誤りが含まれる場合があります · 専門的な助言ではありません
事実はそのまま、ノリだけ変えて — スラングモード 😎
●○○
Overview
トークン化とは、AIが読む前に君の文章を一口サイズの塊(トークン)に刻むこと。文字でも単語でもない中間サイズ——そしてモデルが持つ唯一のアルファベットだ😎
●●○
Detail
トークナイザは訓練データから学んだ5万〜20万個の固定メニューを持ち、君が送る文は毎回そのメニューから組み立て直される。日常語は1トークンで通るが、変わった語は「不-幸-せ」方式で刻まれる。英語は平均で1トークンが単語の4分の3ほど、同じ質問でも日本語なら2〜3倍燃えることがあり、課金は100万トークン単位なので、一部の言語は文字どおり言語税を払っている。「strawberry」事件もこれが原因。モデルはr-r-rを一度も見ておらず、文字の入っていない塊を2、3個見ているだけだ。数学も同じで、数字がランダムな位置で輪切りにされ、そして皆が足し算できないことに驚く😎
●●●
Analogy
絵文字だけのやりとり。標準セットでかなりのことは言えるが、セットにあるものしか言えない。君の「妙な火曜日」専用の絵文字はないから、なんとなく指す3つで近似するしかなく、どうしても言えないことが残る。
AIによる解説には誤りが含まれる場合があります · 専門的な助言ではありません
正式な定義 — 同じ用語の、よくある説明
トークン化は、入力テキストを固定語彙から引いた離散単位に分割する処理であり、語彙は通常、頻出文字列を統合するバイトペア符号化などのサブワードアルゴリズムで構築される。トークン数は系列長、コンテキスト消費、従量課金を決定し、その粒度は言語や文字体系によって大きく異なる。
「tokenization」のような言葉を、ブラウザ上でそのままClickedに解説させませんか?PDFにも対応。
Chromeに追加 — 無料無料で50回の解説 · クレジットカード不要
ギャラリーの他の記事
研究論文の「ちゃんとした」読み方
賢く流し読み、専門用語の壁を突破、学んだことは手元に — 1セッションを正しいやり方で。
「コンテキストウィンドウ」とは?
AIが一度に頭に置けるテキスト量——長いチャットが冒頭を忘れる理由。
「ベクトル埋め込み(エンベディング)」とは?
意味を座標に変える — 単語が一致しなくても機械が「似たもの」を見つける仕組み。
「誤差逆伝播法(バックプロパゲーション)」とは?
ひとつの最終誤差が、何百万の設定への正確な調整に変わる仕組み — ゴールシークの超巨大版。
「RAG(検索拡張生成)」とは?
AIを自分の文書から答えさせる — まず検索、次に生成、出典つき。
「冪等(べきとう)なAPI」とは?
10回クリックしても請求は1回 — 再試行を安全にする性質。