Clicked Gallery
「推論(インファレンス)」とは?
実際の技術ドキュメントでハイライトされた言葉を、Clickedが解説します。
例文
Engineering Notes · AI Systems
The chipmaker's newest processors target inference rather than training, where the volume is.
読者がドキュメント内の単語をハイライトすると、Clickedが技術用語「inference」をシンプルに解説しました:
3段階での解説
●○○
Overview
推論とは、AIモデルが実際の仕事をしている状態、つまり質問が入り、学習済みの知識を使って答えが出てくることです。学習は一度きりの建設で、推論はその後の毎回の利用にあたります。安いほうの半分に見えますし1回あたりは実際そうですが、1日に何十億回も走ります。
●●○
Detail
推論とは質問と答えのあいだで起きるすべてであり、学習とはまったく別の作業です。学習は一度だけ行われ、モデル内部のダイヤルを設定するために何週間も膨大な計算能力を燃やします。推論は設定済みのそのダイヤルを新しい入力に対して走らせるだけで、数値が流れて答えが出てくる一方、モデルの中身は何も変わりません。だから1回の返答は1セントの何分の一で済み、同じモデルの学習には何百万ドルもかかったのです。落とし穴は量で、人気のアシスタントは何十億もの質問に答えるため、1セントの何分の一に何十億を掛けたものが結局は電気代として届きます。この計算こそ、業界が量子化や蒸留でモデルを縮めることに必死な理由であり、チップメーカーが学習用ではなく推論用のプロセッサを設計するようになった理由でもあります。
●●●
Analogy
試験勉強と、試験そのものを受けることの違い。勉強は消耗するし高くつき、一度で終わりますが、試験のほうはすでに知っていることを使う2時間で、新しい学習は一切起きません。学生一人が試験を1回受けるだけなら、勉強に比べれば取るに足らない負担です。しかし同じ試験を毎日5万人に受けさせるなら、予算を壊すのは勉強ではなく試験会場のほうになります。
AIによる解説には誤りが含まれる場合があります · 専門的な助言ではありません
事実はそのまま、ノリだけ変えて — スラングモード 😎
●○○
Overview
推論はモデルが本当の仕事をしている状態で、質問が入り、学習が設定済みのダイヤルを使って答えが出る。学習は一度きりの巨大な建設で、推論はその後の一回一回の利用だ。1回の答えは小銭でも、何十億回と掛ければそこに金が消えていく。😎
●●○
Detail
学習は一度だけ登る山で、推論はその後に踏むすべての一歩だ。質問が入り、調整済みのモデルを数値が駆け抜け、答えが出て、中身は何も変わらない、だから1回の返答は1セントの何分の一で済む。掛け算を始めるまでは無害で、人気アシスタントは何十億もの質問をさばくから、1セントの何分の一×何十億は本物のチップが並んだ本物の電気代になる。だから業界全体が推論に汗をかき、量子化や蒸留でモデルを縮め、チップメーカーは学習用ではなく推論用のシリコンを出荷している。1回あたりを削れば、その削減がそのまま何十億回分に効いてくるからだ。学習は見出しを作り、推論は請求書を作るのだ。😎
●●●
Analogy
運転を習うことと、通勤で運転することの違い。教習も試験も、恐ろしかった初めての縦列駐車も、高くて疲れて、そして終わった話だ。通勤のほうはすでに身についたものを使い、ガソリンを少し燃やすだけ。その通勤を10年間、日に2回続ければ、ガソリン代は静かに教習代を追い越していく。
AIによる解説には誤りが含まれる場合があります · 専門的な助言ではありません
正式な定義 — 同じ用語の、よくある説明
推論とは、学習済みモデルを新規入力に対して実行し出力を得る処理を指し、モデルのパラメータを決定する学習とは区別される。推論はパラメータを更新しないが要求ごとに反復されるため、その総計算量・遅延・消費電力が実運用システムの支配的な運用コストとなり、量子化、蒸留、推論特化ハードウェアといった最適化の動機となる。
「inference」のような言葉を、ブラウザ上でそのままClickedに解説させませんか?PDFにも対応。
Chromeに追加 — 無料無料で50回の解説 · クレジットカード不要
ギャラリーの他の記事
「量子化」とは?
モデルの数値を粗く保存する——メモリ半分、損失ほぼなし。
「モデル蒸留」とは?
別のモデルの回答で自分のモデルを訓練する。縮めるためか、ライバルに追いつくために。
「Mixture of Experts(専門家混合)」とは?
巨大なモデルでも1問につき起きるのは薄い一切れだけ。最先端が手ごろに保たれる理由。
「コンテキストウィンドウ」とは?
AIが一度に頭に置けるテキスト量——長いチャットが冒頭を忘れる理由。
「トランスフォーマー(Transformer)」とは?
GPTの「T」の設計。各単語が他のすべての単語に、同時に注意を向ける。
「ニューラルネットワーク」とは?
ルールを書いてもらう代わりに、例からルールを学ぶ数学。それが勝つ理由も。