Clicked Gallery
「Mixture of Experts(専門家混合)」とは?
実際の技術ドキュメントでハイライトされた言葉を、Clickedが解説します。
例文
Engineering Notes · AI Systems
The lab's flagship is a mixture of experts, waking only a fraction of itself for each query.
読者がドキュメント内の単語をハイライトすると、Clickedが技術用語「mixture of experts」をわかりやすく解説しました:
3段階での解説
●○○
Overview
Mixture of Expertsとは、小さな専門セクションを多数集めた形で作られたモデルで、どの質問に対しても数個だけが起動します。全体としては巨大でありながら、答えるたびにはるかに小さいモデル並みの仕事量で済みます。最大級のモデルのいくつかが手ごろな運用費に収まっているのはこの仕組みのおかげです。
●●○
Detail
Mixture of Expertsの狙いは、全体のサイズと1回の答えにかかる仕事量を切り離すことにあります。普通のモデルではどの質問もネットワーク全体を起こすので、モデルを倍にすれば1回ごとの仕事量も倍になります。Mixture of Expertsは代わりに独立したセクション、つまり専門家として作られ、その前に置かれた小さなルーターが入力の各部分についてどの数個に相談するかを選びます。プログラミングの質問をすれば64個のうち2個を起こすといった動きになり、答えはモデル全体ではなくその薄い一切れが計算します。ただし各セクションは呼ばれるのを待ってメモリに載り続ける必要があるため、節約できるのは1回あたりの仕事量であって、モデルを使える状態に保つ費用ではありません。学習にも追加の配慮が要り、ルーターが同じお気に入りばかり選ぶとモデルの大部分がほとんど訓練されないまま残るからです。この見返りこそ、最先端のモデルでこの設計が繰り返し現れる理由で、1回の答えの仕事量を増やさないまま容量だけを伸ばせるのです。
●●●
Analogy
200本の工具が入った整備士の道具箱。どの修理でも必要なのは4本か5本で、彼はまっすぐそれに手を伸ばし残りは引き出しに眠ったままなので、作業自体は道具箱が小さい場合と変わりません。それでも彼が200本すべてを買い、どの現場にも箱ごと担いでいくのは、何が入ってきても対応できることこそ一式を持つ意味だからです。1回の修理は軽い仕事、その守備範囲を保つ費用は常に発生する、という形になります。
AIによる解説には誤りが含まれる場合があります · 専門的な助言ではありません
事実はそのまま、ノリだけ変えて — スラングモード 😎
●○○
Overview
Mixture of Expertsは、専門セクションをたくさん束ねた形で作られたモデルで、1つの質問につき数個だけが起動する。全体サイズは巨大でも、答えを担当するのは薄い一切れだけ。デカいモデルなのに、1回の答えにかかる仕事量は軽いままだ。😎
●●○
Detail
普通はどの質問もモデル全体を点灯させるので、モデルが大きいほど1回ごとの仕事量も増える。Mixture of Expertsはその結びつきを断ち切る仕掛けで、独立したセクションとして本体を作り、前にルーターを置いて、今の質問に本当に相談する価値のある2つか3つを選ばせる。64人の専門家が給与名簿に載っていて、あなたの質問に出勤するのは2人、残りの62人は待機だ。難点その一、全員が建物にはいなければならないので、仕事量は減ってもメモリの請求書は容赦ない。難点その二、ルーターは怠けてお気に入りばかり呼ぶので、モデルの半分がろくに訓練されないまま残り、訓練側が仕事を意図的にばらけさせにいく。それでも割に合うから最先端はこれを出し続ける、容量は上がり、1回の答えの仕事量は上がらないからだ。😎
●●●
Analogy
ビル全体を1台のエアコンで冷やすのと、フロアごとに別々の機械を置くのとの違い。1台方式だと誰もいない2階まで一緒に冷やすことになり、請求書もその通りの額になる。フロアごとなら人がいる階だけ冷やせるので、運転コストはがくんと落ちる。それでも各フロアに1台ずつ買う必要はあり、上の階で誰かが働く日には動ける状態でなければならないからだ。
AIによる解説には誤りが含まれる場合があります · 専門的な助言ではありません
正式な定義 — 同じ用語の、よくある説明
Mixture of Expertsモデルは、パラメータを複数のエキスパート部分ネットワークに分割し、学習されたルーティング関数が入力トークンごとに小さな部分集合を活性化する構成をとる。これにより総パラメータ数と推論ごとの計算量が分離され、高容量のモデルを低い推論コストで運用できる一方、メモリ常駐の要件は全体分が残り、エキスパート間の負荷不均衡といった学習上の課題が生じる。
「mixture of experts」のような言葉を、ブラウザ上でそのままClickedに解説させませんか?PDFにも対応。
Chromeに追加 — 無料無料で50回の解説 · クレジットカード不要
ギャラリーの他の記事
「トランスフォーマー(Transformer)」とは?
GPTの「T」の設計。各単語が他のすべての単語に、同時に注意を向ける。
「推論(インファレンス)」とは?
モデルが実際の仕事をしている状態。安いほうの半分が最も高くつく理由も。
「量子化」とは?
モデルの数値を粗く保存する——メモリ半分、損失ほぼなし。
「モデル蒸留」とは?
別のモデルの回答で自分のモデルを訓練する。縮めるためか、ライバルに追いつくために。
「ニューラルネットワーク」とは?
ルールを書いてもらう代わりに、例からルールを学ぶ数学。それが勝つ理由も。
「コンテキストウィンドウ」とは?
AIが一度に頭に置けるテキスト量——長いチャットが冒頭を忘れる理由。