Clicked Gallery
「マルチモーダルモデル」とは?
実際の技術ドキュメントでハイライトされた言葉を、Clickedが解説します。
例文
Engineering Notes · AI Systems
The lab's newest multimodal model reads a photograph, a spreadsheet and a spoken question in the same request.
読者がドキュメント内の単語をハイライトすると、Clickedが技術用語「multimodal model」をやさしく解説しました:
3段階での解説
●○○
Overview
マルチモーダルモデルとは、テキスト、画像、音声、動画といった複数の種類の入力を、ひとつのシステムで扱えるAIのことです。ページを撮影して、その場で内容について質問できるのはこのためです。以前のモデルはテキストしか読めなかったので、それ以外はすべて言葉で説明してやる必要がありました。
●●○
Detail
以前のモデルはテキストしか読めなかったため、それ以外のものはまず言葉に置き換える必要があり、たいていの物事はその翻訳を生き延びません。マルチモーダルモデルはその一段を取り除き、処理を始める前にあらゆる種類の入力を同じ内部形式へ変換します。一文も、一枚の写真も、数秒の音声も、すべて長い数値の列になります。数値になってしまえばモデルは同じように扱うので、画像についての質問が画像と同じリクエストに同居できるのです。おかげでレシートやエラー画面の写真がそのまま入り、このグラフの何が問題かといった、両方を必要とする問いにも答えられます。代償は容量と速度で、画像や音声は一文よりはるかに多くの数値になるからです。それがコンテキストウィンドウを食い、回答は遅く高くなります。入力を受け取れることと、うまく扱えることは別で、活字のページを確実に読むモデルでも手描きの図は読み違えることがあります。
●●●
Analogy
電話越しに誰かのパソコン修理を手伝う場面。分かることはすべて相手の説明を通ってくるので、点滅する赤いランプに触れられなければ、あなたにとってそれは存在しません。機械の隣に立てば、エラーは自分で読め、抜けたケーブルも見え、カチカチという音も聞こえます。あなたが賢くなったのではなく、ずっとそこにあった情報に手が届くようになっただけです。
AIによる解説には誤りが含まれる場合があります · 専門的な助言ではありません
事実はそのまま、ノリだけ変えて — スラングモード 😎
●○○
Overview
マルチモーダルモデルは、打ち込んだ文字だけでなく、画像も音も動画も受け取れる。だからスマホを何かに向けて、そのものについて質問できる。昔のタイプは読むことしかできず、こちらが世界をいちいち言葉に詰め直す必要があった。😎
●●○
Detail
昔のモデルには入口がひとつしかなく、その門番はあなただった。言葉にできなかったものは決して中に入れず、あなたの語彙がそのまま「そいつが知りうることの上限」になっていたわけだ。マルチモーダル勢はその壁をぶち抜いた。写真も音も動画も、考え始める前に同じ数値へ溶かし込まれるので、写真とその写真についての質問が一緒に旅をする。リスボンのメニューにスマホを向けて、ベジタリアンが安心して頼めるものはどれかと聞けば、普通に答えが返ってくる。請求書は2通届く。写真は一文よりはるかに多くの注意力を食うので、窓は早く尽きるし待ち時間も伸びる。そして見えることと正しく見えることは別物で、密度の高い文章を眉ひとつ動かさず読む同じモデルが、あなたのホワイトボードの走り書きを眺めて、そこになかった図を自信満々に説明したりする。😎
●●●
Analogy
半分うろ覚えの歌詞を3行打ち込んで曲を説明するのと、スマホに向かって鼻歌を歌うのとの違い。同じ曲、同じあなたなのに、曲名を言い当ててもらえる確率はまるで違う。片方の道は、まずあなたの語彙を通して全部を絞り出さなければ何も始まらない。もう片方は、機械に実際の音そのものを聞かせるだけだ。
AIによる解説には誤りが含まれる場合があります · 専門的な助言ではありません
正式な定義 — 同じ用語の、よくある説明
マルチモーダルモデルとは、テキスト、画像、音声、動画など複数種類の入力を受け付けるよう学習された機械学習システムであり、各入力を共有の表現空間へ射影することで単一の順伝播内での統合的処理を可能にする。これにより中間的な言語記述を経ずにモダリティ横断の推論が可能となる一方、トークン消費と遅延の増大、およびモダリティ依存の信頼性のばらつきを伴う。
「multimodal model」のような言葉を、ブラウザ上でそのままClickedに解説させませんか?PDFにも対応。
Chromeに追加 — 無料無料で50回の解説 · クレジットカード不要
ギャラリーの他の記事
「トランスフォーマー(Transformer)」とは?
GPTの「T」の設計。各単語が他のすべての単語に、同時に注意を向ける。
「トークン化」とは?
AIが読む前にテキストを刻む仕組み——言語によって割高になる理由。
「ベクトル埋め込み(エンベディング)」とは?
意味を座標に変える — 単語が一致しなくても機械が「似たもの」を見つける仕組み。
「ニューラルネットワーク」とは?
ルールを書いてもらう代わりに、例からルールを学ぶ数学。それが勝つ理由も。
「推論(インファレンス)」とは?
モデルが実際の仕事をしている状態。安いほうの半分が最も高くつく理由も。
「コンテキストウィンドウ」とは?
AIが一度に頭に置けるテキスト量——長いチャットが冒頭を忘れる理由。