ブログに戻る

AI は音楽を理解できるのか — 聴取・推論・センスをめぐるエビデンス

Lacuna.fm Research Team
AI は音楽を理解できるのか — 聴取・推論・センスをめぐるエビデンス

AI はすでに楽器やテンポ、旋律の輪郭、ある程度の調的関係を聞き分けられます。専門用語を正確に使い、筋の通った批評を一段落書くこともできます。しかしこの二つの能力は、必ずしも同じ証拠の連鎖の上に立っているわけではありません。前者は、モデルが音から音楽的な事実を取り出すことを要求します。後者は、テキスト学習から吸収した音楽理論、ジャンルの歴史、批評の言説だけでも成立してしまいます。言語能力が高いほど、この二つは取り違えられやすくなります。

2026年時点で最も証拠に支えられている見解は、次のとおりです。AI は音楽的な事実の一部を知覚しています。一方で、楽曲全体の構造、正確な時間関係、複雑な和声については依然として信頼できません。そして集団の平均評価に当てはめることはできても、それはセンスと呼べるものではありません。ボトルネックは、モデルに「耳」があるかどうかだけではないのです。音がエンコーダに入ったあとどの情報が生き残り、そのうちどれだけが言語モデルまで届いて答えを形づくるのか。問題はそこにあります。

56.4%
音楽リスニング問題でテキストのみのモデルが記録した最高スコア
音声入力は一切なし。四択の当てずっぽうは25%
4 / 37
正しい判定を出した回のうち、シンコペーションの数まで合っていた回数
答えが合っていても、聴き取りの説明が合っているとは限りません
97.2%
左右2チャンネルを明示的に扱う研究でのパンニング定位精度
空間的な聴取の欠如は工学上の選択であり、原理的な限界ではありません

マルチモーダル AI は音符を聴いていない — 聴いているのは圧縮された表現

公開情報のあるオーディオ言語モデルは、おおむね同じ入力の連鎖を共有しています。

音声波形 → スペクトログラムまたは音楽表現 → オーディオエンコーダ → 圧縮とアライメント → 言語モデル → テキストの回答

Qwen2-Audio を例に取ります。入力は 16 kHz にリサンプリングされ、128チャンネルのメルスペクトログラムに変換されたうえで、Whisper のオーディオエンコーダを通ります。その結果、出力される1フレームはおよそ40ミリ秒に対応します。言語モデルに届くのは「ハ長調」「4分の4拍子」「ここでギターが入る」といった記号ではありません。混ざり合った音の短い断片を要約した、連続値のベクトルです。言語モデルはそのベクトルと、すでに自分が出力したテキストをもとに、次のテキスト token を予測します。

モデル間の大きな違いの一つは、フロントエンドがどの種類の音を想定して学習されたかです。SALMONN は音声寄りの Whisper と音響イベント寄りの BEATs を組み合わせ、30秒の音声を言語モデル向けの88個の入力 token に圧縮します。一方 MERT は、音高・和声・音響構造という、音楽のために設計された学習目標を加えています。前者は一つのモデルで音声・環境音・音楽をまとめて扱おうとするもの、後者は音楽のために訓練された耳に近いものです。

この連鎖には、独立した三つのボトルネックがあります。エンコーダが何を残すかを決め、コネクタが何を圧縮して捨てるかを決め、言語モデルが実際に何を使うかを決めます。音高や音色の情報がエンコーダの内部に残っていたとしても、テキスト生成に最適化されたアライメントの過程で弱められてしまうことがあるのです。

コンテキストウィンドウに収まることは、構造を理解することではない
長いコンテキストが証明するのは、モデルが長い音声を保持したり参照したりできることだけです。楽曲がモチーフ、和声、セクション、時間を通じてどのように期待を組み立てているかを理解することは、それとは別の能力です。

用途を直接的に制約する限界が、もう一つあります。汎用モデルの多くは、マルチチャンネル音声をモノラルにダウンミックスしているのです。Google の Gemini オーディオドキュメントは、マルチチャンネル入力が単一チャンネルに統合されるとはっきり記しています。こうしたモデルは、どんな音が鳴っているかは答えられますが、入力から実際の左右の配置を復元することはできません。パンニングやステレオの広がり、空間的な定位を判断させても、その根拠はきわめて薄いということになります。

これはオーディオ AI の天井ではありません。2026年に発表された Dual-BEATs は左右チャンネルを別々にエンコードし、パンニング定位で 97.2% の精度に達しています。専用のアーキテクチャを組めば、空間的な聴取は取り戻せます。現在の汎用製品にそれがないのは、トレードオフの結果であって、原理的な制約ではありません。

基本的な認識は強い。構造的な聴取はまだ弱い

MUSE は Gemini 2.5 Pro、Qwen2.5-Omni、Audio Flamingo 3 を、統制された10種類の音楽タスクで評価しました。人間側のベースラインは200人で、うち6人は音楽の専門家です。結果は「AI は人間より一様に劣る」ではありません。きわめて凹凸の激しい能力曲線でした。

Gemini 2.5 Pro は楽器識別で 98.33%、旋律の輪郭で 96.67%、リズムマッチングで 96.67% を記録しました。より複雑な関係を扱うタスクになると、コード進行のマッチングは 66.67%、拍子の識別はわずか 46.67% まで落ちます。同じ研究に参加した6人の専門家は、この最後の二つでそれぞれ 85% と 73.3% でした。専門家グループはきわめて小規模です。能力曲線の形を読むには使えますが、母集団の精密な推定には使えません。

Gemini 2.5 Pro は局所的な認識タスクでは6人の専門家ミュージシャンに肉薄しますが、和音の関係と拍子でははっきり後れを取ります。専門家グループはきわめて小規模であり、この図はタスク間の能力曲線の形を示すためのものです。
Source: MUSE: Benchmarking Auditory Reasoning in Multimodal Language Models(2025年)、Table 1。

モデル間の開きも、同じくらい大きくなっています。MUSE では、Audio Flamingo 3 が6つのタスクでちょうど偶然の水準にとどまり、Qwen2.5-Omni は旋律の輪郭で 23.33% — 四択で当てずっぽうに答えたときの 25% を下回りました。「マルチモーダルモデル」は均質な能力の階層ではありません。製品名よりも、学習目標とオーディオのフロントエンドのほうが効いてくるのが普通です。

より伝統的な音楽情報検索のタスクになると、差はいっそう鮮明になります。CMI-Bench v2 は11個の Audio-LLM を、ビート、調、旋律、感情、奏法という標準的な指標で評価しました。music captioning を除けば、汎用モデルはタスク特化のシステムに大きく水をあけられています。ビートトラッキングは最高でも 23.69 で、教師あり参照系の 88.3 に対して大差。旋律抽出は 5.06 対 72.3、古箏の奏法は 3.18 対 90.0 でした。連続値の感情回帰では、最良の R² が 0.00 — 常に平均値を返すベースラインと同等が上限だった、ということです。

ここには重要な肯定的証拠もあります。自己教師あり学習による音楽表現を評価した MARBLE によれば、MERT-330M はビートトラッキングで 87.9、NSynth の音高タスクで 94.4% に達しています。音楽的な情報が機械に表現できないわけではないのです。差が生まれるのは主に、その表現が圧縮され、アライメントされ、言語モデルに接続されたあとです。

同じモデルでも、入力形式を変えるだけで同じオーダーの差が出ます。coremusic は Gemini 2.5 Pro に、同じ音楽タスクを波形として与えた場合と MIDI として与えた場合を比較しました。MIDI 入力では、シンコペーション、移調、和音の種類がほぼ完璧に近づきます。音声入力では精度が大きく落ちました。フロントエンドが安定して取り出せなかった音高や関係を、後段の推論が取り戻すことはできないのです。

批評を書けることと、その批評がこの曲から出てきていることは別

2024年に発表された MuChoMusic は、旋律、和声、リズム、構造、ムード、スタイルにまたがる 1,187 問の四択問題を組み上げました。この研究で最も重要だったのはスコアではなく、対照条件です。音声をホワイトノイズやランダムな別の曲に差し替えても、評価した5モデルのうち3モデルは、統計的に有意な低下を示しませんでした。

その後に発表された RUListening はさらに踏み込み、音声入力を一切持たないテキストのみのモデルが、同じベンチマークで 56.4% に達することを示しました。偶然の水準は 25% です。テキストモデルが音楽を聴いているからではありません。常識に反する選択肢を消去できるからです。たとえば、ジャンルから楽器編成を推測する、といった具合に。

これは、初期の音楽 QA ベンチマーク自体の欠陥もあらわにします。MuChoMusic の選択肢の作りでは、明らかに無関係な二つを消したうえで残る二つから当てにいく、ということが往々にして可能だったのです。新しい評価は、この抜け道を塞ぎつつあります。MMAR はより強力な誤答選択肢を使っており、そこでは音声をノイズに差し替えるとどのモデルもはっきりスコアを落とします。MMAU-Pro では、テキストのみのモデルはおよそ 16%–30% まで下がります。だから結論は「AI はまったく聴いていない」ではなく、より鋭くこうなります。音声なしでも答えられる問いであれば、言語モデルはまず、安いほうのテキスト経路を取るのです。

最終的な答えが合っていても、説明はあとから組み立てられたものかもしれません。MUSE のシンコペーション課題で、Gemini は 37 回正しい判定を出しましたが、実際にシンコペーションが起きている位置まで正しく数えられたのは、そのうち 4 回だけでした。和音の種類では、決め手となる3度を 60 問中 34 問で特定しています。chain-of-thought は知覚をほとんど改善せず、タスクによってはむしろ悪化させました。

コミュニティによる非公式なテストでも、同じパターンが繰り返し表面化しています。2025年、あるプロデューサーが Gemini 2.0 に DAW の画面を見せながら、同時に音声もモニターさせました。音声をミュートしたあとも、モデルは「聴こえている」と称する音楽を説明し続け、視覚的な手がかりのないプレーヤーに切り替えると、楽器やジャンルの判定は目に見えて悪化しました。このテストは AudioCipher の実験として記録されています。当時のリアルタイム画面共有のパイプラインを対象としたものであり、その後に登場した音声アップロード型のモデルをそのまま代表するものではありません。別の例、Gearnews の読者レポートでは、モデルがレゲエをインディーフォークと取り違え、実際に鳴っていた金管を聞き落とし、鳴っていないアコースティックギターについて論評しました。これらは正式なベンチマークではありませんが、論文が見つけた言語的な近道と聴覚的なハルシネーションと、同じ方向を指しています。

ボトルネックは音楽表現の欠如ではなく、配線に見える

二つの証拠の系統が、同じ説明を支えています。一つは先に挙げた表現モデル — MERT や MusicFM など — で、符号化された表現からビート、音高、調をすでに高い品質で読み出せます。もう一つは、オーディオ言語モデルの内部経路を扱った2026年の研究です。CoAT は、モデルがテキスト出力層に近づくほど隠れ状態がテキスト生成向けに整形され、音高、韻律、情動、音響イベントの情報が段階的に失われていくことを見出しました。ORCA は、コネクタの出力が単一の方向へ収縮していく現象を観測しています。これを是正する制約を加えたところ、多段階の音声推論は明確に改善しました。

どちらの研究も音楽そのものを対象としたものではないため、音楽上のあらゆる誤りがコネクタに由来することを証明するわけではありません。それでも二つを合わせると、一つの安定した現象が説明できます。エンコーダに情報が存在することと、言語の出力側がそれを呼び出せることは、別だということです。

工学的には、すでにより確実な迂回路があります。OpenMU は、聴覚的な分析をすべて LLM 自身にやらせません。和音、テンポ、調、ダウンビートといったタスクは専用の音楽ツールに渡し、言語モデルにはツールの選択と答えの組み立てを任せます。ツール呼び出しの正確さは複数のタスクでおよそ 95%–100% に達しますが、これは正しいツールが呼ばれたかどうかを測った数字であり、背後の音楽アルゴリズムが 100% 正しいという意味ではありません。

これは、より健全な製品構造にそのまま対応します。「何が起きたか」は DSP と音楽情報検索のシステムに答えさせ、「それが何を意味するか」を言語モデルに説明させる、という分担です。たとえばビートと調は、汎用のチャットモデルに曲全体を通して推測させるのではなく、専用の BPM・キー解析から取るべきです。

AI は美的評価に点数をつけられる。しかし「センス」は一つの総合点ではない

音楽の美的評価モデルは、実用に耐える結果を出しています。SongEval は AI が生成した完成曲 2,399 曲を集め、音楽的な素養を持つ 16 人のアノテーターが、一貫性、記憶に残りやすさ、ボーカルの自然さ、構造の明快さ、全体的な音楽性といった次元で評価しました。1曲あたり 4 人が採点しており、専用モデルは自身のテストセット内では、人間の平均スコアと強く相関しました。

論文は、その境界を明示しています。ここでいう美的な品質は訓練を受けたミュージシャン集団の合意を近似したものであり、個人のセンスを表すものではありません。同じデータセット上の実験では、自動評価器の5次元にわたる平均ピアソン相関はおよそ 0.912 でした。しかしこれは SongEval 自身のアノテーション分布への当てはまりであり、任意の音楽の専門家と同じだけ一致する、と外挿できるものではありません。論文はアノテーター間一致係数を報告していないため、この研究からは「人間の合意」がその上限においてどれほど信頼できるのかも分かりません。

より大きな問題は、こうしたモデルが、品質と相関しているだけで品質そのものではない近道を学んでしまう可能性です。2026年の Genre Bias or Aesthetic Perception? は SongEval を監査し、モデルのスコアが「その曲がどれだけポップスに近いか」と強く相関していることを見つけました。二つのテストセットでのスピアマン相関は 0.88 と 0.81 です。ポップスを体系的に過大評価し、ジャズやクラシックなど他ジャンルの質の高い作品を過小評価します。5つの美的次元にわたる予測値の相関が 0.95 を超えていることも、モデルが単一の潜在的な総合点をほぼ繰り返しているだけである可能性を示唆します。

集団の合意は普遍的なセンスではない
美的評価モデルが学べるのは、その特定のアノテーター集団がどう採点しがちか、ということです。プロデューサー、クラシックの演奏家、ポップスのリスナー、ある文化圏のコミュニティ、あるいは特定の一人のユーザー — 参照する集団を指定して初めて、「正確に採点できているか」は検証可能な問いになります。

センスはむしろ、条件付き分布のように振る舞います。誰が聴いているのか、どの伝統を知っているのか、その作品が何をしようとしているのか、そしていつその判断が下されるのか。AI 音楽の言語地図を分析した記事では、学習データと実際のユーザーとのあいだに、はっきりした文化的なズレがあることをすでに確認しました。その条件下で、参照集団を明示しない「音楽性:82」は、主流の学習分布を普遍的な基準のように装っただけのものである可能性が高いのです。

だから「AI にセンスはあるのか」という問いは、三つの別々の問いに書き換えるべきです。

何を判定するのか妥当な正解データ現時点での実現度
音楽的な事実が正しいか検証可能なアノテーション:ビート、調、楽器編成、タイムスタンプ専用モデルでは成熟。汎用の Audio-LLM では不安定
集団の評価と一致するかアノテーター集団と評価基準を明示したうえでのランキングまたはスコア学習可能。ただしジャンルと文化の近道を監査する必要あり
一人の個人のセンスと一致するかその人の再生履歴、スキップ、保存、二者択一の選好予測可能。ただし個人の履歴が必要で、集団の平均では代用できない

参照集団から切り離された「正しいセンス」には、どの論文も検証できるような単一の答えはありません。モデルが主観的な音楽体験のようなものを持つかどうかについては、既存のベンチマークは行動を測ることしかできません。回答のテキストは、その背後に体験があることを証明できないのです。

いま信頼できる AI 音楽分析は、どういう形をしているべきか

信頼できるシステムは、出力を少なくとも三つの層に分けなければなりません。観測可能な事実、解釈としての推論、そして主観的な評価です。事実の層は可能なかぎり専用ツールから取り、タイムスタンプを添えるべきです。推論の層は、根拠と不確実性を明示する必要があります。評価の層は、それが誰の基準を表しているのかを宣言しなければなりません。

検証もまた、専門家らしく聞こえる長文のレビュー一本で済ませることはできません。より有効なのは、タイトルとメタデータを外す、無音・ノイズ・内容の合わない音声を混ぜる、同じ曲の中で和音・テンポ・楽器・セクション順のいずれか一つだけを変える、同じテストを繰り返す、すべての判断にタイムスタンプの引用を求める、そして最後にミュージシャンによるブラインド評価を行う、といった方法です。音声を変えたときにモデルの論評が期待どおりに変化して初めて、その判断が音に根ざしているという証拠が得られます。

ミキシングとマスタリングになると、要求水準はさらに上がります。汎用で、モノラルで、発話向けに最適化された入力パイプラインを、信頼できるステレオ計測ツールとして扱うべきではありません。LUFS、ピーク、スペクトルバランス、ダイナミックレンジ、位相、チャンネル間相関は、まず DSP で計算すべきものです。言語モデルが得意なのは、その計測値をリファレンス曲や制作意図と突き合わせ、あとから検証できる形で提案を組み立てることです。

AI は、音楽の分析と制作における協働者としてはよく機能し、説明責任を負わない美の裁定者としてはうまく機能しません。問題の候補を指摘し、理論的な知識を整理し、明示された基準に沿ってバージョンを比較し、音楽制作のワークフローの中で方向性を素早く試すのを助けることはできます。しかし、どの緊張、どの欠陥、どの逸脱を残す価値があるのかを決めるには、依然として明示された制作意図と、評価を下す主体が必要です。制作者の役割をデータで分析した記事で論じたとおり、ツールは人が決められることの範囲を広げますが、その作品がなぜ成立しているのかを、その人に代わって決めてくれるわけではありません。

本稿の調査範囲
本稿は一次論文、公式の技術ドキュメント、検証可能なコミュニティ実験を優先して参照しています。2026年の研究の一部は arXiv のプレプリント段階にあり、時間をかけた追試を経ていません。コミュニティの事例は、正式なベンチマークを補強する観察としてのみ用いており、全体の誤り率を推定するために使うことはありません。

主要な参考文献

  • Qwen2-Audio Technical Report — 公開された Audio-LLM の入力とアライメントのアーキテクチャ。
  • MERTMARBLE — 自己教師あり学習による音楽表現と、標準タスクでの評価。
  • RUListening — 言語の事前知識が「モデルは聴いている」という錯覚をどう作り出すか。
  • MUSE — 200人のベースラインを伴う、統制された音楽知覚タスク。
  • CMI-Bench v2 — 伝統的な指標で見た、Audio-LLM と専用音楽システムの比較。
  • SongEval — 生成された完成曲に対する専門家の美的評価。
  • Genre Bias or Aesthetic Perception? — 美的スコアリングに潜むジャンルの近道。