音は空気の振動です。マイクはそれを電圧の変化に変え、AD変換器が数値の列に変えます。ここまでは100年近く変わらない話です。
変わったのは、その数値の列に対して何ができるようになったか、です。かつては波形を切ったり貼ったり、音量を上下させることくらいしかできませんでした。いまは、混ざった音を楽器ごとに分けたり、歌のピッチを一音ずつ動かしたり、世界中の楽曲から数秒の断片で原曲を特定したりできます。
これらはすべて、波形を「読む」技術の上に成り立っています。制作する側にとっても発注する側にとっても、「機械に何ができて何ができないのか」を知っておくことは判断の精度に直結します。基本から順にたどってみます。
まず、音はどうやって数値になるのか
解析の話に入る前に、出発点を確認しておきます。マイクが捉えた連続的な電圧の変化を一定の間隔で標本化(サンプリング)し、それぞれの値を段階的な数値に量子化する。これが録音の実体です。
ここには理論的な制約があります。標本化定理によれば、標本化周波数の半分(ナイキスト周波数)より低い周波数の成分しか正しく記録できません。CD の 44.1kHz は、人間の可聴域の上限がおよそ20kHz とされることから、その倍を少し超える値として選ばれています。これを超える成分が混入すると、折り返し雑音(エイリアシング)として本来存在しない低い音に化けるため、AD変換の前段には必ずローパスフィルタが入ります。
制作時に 96kHz や 192kHz が使われるのは、可聴域の再現というより処理の過程で生じる歪みに余裕を持たせるためという側面が大きいと言えます。可聴域を超える成分が聴感に与える影響は、研究の結果が分かれており断定できません。
もう一方の軸がビット深度です。1ビットあたり約6dB に相当し、16ビットでおよそ96dB、24ビットでおよそ144dB という計算になります。ただしこれは理論値です。実際のAD変換器の性能は120〜125dB あたりが上限で、24ビットの理論値には機材が届いていません(実効的には20〜21ビット相当)。24ビットで録音する主な理由は、最終的な音質そのものより、録音時に十分なヘッドルームを取っても S/N が破綻しないという実務上の余裕にあります。
波形は「見る」ものになった
録音された音を画面に表示したとき、まず目に入るのは横軸が時間、縦軸が振幅の波形です。しかしこの表示から読み取れるのは、音量の推移と、おおまかな音の立ち上がりくらいです。どの高さの音が鳴っているかは、波形を見ても分かりません。
そこで使われるのがフーリエ変換です。あらゆる波形は、周波数の異なる正弦波の重ね合わせとして表現できる——この考え方に基づいて、時間軸の信号を周波数ごとの成分に分解します。ただし、音楽は時間とともに変化するので、曲全体を一度に変換しても意味がありません。そこで、信号を短い区間(フレーム)に区切り、区切りごとにフーリエ変換をかける短時間フーリエ変換(STFT)が使われます。
STFT の結果を、横軸に時間、縦軸に周波数、色の濃さでエネルギーの大きさを表して並べたものがスペクトログラムです。これによって、「2秒目に低い方で強い成分が立ち上がり、その上に倍音が並んでいる」といったことが目で読めるようになります。ノイズ除去、音程の検出、楽器の判別——音を扱うほとんどの解析技術は、この表現を出発点にしています。
区切るときには窓関数をかけます。単純に切り取ると端が不連続になり、実在しない周波数成分(スペクトル漏れ)が現れるためです。端に向けてなめらかに減衰する関数を掛けて、この副作用を抑えます。

時間と周波数は、同時に細かく見られない
ここで、避けられない制約が現れます。時間分解能と周波数分解能は、同時に高くできません。
理由は単純です。周波数を細かく見分けるには長い時間を観測する必要があり、そのあいだに何が起きたかは平均されてしまいます。逆に短く区切れば時間変化は追えますが、周波数の解像度は粗くなる。物理の不確定性原理と同じ形の関係で、どちらかを取ればどちらかを失います。
そのため目的によって窓の長さを変えます。打楽器のアタックを捉えるなら短い窓、低音の音程を判別するなら長い窓、というように。ノイズ除去やタイムストレッチで音が滲んだり金属的な副産物(アーティファクト)が出たりするのは、多くの場合このトレードオフに由来します。
人の耳に合わせて測り直す
人間の聴覚に合わせた変換もよく使われます。人の耳は低い周波数の違いに敏感で、高くなるほど鈍くなります。この特性を反映した尺度がメル尺度、それを使って圧縮した特徴量がMFCC(メル周波数ケプストラム係数)です。音声認識の標準的な特徴量で、音楽の分類にも応用されています。
音楽に特化した変換としては定Q変換(CQT)があります。音楽の音高は周波数が対数的に並ぶ(1オクターブ上がると周波数は2倍)ため、周波数軸を対数で区切ったほうが音楽的な構造を捉えやすい。コード認識や採譜の研究でよく用いられます。
| 解析の目的 | よく使われる表現・手法 |
|---|---|
| 音量・ダイナミクスの把握 | 波形、RMS、ラウドネス(LUFS) |
| 音色・分類 | メルスペクトログラム、MFCC |
| 音高・和音・採譜 | 定Q変換(CQT)、クロマ特徴 |
| 単音のピッチ検出 | 自己相関、YIN、pYIN、CREPE |
| 楽曲の同定 | 音楽指紋(スペクトルのピーク配置) |
音を分ける — 音源分離が実用になった
かつて「ミックスされた音源から特定の楽器だけを取り出す」ことは、原理的に困難だと考えられていました。ステレオ2チャンネルに何十もの音が足し合わされた状態から元を復元するのは、方程式の数より未知数が多い問題だからです。位相差を使って中央の音を打ち消す古典的な手法はありましたが、精度は限定的でした。
この状況を変えたのが、深層学習による音源分離です。大量の「分離前」と「分離後」のペアを学習させることで、モデルは楽器ごとの時間周波数パターンの特徴を獲得します。研究コミュニティでは MUSDB18 のような共通データセットを用いて、ボーカル・ドラム・ベース・その他の4分類での精度が SDR(信号対歪み比)という指標で比較されてきました。
実装としては、Deezer が公開した Spleeter(論文は2020年、*Journal of Open Source Software* 掲載。2分割から5分割まで対応)、オープンな Open-Unmix、そして Meta の研究チームによる Demucs 系統がよく知られています。
精度の向上ぶりは数値でも追えます。Demucs は、波形を直接扱う方式とスペクトログラムを扱う方式を組み合わせたハイブリッド構成へと発展し、さらに Transformer を導入した Hybrid Transformer Demucs(htdemucs)へ進みました。公開されているベンチマーク(MUSDB HQ テストセット)では、Hybrid Demucs(v3)の総合 SDR が 7.7dB、追加の学習データを与えてファインチューニングした HT Demucs(v4)が 9.0dB と報告されています。数値を比べるときは、追加データを使ったかどうかと、どの指標で測ったかを揃えないと意味がありません。0.1dB の差に意味を持たせすぎない、というのは研究者側からも指摘されています。現在では専用ソフトだけでなく、主要な DAW やマスタリング支援ツールにも分離機能が組み込まれています。
用途はリミックスやカラオケ制作にとどまらず、古い録音の修復、採譜の補助、教材制作にも広がりました。演奏をやり直せない素材に手を入れられるようになった意味は大きく、歴史的録音のリマスターでも使われています。
ただし、分離は完全ではありません。強く重なった帯域では、取り出した音に他パートの残響が混ざったり、必要な倍音が削れて痩せた音になったりします。分離できることと、作品に使える品質であることは別です。分離した音源を素材にする案件では、品質の許容範囲を事前にすり合わせておくのが安全です。

音の高さを測る — ピッチ検出が変えたもの
音源分離と並んで制作を変えたのが、ピッチ検出の実用化です。
単音の高さを推定する手法は、古くは波形の周期性を調べる自己相関から始まりました。周期を誤って倍や半分に取ってしまう問題(オクターブエラー)を抑える改良として YIN が提案され、確率的に候補を評価する pYIN へと発展します。さらに2018年には、波形を直接畳み込みニューラルネットワークで処理する CREPE(Kim, Salamon, Li, Bello)が発表され、従来の最高水準だった pYIN と同等以上の精度が報告されました。歌声のように音高が揺れ、倍音構成が刻々と変わる信号でも、実用的な精度で追跡できるようになったわけです。
この技術が現場に与えた影響は大きく、二つの製品が象徴的です。
一つはオートチューンです。1997年に Antares Audio Technologies がリリースしたこのソフトウェアは、もともと歌の音程を自然に補正するための道具でした。開発者のアンディ・ヒルデブランドは石油探査の地震データを信号処理で解析していた技術者で、地中に音波を送って地下構造を読み解く手法が声の音程追跡にも応用できると気づいた、と説明されています。
ところが、補正の速度を極端に速く設定すると、音程が階段状に飛ぶ独特の質感が生まれます。1998年のシェール「Believe」でこの効果が前面に出て以来、補正ツールは表現手段としても定着しました。修正のための道具が、意図せず新しい音色を生んだわけです。
もう一つは Melodyne です。2009年に搭載された DNA(Direct Note Access)によって、和音として鳴っている音の中から個々の音を取り出して編集することが可能になりました。録音済みのギターのコードの中の一音だけを動かす、といった操作が現実になったわけです。
ピッチが編集可能になったことで、「録音は演奏の記録である」という前提は大きく揺らぎました。どこまで直すかは技術の問題ではなく、制作者と発注者の合意の問題です。
音量をどう測るか — ラウドネスという物差し
音の大きさを測るのは、実は簡単ではありません。ピーク値も単純な平均値も、人間が感じる大きさとは一致しないからです。人の耳は周波数によって感度が違い、音が続く長さによっても印象が変わります。
この問題に対する国際的な答えが、ITU-R BS.1770 で定義されたラウドネス測定の方法です。正式名称は「Algorithms to measure audio programme loudness and true-peak audio level」で、2023年11月承認の BS.1770-5 が最新版にあたります。人間の聴覚特性に合わせた周波数重み付けを行い、一定の水準を下回る区間を除外したうえで平均を取り、LUFS(Loudness Units relative to Full Scale)という単位で表します。
放送分野ではこれを基に EBU R128(Loudness normalisation and permitted maximum level of audio signals)が策定され、番組のラウドネスを -23.0 LUFS に揃える運用が広まりました。現行版では、目標値の達成が実務上難しい場合(生放送など)に限って ±1.0 LU の許容が認められています。
ここで重要なのは、LUFS はピーク値ではなく「体感的な平均音量」を測る指標だという点です。波形をどれだけ潰しても、聴感上の音量が同じなら LUFS は変わりません。
この事実は、長く続いた「ラウドネス戦争」の前提を崩しました。CD の時代には「他より大きく聞こえる」ことが有利とされ、コンプレッサーとリミッターで波形を限界まで押し潰す競争が起きました。しかしストリーミングサービスが再生時にラウドネスを揃えるノーマライズを導入した結果、潰して音量を稼いでも再生時に下げられるだけになりました。
ここで、何が失われたのかを正確に見ておく必要があります。大規模な楽曲解析の研究では、曲全体の音量の振れ幅(マクロなダイナミクス)は、実はそれほど減っていないという報告が繰り返し出ています。潰されたのは、アタックの鋭さのような短い時間スケールの起伏(マイクロダイナミクス)のほうです。長く聴いていると疲れる、という感覚の正体はこちらにあると考えられています。「ダイナミックレンジが失われた」と一括りにすると、この区別が消えてしまいます。
ただし、「だから戦争は終わった」と言い切れるかというと、そう単純でもありません。放送規格の側は、この仕組みによって制作現場がラウドネス競争から解放されたと述べています。一方で、近年チャートに入った楽曲のマスターを測ると推奨値との相関が見られず、以前と変わらないか、むしろ大きいという報告もあります。技術的な合理性が失われても、慣習や「大きいほうが良く聞こえる」という感覚はすぐには変わらない、ということかもしれません。
たとえば Spotify は、再生時に -14 LUFS へ揃えると公表しています。マスターがそれより大きければゲインを下げ、小さければ上げる。つまり大きく作っても再生音量は変わらないわけです。
| 基準・サービス | ラウドネスの扱い | 補足 |
|---|---|---|
| ITU-R BS.1770-5(2023年) | 測定アルゴリズムの規格 | ラウドネスと True Peak の算出方法を規定。単位は LKFS/LUFS |
| EBU R128(放送) | -23.0 LUFS | 欧州の放送運用で広く採用。生放送等では ±1.0 LU の許容 |
| Spotify | -14 LUFS に再生時調整 | True Peak は -1 dBTP 推奨(-14 LUFS 超のマスターは -2 dB 以下) |
基準値は変更されることがあるため、マスタリング時にはその時点の公式資料を確認するのが確実です。あわせて、サンプル間のピークまで見る True Peak(dBTP)に余裕を持たせ、変換時のクリップを避けるのが一般的な運用です。
曲を特定する — 音楽指紋と自動検知
スマートフォンを数秒かざすだけで曲名が分かる仕組みは、波形解析の応用として最も広く使われているものでしょう。
代表的な音楽指紋の考え方は、スペクトログラムの中から周囲より突出したエネルギーのピークだけを抜き出し、その配置パターンをハッシュ値として索引化するというものです。振幅の絶対値ではなくピークの相対的な位置関係を使うため、周囲の騒音やスピーカーの特性が変わっても一致を取れる——これが雑音に強い理由です。
同じ発想は権利処理の現場でも動いています。動画共有サービスの自動検知は、投稿された音声を登録済みの参照データと照合し、権利者が設定したポリシー(収益化・ブロック等)を適用します。人手では追いつかない量の照合を、指紋の索引が成立させているわけです。
音楽情報検索(MIR)の領域では、同定に加えてテンポ・キー・コード・楽曲構造の推定といった課題が研究されてきました。国際学会 ISMIR を中心にデータセットと評価手法が共有されています。ジャンルや録音状態によって精度が変わるため、「機械が出した数値は常に正しい」とは考えないほうがよいのが実務上の注意点です。
生成AI時代の波形
近年の音楽生成AIも、根っこは波形の解析技術です。
大規模なモデルが音を扱えるようになった背景には、ニューラルオーディオコーデックの発展があります。波形を離散的なトークン列に圧縮する技術で、これによって音を言語モデルと同じ枠組みで扱えるようになりました。生成AIが「音を予測する」とき、予測しているのはこのトークンの並びです。
一方で、生成された音をどう見分けるかという課題が生まれました。人の耳では判別が難しくなったため、生成時に聞こえない形で識別情報を埋め込む電子透かしの実用化が進んでいます。ただし再エンコードや加工、切り出しで透かしが失われる可能性は残り、検出できないことは「AI生成ではない」ことの証明にならないという限界があります。
音楽生成AIの著作権上の扱いについては、AI が作る音楽と著作権で詳しく整理しています。

測れることと、測れないこと
ここまで見てきたように、音について機械が測れることは大きく広がりました。音量は数値で比較でき、テンポやキーは自動で推定でき、混ざった音は分離でき、曲の同一性は照合できます。
発注する側にとって、これは実務的な利点になります。「もっと迫力のある音に」という曖昧な要望を、「配信基準のラウドネスで、True Peak に余裕を持たせて」と具体化できる。仕様を数値で確認できれば、認識のずれが減ります。
しかし、測れないことのほうがまだ多いのも事実です。ある演奏が良いかどうか、その曲がその場面に合っているか——こうした判断は数値では出てきません。分離の精度が上がっても、どこまでの劣化なら作品として許容できるかは人が決めます。
解析技術は判断の材料を増やしますが、判断そのものは代行しません。 数値で語れる部分を数値で語り、それ以外を言葉で詰める。この切り分けができる制作者と発注者のあいだでは、やり取りの精度が明らかに上がります。
音響やマスタリングを扱える人材、録音・修復の実績がある人材は、見つけるから職種で絞って探せます。具体的な依頼内容が決まっていれば、仕事の掲載から相談を投げることもできます。
参考・出典
- Recommendation ITU-R BS.1770 — Algorithms to measure audio programme loudness and true-peak audio level(国際電気通信連合・最新版 BS.1770-5 は2023年11月承認)
- EBU R 128 — Loudness normalisation and permitted maximum level of audio signals(欧州放送連合・Version 5.0、2023年11月)
- Loudness normalization — Spotify for Artists(Spotify 公式ヘルプ)
- Demucs(Music Source Separation)(Meta AI Research。関連論文: Rouard, Massa, Défossez「Hybrid Transformers for Music Source Separation」ICASSP 2023/Défossez「Hybrid Spectrogram and Waveform Source Separation」ISMIR 2021)
- Spleeter(Deezer。Hennequin ほか「Spleeter: a fast and efficient music source separation tool with pre-trained models」*Journal of Open Source Software*、2020年)
- CREPE: A Convolutional Representation for Pitch Estimation(Kim, Salamon, Li, Bello、2018年)
- Antares Audio Technologies — About(Auto-Tune の開発経緯)
- ISMIR(International Society for Music Information Retrieval)(音楽情報検索の国際学会)
*本記事は2026年8月時点の公開情報に基づいています。各サービスの基準値や仕様は変更されることがあります。*