Songsee
音声のスペクトログラムや特徴量(mel, chroma, MFCC)を CLI で作ります。
skill の情報
| 提供元 | 最初から入っています |
| パス | skills/media/songsee |
| バージョン | 1.0.0 |
| 作者 | community |
| ライセンス | MIT |
| 対応プラットフォーム | linux, macos, windows |
| タグ | Audio, Visualization, Spectrogram, Music, Analysis |
参考: SKILL.md 全文
songsee
音声ファイルからスペクトログラムや、複数のパネルに分けた音声特徴量の図を作ります。
事前に必要なもの
Go が必要です。次のコマンドで導入します。
go install github.com/steipete/songsee/cmd/songsee@latestWAV / MP3 以外の形式を扱うなら ffmpeg もあると便利です。
さっそく使う
# Basic spectrogram
songsee track.mp3
# Save to specific file
songsee track.mp3 -o spectrogram.png
# Multi-panel visualization grid
songsee track.mp3 --viz spectrogram,mel,chroma,hpss,selfsim,loudness,tempogram,mfcc,flux
# Time slice (start at 12.5s, 8s duration)
songsee track.mp3 --start 12.5 --duration 8 -o slice.jpg
# From stdin
cat track.mp3 | songsee - --format png -o out.png図の種類
--viz にカンマ区切りで指定します。
| 種類 | 説明 |
|---|---|
spectrogram |
標準的な周波数スペクトログラム |
mel |
メル尺度のスペクトログラム |
chroma |
音名クラスの分布 |
hpss |
調波成分と打楽器成分の分離 |
selfsim |
自己相似行列 |
loudness |
時間ごとのラウドネス |
tempogram |
テンポの推定 |
mfcc |
メル周波数ケプストラム係数 |
flux |
スペクトル変化量(オンセット検出) |
--viz を複数指定すると、1 枚の画像にグリッドとして並べて描画されます。
よく使うフラグ
| フラグ | 説明 |
|---|---|
--viz |
図の種類(カンマ区切り) |
--style |
配色: classic, magma, inferno, viridis, gray |
--width / --height |
出力画像のサイズ |
--window / --hop |
FFT の窓幅とホップサイズ |
--min-freq / --max-freq |
周波数の範囲を絞る |
--start / --duration |
音声の切り出し範囲 |
--format |
出力形式: jpg または png |
-o |
出力先のファイルパス |
補足
- WAV と MP3 はそのままデコードできます。ほかの形式には
ffmpegが必要です - 出力画像は
vision_analyzeで読み込ませれば、音声の分析を自動化できます - 音声出力を比べたいとき、シンセシスの不具合を追いたいとき、音声処理の流れを記録したいときに役立ちます