Py学习  »  机器学习算法

机器学习模型可从录音中识别爵士钢琴家并揭示使其具有辨识度的音乐“指纹”

21dB声学人 • 1 周前 • 56 次点击  




一项针对20位著名爵士钢琴家的研究表明,机器学习模型能够从录音中识别出爵士钢琴家,并揭示使每位演奏者具有辨识度的音乐“指纹”。这项发表在《自然·机器智能》(Nature Machine Intelligence)上的研究,可能为艺术家归属与风格分析、文化遗产研究以及音乐教育等领域提供新的思路。

图片来源:Unsplash/CC0 Public Domain


音乐家通常可以通过其作品中独特的模式或“指纹”被识别出来,这些指纹包括和声进行、节奏结构和旋律动机。爵士乐为研究这些指纹提供了绝佳的机会,因为它融合了作曲、即兴创作和表演三大要素,而这些要素的组合对特定演奏者而言可能极具独特性。


然而,爵士乐的计算分析一直面临困难:大多数演奏仅以音频录音形式存在,而直接在音频上训练的模型由于录音环境和设备类型等变量,往往难以被人类解读。


剑桥大学的Huw Cheston及其同事训练了监督学习模型,用于从精心整理的84小时录音数据集中识别演奏者。


该数据集包含20位著名爵士钢琴家的1629场演奏录音,其中包括Bill Evans、Oscar Peterson、Thelonious Monk、Chick Corea、Keith Jarrett、McCoy Tyner和Ahmad Jamal等人的录音。


这些录音被转换为MIDI“钢琴卷帘”(piano roll)格式——一种显示音符演奏时间和音高的数字表示形式。


性能最佳的模型识别演奏者的准确率达到94.4%,而一个更具可解释性的模型——该模型将旋律、和声、节奏和力度(dynamics)分开处理——达到了91.3%的准确率。当单独测试各个维度时,和声给出的预测最准确,其次是节奏和旋律,而力度是最不准确的维度。


作者指出,他们的方法可以帮助研究人员探索使演奏者与众不同的音乐模式,其中包括与现有学术文献相吻合的特征,以及此前未被讨论过的特征。


他们还发布了开源模型和一款用于探索研究结果的应用程序。不过,作者也指出,旋律与和声等音乐维度存在一定程度的重叠,且MIDI钢琴卷帘无法捕捉爵士表演的所有方面,包括颤音和音高弯曲等音色和音调特质。


未来的工作可以将该方法扩展到其他流派、乐器、历史背景,以及知名度较低或在历史上被忽视的音乐家。


论文信息:Huw Cheston et al, Machine learning of artistic fingerprints in jazz, Nature Machine Intelligence (2026). DOI: 10.1038/s42256-026-01279-9

信息源于:phys.org



  关于我们  


21dB声学人是中国科学院声学研究所苏州电声产业化基地旗下科技媒体,专注于声学新技术、音频测试与分析、声学市场调研、声学创业孵化、知识产权服务等。

  合作推广  


稿件投稿 | 创业支持 | 知产服务 | 技术转化
请发送需求至以下邮箱,我们将派专人与您联系
21db@ioasonic.com

  免责声明  


本文内容基于该期刊论文公开信息撰写,仅供学术交流与信息分享,不为其版权负责。所有技术细节、实验数据与结论均以原论文为准。如涉及侵权、隐私等问题,请联系我们及时删除。

图片


Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/200253