分享
AI 音乐 | 3.12 资讯
输入“/”快速插入内容
AI 音乐 | 3.12 资讯
用户6750
用户6750
2024年3月13日修改
20%
作者:叮当不是机器猫 |分享AI音乐动态,探索AI与音乐的无限可能!
公众号:智音Brook
2024-03-12 22:13 广东
原文:
https://mp.weixin.qq.com/s/hhpJjZs0A40kxgFAwgNKeA
80%
目录
MART:使用部分整体变压器学习分层音乐音频表示
Video2Music:情感驱动的多模态视频内容与音乐生成框架
Paper Piano:面向所有人的网络摄像头驱动虚拟钢琴体验
突发:Splash Pro 即将永久关闭
Aux 推出 LoopLM,助力音乐制作人创造独特样本和循环
MART:使用部分整体变压器学习分层音乐音频表示
论文:
https://arxiv.org/abs/2312.06197
MART(Music Audio Representation Transformer)是一种创新的自监督学习方法,专为音乐音频表示学习而设计。该方法由 Dong Yao 及其团队开发,旨在通过捕捉音乐内在的层次结构来提升音乐表示的质量。MART 的核心在于其独特的层次音频裁剪策略、部分-整体变换器,以及层次对比学习目标。
层次音频裁剪(HAC)
:MART 通过递归裁剪技术,将音乐音频分割成多个子片段,形成一个具有部分-整体层次结构的音乐片段集。这种策略不仅保留了音乐的内在结构,而且为后续的特征提取和表示学习奠定了基础。
部分-整体变换器(PWT)
:MART 引入了一种新颖的变换器架构,专门用于处理和学习音乐片段之间的部分-整体关系。通过堆叠多个交互单元,MART 能够有效地在不同层次的音乐片段间传播信息,并促进它们之间的交互,从而更好地理解音乐的结构和内容。
层次对比学习目标(HCL)
:为了进一步优化部分-整体表示,MART 采用了层次对比学习目标。这种方法通过对比损失函数,鼓励模型学习到相邻层次间的音乐表示相互对齐,从而在多层次上建立一个连贯的表示空间。
在多个下游任务的实验中,MART 展现了卓越的性能,尤其是在音乐分类和翻唱歌曲识别任务上,其表现超越了现有的监督学习方法和其他自监督学习方法。这些成果证明了 MART 在音乐表示学习领域的潜力,特别是在理解和利用音乐的层次结构方面。
Video2Music:情感驱动的多模态视频内容与音乐生成框架
论文:
https://www.sciencedirect.com/science/article/abs/pii/S0957417424005062?via%3Dihub
Video2Music 是一个突破性的框架,它利用情感多模态变换器(Affective Multimodal Transformer, AMT)模型,直接从视频内容生成与之情感匹配的音乐。这一创新技术旨在解决社交媒体平台上视频与背景音乐匹配的挑战,尤其是在版权问题日益受到关注的环境中。
情感匹配
:Video2Music 的 AMT 模型专注于捕捉视频和音乐之间的复杂关系,并引入了一种新颖的情感匹配机制,确保生成的音乐能够与视频的情绪和内容相协调。
全面转录的数据集
:为了支持这一框架,研究者们创建了 MuVi-Sync 数据集,它包含了丰富的视频特征(如场景偏移、情感、运动和语义)和音乐特征(如和弦、调性、响度和音符密度)。
表现力音乐生成
:该框架能够生成和弦序列,并允许在后续阶段调整音乐的表现力,如节奏和音量的变化,通过基于双向 GRU(bi-GRU)模型根据视频特征来估计音符密度和响度。
Video2Music 在音乐-视频对应关系和和弦预测准确性方面的表现优于现有基线模型,通过在新提出的 MuVi-Sync 数据集上的实验,该框架展示了其在多模态生成系统中的显著进步。
Paper Piano:面向所有人的网络摄像头驱动虚拟钢琴体验