要让机器理解一次钢琴演奏,需要同时看见手怎么落键、身体怎么用力、琴键何时发声,还要能逐音对上乐谱。现有数据集却往往只占其中一两样:有的只有音频和MIDI,有的只有单视角视频,有的缺指法、缺身体动作。首尔国立大学、韩国科学技术院(KAIST)与雅马哈(Yamaha)联合发布了SKY-Piano一个多模态钢琴演奏数据集,把真实弹奏的手、身体、音频、MIDI、乐谱和指法标注放进同一条时间轴。
数据来自7位职业钢琴家与12位业余演奏者,共19人,演奏35首曲目,合计11.0小时。据论文对照,它是现有同类数据集中唯一同时具备真实弹奏的手、真实身体、最多4个同步视角、音频、MIDI、乐谱与指法标注的数据集。录音用雅马哈Disklavier自动演奏钢琴,MIDI直接从琴内读出,按键力度和踏板动作逐键记录。
四台相机加两套动捕,把演奏现场搬回实验室
现场布置4台硬件同步相机,从顶部、左侧、右侧和低右角拍摄,覆盖键盘、双手和上半身,视频为4K、每秒60帧。手部动作由带8台红外相机的光学动捕系统捕捉:每只手贴23个4毫米反光标记点,从指尖、指关节、手腕到肘部和肩部,双臂共46个,采样率120赫兹;身体由另一套动捕系统配合17关节模型记录。
图1:手部与身体两套动捕的标记布局:每只手 23 个反光点从指尖一路排到肘、肩锚点,中间面板是记录头颈、躯干与四肢的 17 关节身体骨架。
后期用广播级时间码给所有数据流打同一时戳;音频与MIDI对齐核对精度约3毫秒。发布视频对人脸做了匿名化,动捕数据提供保留缺失标记与模型插补两个版本。
一条流水线把七种模态对齐到同一时间轴
原始录音先按时间码切成独立演奏片段,再通过腕部速度互相关和坐标变换,把手部、身体两套动捕统一到同一坐标系;MIDI按静音间隙分曲,用符号指纹自动辨认曲目并人工复核。乐谱方面,每首曲子的MusicXML经自动音符匹配与演奏MIDI逐音对齐,并由音乐学者人工核验。
图2:预处理流水线先按时间码或腕部速度相关性切段、对齐手部与身体坐标并按曲目分包,再并行做缺失插补、关节运动学解算与逐音伪指法标注,产出包含乐谱在内的逐曲发布包。
为方便浏览,团队还做了一个交互式网页浏览器,乐谱、手部与身体动作、俯拍视频、音频和MIDI在同一时间轴上联动,伪指法直接以彩色覆盖在按下键的指尖上。
三层指法标注:确定的直接给,不确定的标出来
指法标注最吃功夫。思路很直接:音符发声那一刻,落在目标琴键里、深度最低的指尖就是按键手指。流程分三层:第一层用几何规则判定;第二层对多候选和无候选情况,用指尖下探证据在25毫秒窗口内复核;仍有歧义的交给循环网络补全,每个音符都带来源标记——算法判定、模型插补或存疑。
在职业演奏者的11万3千多个MIDI音符上,91.4%能在发声前后50毫秒内检测到指尖进入目标键区,注册击键时指尖中位深度为键面下10.1毫米,说明记录的是真实下键而非悬空靠近。人工审核的2269个音符上,严格匹配精度94.5%、覆盖94.0%;对照工作PianoVAM只覆盖约82%,SKY-Piano用第三层把覆盖补到100%。
图3:指法标注分三层推进,从证据明确的音符到歧义音符,并保留单候选、多候选、无候选的歧义报告。
数据集对比与微调实验
论文用一张对照表盘点七个已有数据集:有的缺身体动作,有的只有单视角视频,有的完全没有指法,SKY-Piano是唯一在真实手、真实身体、多视角、音频、MIDI、乐谱和指法各项全部齐备的。
图4:SKY-Piano与七个现有钢琴数据集的模态对照,勾叉之间可以看出各数据集缺在哪一环。
价值不只在规模。团队把一个从MIDI生成手部动作的现成模型拿到新数据上测试,零样本时21个手部关节平均位置误差65.9毫米;在职业组上做留一钢琴家交叉验证微调后降到48.8毫米,下降25.9%,说明这批数据能把既有模型适配到真实动捕坐标上。
11小时之后,下一步走向更多乐器与应用
数据集已通过项目页面发布,附带交互浏览器和流水线代码,可用于音频转谱、视听结合转谱、自动指法估计、演奏技能分层分析和动作生成。所有录制经KAIST伦理审查批准,参与者签署了覆盖各模态公开范围的知情同意书。
也要看到边界:19位演奏者规模仍属小样本,曲目集中在西方古典与技术练习;指法标签是带歧义标记的自动伪标注,而非逐音人工真值。后续若能扩大覆盖面、引入更多音乐传统,并把伪标注逐步替换为人工审核,这套数据才更有条件支撑从看懂弹奏到教会机器弹琴的研究。