近日,镜识科技发布灵巧手VIVA,全球首次实现了实时人机四手联弹,机器人不再只是"弹得准",而是真正"弹得好"。并宣布完成VIVA×CADA阶段里程碑,机器人音乐智能迈入"会创作、能演奏、可持续学习"的新阶段,机器人从简单执行预置动作升级为具备艺术表达与创作能力的演奏伙伴。
关于命名,镜识科技透露,“VIVA”源自拉丁语词根viv‑,寓意“活着、生命力”,亦呼应音乐术语vivace,代表活泼昂扬、富有生命力的演奏状态,同时致敬经典曲目《Viva La Vida》。而为VIVA赋予“思想”的CADA,取名自古典音乐术语Cadenza(华彩乐段),象征演奏者挥洒技艺、自由抒发音乐表达的高光时刻。VIVA×CADA,寄寓美好期许:Viva cada dia(巴西葡萄牙语)—— 享受每一天。
VIVA破解"不可能三角":从硬件根源突破行业瓶颈

在灵巧手领域,力量、速度、灵巧长期以来被视为"不可能三角":功率的限制导致力量与速度之间必须权衡,而更高的自由度缺限制了每个驱动的功率上限。镜识科技选择以人手为标杆,通过正向设计破解这一难题:采集并分析人类钢琴家的演奏数据,提取核心设计指标,理论建模并拓扑优化机械设计。最终,无论是复杂手型变换、多指尖协同配合还是精细轨迹控制,都能达到与人手相近的运动能力边界。

灵巧手VIAVA
统合三者的关键在于首创的腱绳-连杆复合式传动系统:腱绳传动将驱动器后置、减轻远端质量,使手指获得高速度;机械连杆保证刚度与力的精确传递,支撑指尖大输出;复合传动则精准复现人手关节的自然协同规律,让每一次落键、抬指都贴合真人演奏的运动轨迹,告别机械生硬的动作质感,实现自然运动表现。在此基础上,高性能驱动系统令关节转速突破1000°/s,单指指尖峰值力达33N——既能实现快节奏的指法变换,也能爆发强奏力度,覆盖完整音量动态范围;快速音阶、颤音、重复音等高难度技法均可稳定实现,为人机实时合奏这类对时序与力度要求极高的场景提供了充足性能保障。专业钢琴演奏对机械手同时提出了力量、速度、灵巧三方面极端的性能要求。与人类协同配合演奏的高难度曲目《康康舞曲》,正是我们攻克灵巧手不可能三角时所吹起的号角。
VIVA × CADA:VIVA是灵巧演奏家,CADA是音乐具身大模型

让VIVA真正"拥有思想"的,是镜识科技自研的CADA音乐具身大模型。如果说VIVA是演奏音乐的"身体",那么CADA就是赋予VIVA音乐能力的"大脑"。CADA打通了从音乐理解、音乐创作到具身演奏、反馈学习的完整闭环:首先通过通用大模型理解人的自然语言指令与音乐意图,再由音乐生成模型完成旋律、编曲的创作,并通过演奏策略模型将抽象的音乐表达转化为具体的指法、触键、力度与时序控制指令,最终由VIVA灵巧手在真实钢琴上完成演奏。
更关键的是,每一次演奏都不是结束。系统持续感知实际演奏产生的声音、动作与表现结果,对比目标与实际效果进行误差分析和策略调整,形成"创作—演奏—感知—评估—学习"的持续闭环。机器人不只是执行一次任务,而是在真实环境中不断积累经验、优化技能,让同一首曲目越弹越好。本次发布中所演奏的《Vivala Vida:Nueva Vida》正是由该大模型与人交互下生成的曲目,由机器人自主完成学习与校正,表达出属于它的浪漫。
让机械拥有生命,让音乐成为表达
团队表示,VIVA所代表的不只是一个能够弹奏钢琴的机械手:机械本身是冰冷的,但当它触碰琴键、控制力度、感受旋律,并最终将音乐呈现出来时,机械开始拥有丰富情绪的表达。

在镜识科技看来,音乐是高度融合认知、创造、表达与精密操作的场景,是探索大模型与机器人深度融合的理想载体。通用大模型提供理解、推理与交互能力,场景专用模型将通用智能快速转化为专业技能,机器人本体负责真实世界执行,而持续的环境反馈让技能不断进化——这也是未来机器人发展的重要方向。从"理解音乐并弹奏音乐"出发,团队希望最终让机器人具备理解、创造、行动、交互与持续学习的能力。

让机器拥有身体,让身体涌现思想,让思想能被听见。VIVA × CADA的阶段里程碑,让机器人从"执行动作"走向"艺术表达",推动智能从数字世界走向物理世界。








