我院殷亚凤老师课题组近期在手语理解与生成领域取得新进展:提出了一种支持手语翻译与手语生成的双向生成统一框架Uni-SLTP,将“手语到文本”的手语翻译和“文本到手语”的手语生成统一为条件自回归序列生成任务。该方法通过构建兼顾语义与动作细节的手语离散表示,使同一模型能够同时支持两个方向的生成任务,为手语翻译与生成的统一建模提供了新的技术路径。

图1:Uni-SLTP框架图
Bridging the Gap Between Semantics and Reconstruction: Unifying Sign Language Translation and Production。 手语翻译和手语生成是手语研究中的两个重要任务。前者强调从连续手语动作中提取语义并生成文本,后者则需要根据文本恢复细粒度动作。现有研究通常针对两个任务分别设计模型,而近年来的统一手语模型主要集中于孤立手语识别、连续手语识别和手语翻译等“手语到文本”方向。相比之下,将手语翻译和手语生成统一建模更加困难:一方面,两者具有相反的模态转换方向;另一方面,手语翻译更关注高层语义信息,而手语生成还需要保留足够的动作细节以实现准确重建。针对这一问题,该研究提出了Uni-SLTP统一框架。一方面,设计语义-重建引导的残差向量量化方法SR-RVQ,通过分层离散表示兼顾高层语义和细粒度动作信息;另一方面,将手语和文本表示纳入统一的自回归生成模型,把两个方向统一为条件序列生成任务,使同一模型能够同时完成手语翻译与手语生成。该研究在Phoenix14T和CSL-Daily两个公开手语数据集上开展实验。实验结果表明,Uni-SLTP在两个数据集上所生成的手语在语义一致性和动作精度均取得更优结果,同时在仅使用姿态输入的手语翻译设置下保持了具有竞争力的性能。

图2:语义-重建引导的残差向量量化方法SR-RVQ框架图
该项研究工作已被The 34th ACM International Conference on Multimedia(ACM MM 2026,CCF-A 类会议)录用,并入选会议Oral Presentation。欢迎对该研究工作感兴趣的学术同行来信交流:yafeng@nju.edu.cn.