English
当前您的位置: 当前位置: 首页 > 新闻动态 > 正文

我院殷亚凤老师课题组在手语翻译领域取得新进展

发布日期:2026-10-08 浏览量:

我院殷亚凤老师课题组近期在手语翻译领域取得新进展:针对大语言模型应用于无标注词手语翻译时存在的视觉表征对齐困难、模型过度依赖文本信息等问题,提出了一种面向大语言模型的视觉优先手语翻译方法 SignLlama,在发挥大语言模型语言生成能力的同时,提升模型对手语视觉信息的理解与利用能力。

SignLlama: Enhancing Gloss-free Sign Language Translation by Prioritizing Visual Features for LLMs。近年来,大语言模型为手语翻译提供了新的技术路径。然而,将其直接应用于无标注词手语翻译仍面临两个关键问题:一方面,手语视频具有连续、细粒度的视觉特征,与大语言模型预训练所使用的离散文本表征存在显著差异;另一方面,现有方法通常将视觉与文本特征直接拼接进行自回归训练,容易使模型过度依赖文本信息而忽视关键的手语视觉信息。针对上述问题,该研究工作提出 SignLlama,从视觉特征学习和大语言模型训练两个层面强化视觉信息的作用。首先,提出基于过滤的伪标注词的CTC预训练策略,从翻译文本中自动构造伪标注词序列,对视觉编码器进行预训练,从而缩小手语视觉特征与文本表征之间的差异,为大语言模型提供更加有效的视觉输入。 进一步地,针对大语言模型在自回归生成过程中容易“重文本、轻视觉”的问题,提出基于视觉优先的蒸馏训练策略。该方法构建“视觉-文本预测”和“纯视觉预测”两条路径,并通过知识蒸馏来增强模型仅依赖视觉信息进行文本生成的能力,从而提升视觉信息在翻译过程中的作用。在多个公开数据集上进行的系统评测,验证了SignLlama有竞争力的翻译性能。此外,SignLlama无需额外模态或外部手语数据进行预训练,并构建了覆盖 1B至13B参数规模的一系列模型,为大语言模型在无标注词手语翻译中的应用提供了新的技术路径。

该项研究工作已被 The 34th ACM International Conference on Multimedia(ACM MM 2026,CCF-A 类会议)录用。 欢迎对该研究工作感兴趣的学术同行来信交流:yafeng@nju.edu.cn.

苏州校区

地址:苏州市太湖大道 1520 号

邮编:215163    邮箱:ise@nju.edu.cn

版权所有:南京大学智能软件与工程学院Copyright © All Rights Reserverd

网站制作:南京大学智能软件与工程学院