English
当前您的位置: 当前位置: 首页 > 新闻动态 > 正文

我院殷亚凤老师课题组在长手语视频分割领域取得新进展

发布日期:2026-10-08 浏览量:

我院殷亚凤老师课题组近期在长手语视频句子级分割领域取得新进展:提出了一种基于视觉差异感知的视频分割框架,在无需文本标注辅助的情况下,仅依靠视觉信息,将连续手语视频划分为语义连贯的句子级片段。该方法结合时序变化建模与全局句子数量预测,为面向长视频场景的手语识别与翻译提供了新的技术支持。

Seeing Semantic Shift: Difference-Aware Sentence-Level Temporal Segmentation of Sign Language Videos。近年来,手语识别与翻译技术在单句子场景中取得了显著进展,但真实交流中的手语往往以连续表达的形式出现。如何识别句子边界,为长视频自动“断句”,是支撑后续手语理解的重要环节。然而,手语句子之间的转换通常自然流畅,缺少明显停顿,仅依靠静态画面难以准确判断边界;并且依赖标注文本辅助的分割方法,也难以适用于缺少配套文本的场景。针对上述问题,该研究提出了基于视觉差异感知的分割框架SignShift,通过时序差分建模与句子数量预测,仅依靠视觉信息检测连续手语视频中的句子边界。首先,设计多尺度时序差分模块,分别从整体视频、手部和面部特征中提取不同时间间隔下的帧间差异,增强对句间转换的感知能力。其次,设计时序分割模块,推测每一帧作为句子结束位置的概率,定位潜在的句间转换;并设计句子数量预测模块,通过聚合整段视频的时序信息,估计视频包含的句子总数。最后,引入边界选择模块,结合逐帧边界概率与预测的句子数量确定句子级视频边界,缓解过渡分割和欠分割问题。公开数据集上的实验表明,SignShift能够仅依靠视觉信息有效定位手语句子边界。

该项研究工作已被The 34th ACM International Conference on Multimedia(ACM MM 2026,CCF-A类会议)录用。欢迎感兴趣的学术同行来信交流:yafeng@nju.edu.cn.

苏州校区

地址:苏州市太湖大道 1520 号

邮编:215163    邮箱:ise@nju.edu.cn

版权所有:南京大学智能软件与工程学院Copyright © All Rights Reserverd

网站制作:南京大学智能软件与工程学院