HyperAIHyperAI

Command Palette

Search for a command to run...

面向隐私保护的课堂事件识别:鲁棒且高效的运动推理方法

Paritosh Parmar Landy Lan Hong Yang Chen Yi Chiat Pin Tay

摘要

计算机视觉能否让课堂更安全?在这项初步研究中,我们探索了基于闭路监控风格观测的、隐私感知且计算高效的课堂事件识别。该场景的研究尚不充分,现有基准有限,且鲜有方法能同时满足现实部署对隐私、效率和泛化能力的要求。我们引入了一个新颖的混合基准,将生成式闭路监控风格视频与真实课堂姿态数据相结合,并提出了一个轻量但鲁棒的运动推理框架。该框架的动机源于观察到许多事件在运动方向、速度、加速度和强度上的差异远大于仅姿态上的差异。为此,我们的方法首先构建人体动作的层次化运动学表示,然后将一个大型教师模型中的层次化多阶运动推理知识蒸馏到一个更小的单阶学生模型中,从而在保持丰富运动理解能力的同时,实现对每个人的高效推理。实验表明,我们的模型以不到十分之一的计算成本,在性能上超越了规模大得多的基线模型,同时展现出更强的域外运动推理能力和零样本合成到真实场景的泛化能力。我们将公开发布该基准、代码库及辅助工具,以促进隐私保护课堂安全领域的进一步研究。

一句话总结

来自新加坡科技研究局高性能计算研究所的研究人员提出了一种混合基准,将生成式闭路电视风格视频与真实课堂姿态数据配对,并设计了一个轻量级运动推理框架,将层次化运动学推理从大型教师模型蒸馏到紧凑的单阶学生模型中,实现以不到大型基线模型十分之一的计算成本进行高效的逐人推理,同时在隐私感知的课堂事件识别中展现出强大的域外运动推理能力和零样本合成到真实场景的泛化能力。

核心贡献

  • 提出了一个面向隐私感知课堂事件识别的混合基准,结合生成式闭路电视风格视频与真实课堂姿态数据,针对跌倒、打斗和奔跑等罕见的安全关键行为。
  • 提出了一个轻量级运动推理框架,构建层次化运动学表示,并将多阶运动知识从大型教师模型蒸馏到紧凑的单阶学生模型中,实现高效的逐人推理。
  • 实验表明,蒸馏后的模型在不到十分之一的计算成本下超越了规模更大的基线模型,并展现出更强的域外运动推理能力以及零样本合成到真实场景的泛化能力。

引言

对课堂安全事件(如跌倒、打斗和奔跑)进行自动监控对于及时干预和厘清责任至关重要,但人工审查闭路电视画面易出错且不可持续。此前教育计算机视觉领域的研究主要关注参与度、注意力和评估,事件识别在很大程度上未被探索,缺乏专用基准,且面临天花板安装的摄像头视角、未被充分研究的儿童与成人交互以及原始视频带来的隐私问题等挑战。作者通过引入一个结合合成视频与真实视频的闭路电视视角课堂事件识别基准,并提出了一个轻量级、保护隐私的框架来解决这一空白,该框架基于骨骼姿态数据而非原始图像运行,在性能上优于现有的基于姿态的基线模型,同时能够从合成视频泛化到真实场景。

数据集

作者构建了一个课堂事件识别数据集,由两个互补的子集组成:

  • 合成视频子集(1,296 个片段):基于 Kling 和 Seedance 视频模型构建的生成管线生成。提示词经过精心设计,以复现学前班闭路电视画面,包括天花板安装的摄像头角度、典型教室物体和学生尺寸。通过人机协同的图像生成方式创建校服素材库,每个素材均经过人工验证,确保与真实校服一致。该管线还生成非校服的变化版本。每个视频均经过三位评审员的质量检查,评估视觉真实感、时序一致性、运动保真度和动作语义。最后,由学前班教师验证样本,并使用自定义标注工具标注动作标签及其时间边界。

  • 真实姿态子集(574 个序列):从真实学前班采集。仅从闭路电视视频数据中提取匿名化骨架关键点,不发布原始视频。使用相同的标注工具标注动作标签和时间边界,所有标注均由学前班教师验证。

  • 动作类别:七个事件类别(跌倒、出拳、跳跃、踢、投掷、奔跑、坐下)以及一个用于非事件课堂活动的背景元类别。

  • 数据使用方式:该数据集用于训练和评估课堂事件识别模型。合成视频提供多样化、可控的视觉示例,真实姿态序列则提供来自真实课堂环境的真实运动模式。

  • 处理细节:标注工具预加载估计的骨架姿态以减少人工工作量。未采用明确的裁剪策略;处理重点在于基于提示的生成、质量检查和教师主导的验证。发布的数据集仅包含合成视频和经批准的真实姿态关键点,不包含任何个人身份信息。

方法

为应对获取适合课堂事件识别数据的挑战,作者利用生成式人工智能生成逼真的合成视频。数据集生成管线首先构建素材库(例如校服),采用最先进的图像生成器并通过人机协同过程完成。这些素材与精心设计的提示词(模拟典型闭路电视摄像头安装位置和视角)一同输入视频生成器,以条件生成课堂视频。每个生成的视频在纳入最终数据集之前,均需经过多位评审员的人工质量检查,确保视觉真实感、时序一致性和动作语义正确性。

所提出的识别系统旨在仅从姿态序列中识别安全相关事件,减少对原始视觉数据的依赖并保护隐私。如框架图所示,该系统在不访问原始视频的情况下处理从闭路电视画面中提取的姿态轨迹,将其输入基于姿态的课堂事件识别模型以预测动作类别。

为捕捉动作的动态特性,作者引入了一种结合关节位置、速度和加速度的层次化运动学表示。然而,计算高阶运动学特征可能会放大低阶姿态估计中存在的误差。如下图所示,未经处理的求导会导致速度和加速度幅度中的显著噪声放大。为缓解这一问题,作者在计算导数之前应用了时序预处理,包括对缺失坐标进行线性插值以及使用 Savitzky-Golay 滤波器进行平滑处理。

为每个运动学阶次实例化一个统一的动作识别模型,各阶次专用的骨干网络分别在关节位置、速度和加速度上独立训练。为获得稳健的联合表示,这些骨干网络的潜在表示通过加权平均进行融合:

ϕmultiorder=m=0Mwmϕmm=0Mwm\phi_{\mathrm{multi-order}} = \frac{\sum_{m=0}^{M} w_m \phi_m}{\sum_{m=0}^{M} w_m}ϕmultiorder=m=0Mwmm=0Mwmϕm

其中 MMM 为运动学阶次的数量,ϕm\phi_mϕm 为阶次 mmm 的表示,wmw_mwm 为融合权重。

为降低推理成本以便在资源受限设备上部署,作者采用了一个多目标知识蒸馏框架。如下图所示,完整方法将多阶融合教师模型蒸馏到一个轻量级单流学生模型中,该学生模型仅对零阶关节位置特征进行操作。

学生模型使用两个互补的目标进行训练。首先,基于 Kullback-Leibler 散度的蒸馏损失将学生模型的软化类别概率分布与教师模型对齐:

LKD(ps(τ),pt(τ))=τ2jpjt(τ)logpjt(τ)pjs(τ)\mathcal{L}_{KD}(p^s(\tau), p^t(\tau)) = \tau^2 \sum_j p_j^t(\tau) \log \frac{p_j^t(\tau)}{p_j^s(\tau)}LKD(ps(τ),pt(τ))=τ2jpjt(τ)logpjs(τ)pjt(τ)

其次,使用真实标签的标准分类损失保留直接监督:

LCls(ps(1),y)=jyjlogpjs(1)\mathcal{L}_{Cls}(p^s(1), y) = \sum_j -y_j \log p_j^s(1)LCls(ps(1),y)=jyjlogpjs(1)

最终的多目标训练损失将这两项结合在一起:

LMTL=λKDLKD+λClsLCls\mathcal{L}_{MTL} = \lambda_{KD} \mathcal{L}_{KD} + \lambda_{Cls} \mathcal{L}_{Cls}LMTL=λKDLKD+λClsLCls

这一过程从两个维度对模型进行压缩:从多阶输入到单一零阶数据流,以及从较大的教师网络到显著更小的学生网络。

实验

评估使用合成课堂事件数据集来测试用于基于骨架的动作识别的教师-学生蒸馏框架,该框架融合了关节位置、速度和加速度等多阶运动学线索。与代表性方法的比较表明,轻量级学生模型优于更重的基线模型,而零样本迁移到真实场景的结果则展现了更强的跨域泛化能力,这得益于其对运动敏感表示而非视觉外观的依赖。消融研究证实,所有运动学阶次提供了互补信息,将多阶教师模型蒸馏到紧凑的学生模型中使后者能够超越其更大的教师模型,其中最优的损失平衡和融合权重是实现这一改进的关键。

所提出的方法在合成课堂事件数据集上取得了最高准确率,超越了包括 PoseC3D 在内的所有基线模型,而参数数量仅为后者的十分之一。由于数据集存在跨主体和跨视角挑战,所有模型的准确率均低于标准基准;该方法在零样本真实场景迁移中也处于领先地位,尽管仍存在领域差距。消融研究表明,通过多阶建模和蒸馏,结合关节位置、速度和加速度,使轻量级学生模型能够超越其教师模型。所提出的方法达到了 71.78% 的准确率,比 PoseC3D 高出 1.24 个百分点,比 MSG3D 高出 2.90 个百分点。其参数数量仅为 PoseC3D 的十分之一,却实现了更优的性能。所有评估方法在该数据集上的准确率均显著低于已建立的基准,凸显了课堂事件识别的难度。多阶运动线索(位置、速度、加速度)是互补的,将其蒸馏到轻量级零阶学生模型中,使得学生模型能够超越更大的教师模型。在零样本真实场景评估中,该方法仍为最佳表现者,但准确率从 71.78% 下降至 63.41%,表明存在持续的合成到真实场景的差距。

所有模型在从合成课堂视频迁移到真实课堂视频时均出现准确率下降,证实了领域差距的存在。所提出的方法取得了最高的零样本真实场景准确率,比最强基线高出超过四个百分点,比其他基线的优势更为显著,这得益于基于姿态的抽象和多阶运动蒸馏。所提出的方法达到了 63.41% 的零样本真实场景准确率,比 MSG3D 高出 4.18 个百分点,比 STGCN++ 高出 6.09 个百分点。姿态特征和多阶蒸馏有助于模型在合成到真实场景的迁移中保留与动作相关的运动模式,从而在所有比较方法中实现了最佳的跨域泛化能力。

所提出的方法在具有跨主体和跨视角挑战的合成课堂事件数据集上进行了评估,并在零样本迁移到真实课堂视频场景中进行了测试。该方法取得了最高准确率,同时参数量仅为最强基线的十分之一,验证了关节位置、速度和加速度的多阶运动建模与蒸馏到轻量级学生模型相结合,能够带来显著收益。在零样本评估中,该方法仍为最佳表现者,但准确率下降,证实了持续的合成到真实场景领域差距;尽管如此,基于姿态的抽象和多阶蒸馏在所有比较方法中提供了最佳的跨域泛化能力。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供
面向隐私保护的课堂事件识别:鲁棒且高效的运动推理方法 | 论文 | HyperAI超神经