作者介绍
胡庭恺是西南大学电子信息工程学院计算机科学与技术专业在读博士研究生,主要研究无监督毫米波雷达SAR成像,长期致力于毫米波雷达与深度学习的交叉融合研究,尤其关注技术成果的工程转化能力与商业化落地潜力,也在探索AI Agent技术在电子信息工程领域的赋能场景与应用实践。
很多雷达手势系统存在“网络很快,整机却不快”的问题,原因是Range - Doppler、微多普勒等特征图前面还存在FFT、加窗和杂波处理的阻碍。这篇工作直接采用FMCW原始复值ADC立方体,运用(2 + 1)D复值卷积在时域学习空时特征,并将Monte Carlo Dropout与Deep Ensemble引入不确定性估计。结果显示,实现了10类手势99.38%的准确率,仅约6.75k参数;在Jetson Nano上端到端2.75 ms,相对多种FFT管线总时延快4×到86×。代码和数据已公开,对于还在为预处理延迟买单的边缘雷达交互,值得认真研究这套FFT - free路线。
原论文信息
论文标题:Complex - Valued (2 + 1)D Convolutional Neural Networks for Real - Time Hand Gesture Recognition on Edge Devices with FMCW Radar
发表日期:2026年7月
发表单位:PHENIKAA University;Shibaura Institute of Technology;Vietnam National University, Hanoi
期刊:IEEE Transactions on Aerospace and Electronic Systems
通讯作者:Minhhuy Le,PHENIKAA University
手势网络很快,系统却仍在等FFT?
在近距人机交互中,FMCW雷达能在暗光、遮挡和隐私敏感场景下工作。然而在工程上,拖后腿的常常不是最后那层分类头,而是特征图流水线。一次识别若先做多维FFT、再拼Range - Doppler / 微多普勒 / 角度图,预处理可能消耗十几到上百毫秒。在论文复现对照里,有的3D RDI预处理约164 ms,而分类网络本身可能只有数毫秒。
难点具体如下:
- 预处理税高:窗长、FFT长度、重叠率都会改变端到端延迟。
- 信息被提前切块:只保留幅度谱时,相位关系容易在前端丢失。
- 噪声下要敢不敢用:交互系统不仅要类别,还要知道何时不置信。
现有路线存在典型困境:
- FFT特征 + CNN/LSTM:精度高,但边缘总延迟受前端绑定。
- 轻量频谱CNN:模型可压小,仍难绕开FFT。
- 已有Fourier - free尝试:方向正确,但精度、参数量或可部署性还不够理想。
这篇文章工作的目标明确:把雷达手势识别做成真正可在边缘实时运行的端到端复值网络,并补充不确定性。
从“先变频谱再识别”到“复值网络直读ADC”
作者将系统主线改为:原始中频复信号直接进入网络。关键判断是:与其在前端用FFT人工切出距离 - 速度图,不如让复值卷积同时利用幅度与相位,在时域学习出手势的空时结构。
FFT - free输入
雷达采用TI AWR1243,工作频率77 - 81 GHz,带宽4 GHz,3Tx×4Rx。每帧128 chirps、每chirp 64 ADC点,帧率20 fps。一个样本堆叠20帧(约1 s)原始复数据,手势距离主要在10 - 50 cm。跳过FFT意味着噪声和杂波没有被经典前端“洗干净”,所以网络必须更善于从原始域中区分出有用运动。
复值运算
复卷积按复数乘法展开实虚交叉项,随后接复批归一化和C - ReLU。分类时对复特征幅度做Softmax。这样,相位不是事后拼接通道,而是卷积归纳偏置的一部分。
(2 + 1)D因式分解控参数
完整3D复卷积参数成本较高。作者将其拆分为:
- STCV:在快时间 - 慢时间平面抽取空间/距离 - 多普勒相关结构。
- TCCV:再沿通道 - 时间融合天线维信息。
在相同设定下,(2 + 1)D CVNet约6.75k参数,传统3D CNN约17.04k,参数量大约少2.53×,准确率反而从97.93%提升到99.38%。
不确定性不是附加题
训练和推理可启用Monte Carlo Dropout,也可训练多个独立模型做Deep Ensemble。当噪声恶化时,多通行推断可用于降低盲目自信。
算法怎么跑起来?
数据与标签
共有10类:下压、上拉、逆时针、顺时针、放大、缩小、左、右、无手、静止举手(UKN)。处理后总样本约38809,8人训练、2人验证,按人划分,避免同人泄漏。
前向主路径
输入复立方体后,残差块内重复“复卷积 → 复BN → C - ReLU”,并用(2 + 1)D分解降低3D核成本;全局池化后输出10类。硬件资源落点方面,计算从“多维FFT + 实值CNN”转变为“纯网络MAC”。论文在Jetson Nano(FP16、batch = 8)测到约7.28 GMACs / 14.55 GFLOPs,网络端到端2.75 ms。FFT管线的延迟主要在于预处理,而非分类头,去掉预处理后,整机才从“看起来实时”变为“测下来实时”。
不确定性推断
- MC - D:同一模型多次dropout前向,平均概率,方差/熵作不确定度。
- DEL:多模型独立训练后平均,校准通常更好,但成本也更高。
99.38%只是分数,2.75 ms才是系统故事
在干净验证集上,(2 + 1)D CVNet准确率达99.38%。混淆矩阵里多数类别在98.1% - 100%,UKN约98.1%。在同数据复现对照中,不少FFT特征方法可达到98%左右,但参数量与总延迟通常较高;传统3D CNN直吃原始数据准确率为97.93%,仍低于复值(2 + 1)D。在公开BGT60相关集合上,该方法准确率为94.05%,高于文中ResNet - 18对照的90.78%。
真正拉开差距的是边缘总时延(Jetson Nano):
- 本方法预处理0 ms,总时延2.75 ms(约364 FPS)
- 对照FFT管线总时延常见约11.8 ms到166 ms
- 论文概括为整体快约4× - 86×
功耗方面,文中提到约4.5 W、GPU利用率约20.3%的测量口径,说明它并非依靠堆算力来实现。在噪声测试中,作者给验证集加AGWN,扫 - 5到20 dB。干净/高SNR时三种推断都接近99%、ECE约0.023,噪声加重后,MC - D与DEL相对单次前向大约有3% - 16%的准确率收益,DEL校准更好。
从工程可行性来看,雷达20 fps时帧周期50 ms。2.75 ms推理只占帧周期约5.5%,就算加上采集搬运,仍有预算做滑动窗口、投票或安全互锁。与“分类1 ms、FFT 30 - 150 ms”的系统相比,用户体感延迟会完全不同。不过,MC - D/DEL的多通行会成倍增加时延,在实时闭环里更适合“平时单次前向,低置信再触发多通行复核”。
从实验室采集到噪声应力测试
采集在室内完成,手距雷达10 - 50 cm,天线罩用低损耗介质塑料。从图中可见实验布置与类别样本分布。需要注意的边界条件有:
- 噪声是可控加性高斯白噪声,不是完整多径、电机干扰或雷达互扰。
- 距离包络偏近距,远距手势未充分验证。
- 当前是片段分类,不是连续手势切分与在线词表扩展。
即便如此,作者把总延迟测到Jetson Nano,并把代码数据公开,已经比很多“只报GPU准确率”的工作更接近工程。
边缘雷达交互“删掉FFT”之后
若模组算力有限、交互又要求低时延,FFT - free复值网络提供了一条可验证路径:把延迟预算从预处理夺回给系统逻辑。可迁移方向包括:
- 笔记本/白电近距隔空手势(0.1 - 0.5 m)。
- 辅助机器人床旁短距指令,并结合不确定度做“不确信就请求重复”。
- 其他短距FMCW时域学习任务,如近距存在检测或简单动作开关。
更大的判断是:当边缘芯片算力不再宽裕时,雷达感知的优化重点会从“更漂亮的中间特征图”,转向“哪些经典前端步骤其实可以被可学习算子替换”。
作者三问
1. 不做FFT,网络如何还能分出手势?
中频复信号里已经编码了散射点的距离相位与运动引起的时变。复值卷积保留实虚耦合,(2 + 1)D结构再分别挖掘空时图案和通道关系。FFT是一种固定基变换;这里改由数据学习更任务化的时域滤波器。
2. 2.75 ms是否意味着任意边缘芯片都能实时?
这只说明在Jetson Nano、FP16、论文设定下测到了这个数值。换到MCU或更小NPU,算子支持、内存带宽和复数量化方案都会改变。它证明的是“总链路可以不再被FFT绑架”,并非“所有硬件都自动达到2.75 ms”。
3. 有了不确定性,产品就能安全上线吗?
它提供了拒识和二次确认的信号,尤其在低SNR时有增益。但当前噪声模型偏合成,真实误触发成本还要结合连续手势、背景人体和多径场景重测。不确定度是安全机制的输入,并非安全机制本身。
作者测评
学术/科研价值
★★★★☆。把复值网络、(2 + 1)D分解、FFT - free雷达前端和不确定性估计整合到同一边缘HGR框架,并用统一数据重跑多种SOTA,证据扎实。代码数据公开进一步提高了复现价值。不过,噪声类型和远距/连续手势的研究仍偏窄,理论分析少于系统贡献。
工业/工程价值
★★★★★。少见地将“预处理时延”作为重要指标,并在Jetson Nano给出端到端2.75 ms与功耗/利用率口径。对于边缘交互,这比准确率再提升0.5个点更关键。距离工业量产还差:连续识别、远距、真实干扰和更低功耗器件移植。
商业/产品价值
★★★★☆。可以概括为:雷达手势不必先做完FFT再识别,边缘端可以几毫秒级出结果。消费电子、智慧座舱近距控制和护理机器人都可能是付费场景,且开源降低了评估成本。但商品化仍需补充手势词表扩展、误触发率与外观/结构集成验证。
可能的问题
- 距离主要在10 - 50 cm,桌面/座舱远一些的交互未充分覆盖。
- 噪声实验以AGWN为主,真实多径与硬件损伤考虑不足。
- 片段式10类分类不等于连续手势系统。
- MC - D/DEL提升稳健性的同时会增加推断成本。
- 复值算子在部分NPU/MCU工具链上支持仍不完整。
关于SuperRadar社区
`SuperRadar`是深圳承泰科技股份有限公司核心Sponsor的开放社区,聚焦感知、AI算法、多传感器融合、机器人、智能交通、工业安全、低空经济等方向,致力于通过开放技术基座、开发者工具、场景实践和生态共创,推动毫米波雷达感知技术进步与智能感知行业发展。