news 2026/7/23 6:53:52

FFT-free复值网络:边缘雷达手势识别提速4× - 86×,端到端仅2.75ms!

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
FFT-free复值网络:边缘雷达手势识别提速4× - 86×,端到端仅2.75ms!

作者介绍

胡庭恺是西南大学电子信息工程学院计算机科学与技术专业在读博士研究生,主要研究无监督毫米波雷达SAR成像,长期致力于毫米波雷达与深度学习的交叉融合研究,尤其关注技术成果的工程转化能力与商业化落地潜力,也在探索AI Agent技术在电子信息工程领域的赋能场景与应用实践。

很多雷达手势系统存在“网络很快,整机却不快”的问题,原因是Range - Doppler、微多普勒等特征图前面还存在FFT、加窗和杂波处理的阻碍。这篇工作直接采用FMCW原始复值ADC立方体,运用(2 + 1)D复值卷积在时域学习空时特征,并将Monte Carlo Dropout与Deep Ensemble引入不确定性估计。结果显示,实现了10类手势99.38%的准确率,仅约6.75k参数;在Jetson Nano上端到端2.75 ms,相对多种FFT管线总时延快4×到86×。代码和数据已公开,对于还在为预处理延迟买单的边缘雷达交互,值得认真研究这套FFT - free路线。

原论文信息

论文标题:Complex - Valued (2 + 1)D Convolutional Neural Networks for Real - Time Hand Gesture Recognition on Edge Devices with FMCW Radar

发表日期:2026年7月

发表单位:PHENIKAA University;Shibaura Institute of Technology;Vietnam National University, Hanoi

期刊:IEEE Transactions on Aerospace and Electronic Systems

通讯作者:Minhhuy Le,PHENIKAA University

手势网络很快,系统却仍在等FFT?

在近距人机交互中,FMCW雷达能在暗光、遮挡和隐私敏感场景下工作。然而在工程上,拖后腿的常常不是最后那层分类头,而是特征图流水线。一次识别若先做多维FFT、再拼Range - Doppler / 微多普勒 / 角度图,预处理可能消耗十几到上百毫秒。在论文复现对照里,有的3D RDI预处理约164 ms,而分类网络本身可能只有数毫秒。

难点具体如下:

  • 预处理税高:窗长、FFT长度、重叠率都会改变端到端延迟。
  • 信息被提前切块:只保留幅度谱时,相位关系容易在前端丢失。
  • 噪声下要敢不敢用:交互系统不仅要类别,还要知道何时不置信。

现有路线存在典型困境:

  • FFT特征 + CNN/LSTM:精度高,但边缘总延迟受前端绑定。
  • 轻量频谱CNN:模型可压小,仍难绕开FFT。
  • 已有Fourier - free尝试:方向正确,但精度、参数量或可部署性还不够理想。

这篇文章工作的目标明确:把雷达手势识别做成真正可在边缘实时运行的端到端复值网络,并补充不确定性。

从“先变频谱再识别”到“复值网络直读ADC”

作者将系统主线改为:原始中频复信号直接进入网络。关键判断是:与其在前端用FFT人工切出距离 - 速度图,不如让复值卷积同时利用幅度与相位,在时域学习出手势的空时结构。

FFT - free输入

雷达采用TI AWR1243,工作频率77 - 81 GHz,带宽4 GHz,3Tx×4Rx。每帧128 chirps、每chirp 64 ADC点,帧率20 fps。一个样本堆叠20帧(约1 s)原始复数据,手势距离主要在10 - 50 cm。跳过FFT意味着噪声和杂波没有被经典前端“洗干净”,所以网络必须更善于从原始域中区分出有用运动。

复值运算

复卷积按复数乘法展开实虚交叉项,随后接复批归一化和C - ReLU。分类时对复特征幅度做Softmax。这样,相位不是事后拼接通道,而是卷积归纳偏置的一部分。

(2 + 1)D因式分解控参数

完整3D复卷积参数成本较高。作者将其拆分为:

  • STCV:在快时间 - 慢时间平面抽取空间/距离 - 多普勒相关结构。
  • TCCV:再沿通道 - 时间融合天线维信息。

在相同设定下,(2 + 1)D CVNet约6.75k参数,传统3D CNN约17.04k,参数量大约少2.53×,准确率反而从97.93%提升到99.38%。

不确定性不是附加题

训练和推理可启用Monte Carlo Dropout,也可训练多个独立模型做Deep Ensemble。当噪声恶化时,多通行推断可用于降低盲目自信。

算法怎么跑起来?

数据与标签

共有10类:下压、上拉、逆时针、顺时针、放大、缩小、左、右、无手、静止举手(UKN)。处理后总样本约38809,8人训练、2人验证,按人划分,避免同人泄漏。

前向主路径

输入复立方体后,残差块内重复“复卷积 → 复BN → C - ReLU”,并用(2 + 1)D分解降低3D核成本;全局池化后输出10类。硬件资源落点方面,计算从“多维FFT + 实值CNN”转变为“纯网络MAC”。论文在Jetson Nano(FP16、batch = 8)测到约7.28 GMACs / 14.55 GFLOPs,网络端到端2.75 ms。FFT管线的延迟主要在于预处理,而非分类头,去掉预处理后,整机才从“看起来实时”变为“测下来实时”。

不确定性推断
  • MC - D:同一模型多次dropout前向,平均概率,方差/熵作不确定度。
  • DEL:多模型独立训练后平均,校准通常更好,但成本也更高。

99.38%只是分数,2.75 ms才是系统故事

在干净验证集上,(2 + 1)D CVNet准确率达99.38%。混淆矩阵里多数类别在98.1% - 100%,UKN约98.1%。在同数据复现对照中,不少FFT特征方法可达到98%左右,但参数量与总延迟通常较高;传统3D CNN直吃原始数据准确率为97.93%,仍低于复值(2 + 1)D。在公开BGT60相关集合上,该方法准确率为94.05%,高于文中ResNet - 18对照的90.78%。

真正拉开差距的是边缘总时延(Jetson Nano):

  • 本方法预处理0 ms,总时延2.75 ms(约364 FPS)
  • 对照FFT管线总时延常见约11.8 ms到166 ms
  • 论文概括为整体快约4× - 86×

功耗方面,文中提到约4.5 W、GPU利用率约20.3%的测量口径,说明它并非依靠堆算力来实现。在噪声测试中,作者给验证集加AGWN,扫 - 5到20 dB。干净/高SNR时三种推断都接近99%、ECE约0.023,噪声加重后,MC - D与DEL相对单次前向大约有3% - 16%的准确率收益,DEL校准更好。

从工程可行性来看,雷达20 fps时帧周期50 ms。2.75 ms推理只占帧周期约5.5%,就算加上采集搬运,仍有预算做滑动窗口、投票或安全互锁。与“分类1 ms、FFT 30 - 150 ms”的系统相比,用户体感延迟会完全不同。不过,MC - D/DEL的多通行会成倍增加时延,在实时闭环里更适合“平时单次前向,低置信再触发多通行复核”。

从实验室采集到噪声应力测试

采集在室内完成,手距雷达10 - 50 cm,天线罩用低损耗介质塑料。从图中可见实验布置与类别样本分布。需要注意的边界条件有:

  • 噪声是可控加性高斯白噪声,不是完整多径、电机干扰或雷达互扰。
  • 距离包络偏近距,远距手势未充分验证。
  • 当前是片段分类,不是连续手势切分与在线词表扩展。

即便如此,作者把总延迟测到Jetson Nano,并把代码数据公开,已经比很多“只报GPU准确率”的工作更接近工程。

边缘雷达交互“删掉FFT”之后

若模组算力有限、交互又要求低时延,FFT - free复值网络提供了一条可验证路径:把延迟预算从预处理夺回给系统逻辑。可迁移方向包括:

  • 笔记本/白电近距隔空手势(0.1 - 0.5 m)。
  • 辅助机器人床旁短距指令,并结合不确定度做“不确信就请求重复”。
  • 其他短距FMCW时域学习任务,如近距存在检测或简单动作开关。

更大的判断是:当边缘芯片算力不再宽裕时,雷达感知的优化重点会从“更漂亮的中间特征图”,转向“哪些经典前端步骤其实可以被可学习算子替换”。

作者三问

1. 不做FFT,网络如何还能分出手势?

中频复信号里已经编码了散射点的距离相位与运动引起的时变。复值卷积保留实虚耦合,(2 + 1)D结构再分别挖掘空时图案和通道关系。FFT是一种固定基变换;这里改由数据学习更任务化的时域滤波器。

2. 2.75 ms是否意味着任意边缘芯片都能实时?

这只说明在Jetson Nano、FP16、论文设定下测到了这个数值。换到MCU或更小NPU,算子支持、内存带宽和复数量化方案都会改变。它证明的是“总链路可以不再被FFT绑架”,并非“所有硬件都自动达到2.75 ms”。

3. 有了不确定性,产品就能安全上线吗?

它提供了拒识和二次确认的信号,尤其在低SNR时有增益。但当前噪声模型偏合成,真实误触发成本还要结合连续手势、背景人体和多径场景重测。不确定度是安全机制的输入,并非安全机制本身。

作者测评

学术/科研价值

★★★★☆。把复值网络、(2 + 1)D分解、FFT - free雷达前端和不确定性估计整合到同一边缘HGR框架,并用统一数据重跑多种SOTA,证据扎实。代码数据公开进一步提高了复现价值。不过,噪声类型和远距/连续手势的研究仍偏窄,理论分析少于系统贡献。

工业/工程价值

★★★★★。少见地将“预处理时延”作为重要指标,并在Jetson Nano给出端到端2.75 ms与功耗/利用率口径。对于边缘交互,这比准确率再提升0.5个点更关键。距离工业量产还差:连续识别、远距、真实干扰和更低功耗器件移植。

商业/产品价值

★★★★☆。可以概括为:雷达手势不必先做完FFT再识别,边缘端可以几毫秒级出结果。消费电子、智慧座舱近距控制和护理机器人都可能是付费场景,且开源降低了评估成本。但商品化仍需补充手势词表扩展、误触发率与外观/结构集成验证。

可能的问题
  • 距离主要在10 - 50 cm,桌面/座舱远一些的交互未充分覆盖。
  • 噪声实验以AGWN为主,真实多径与硬件损伤考虑不足。
  • 片段式10类分类不等于连续手势系统。
  • MC - D/DEL提升稳健性的同时会增加推断成本。
  • 复值算子在部分NPU/MCU工具链上支持仍不完整。

关于SuperRadar社区

`SuperRadar`是深圳承泰科技股份有限公司核心Sponsor的开放社区,聚焦感知、AI算法、多传感器融合、机器人、智能交通、工业安全、低空经济等方向,致力于通过开放技术基座、开发者工具、场景实践和生态共创,推动毫米波雷达感知技术进步与智能感知行业发展。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/7/23 6:52:57

2026年独立站平台选哪个好?海外建站平台选择指南

2026年独立站平台选哪个好?海外建站平台选择指南独立站平台选哪个好,要先看企业想解决哪类问题:是让海外客户搜到并发询盘,还是让消费者直接下单付款;是做品牌展示,还是做多语言市场覆盖;是内部…

作者头像 李华
网站建设 2026/7/23 6:50:17

简思科技行业系统解决方案:从产线到楼宇,覆盖六大行业

简思科技行业系统解决方案:从产线到楼宇,覆盖六大行业 简思科技通过状态帧可编程控制器,为纺织业、智慧楼宇、包装机械、智慧农业、非标机械等行业提供自动化控制方案。控制范围涵盖开关量、运动控制、模拟量采集、编码器信号、Modbus RTU通信…

作者头像 李华
网站建设 2026/7/23 6:49:40

PCDN技术优化:晚高峰3小时高效跑量方案

1. PCDN技术本质与运营现状PCDN(Peer to Peer Content Delivery Network)作为P2P技术与CDN网络的结合体,其核心逻辑是将传统中心化CDN节点下沉到终端用户设备。在实际业务场景中,当用户观看某视频平台内容时,其设备会同…

作者头像 李华
网站建设 2026/7/23 6:49:38

Mongo CRUD 基础实战——用户与商品管理

务场景:本地生活电商的运营团队急得跳脚——商品信息管理全靠手工 Excel,然后开发写脚本批量导入 MySQL,每次上下架都要拉开发改代码。更离谱的是,新来的运营把"已删除"和"已下架"搞混,直接删了一…

作者头像 李华
网站建设 2026/7/23 6:43:57

Cortex-M4硬故障、MPU与FPU寄存器配置实战指南

1. Cortex-M4异常与内存保护机制概览在嵌入式系统开发,尤其是基于ARM Cortex-M4这类高性能微控制器的项目中,我们常常会与两个核心的“守护者”打交道:一个是负责兜底、处理最严重错误的硬故障(Hard Fault)机制&#x…

作者头像 李华
网站建设 2026/7/23 6:34:20

AI大模型如何重构研发生命周期与程序员转型

1. 技术团队精简与AI转型的行业真相最近一份来自某大厂技术主管的爆料在圈内引发热议——该厂产研团队仅保留30%人员,其余70%将通过自然淘汰和转岗方式优化。这并非孤例,过去半年里已有至少5家头部互联网企业实施类似策略。作为亲历过三次技术变革的老兵…

作者头像 李华