EyeCue:眼动+自我中心视频融合的认知分心检测框架
论文信息
- 标题:Driver Cognitive Distraction Detection via Gaze-Empowered Egocentric Video Understanding
- 作者:JinYi Yoon, Matthew Corbett, Abhijit Sarkar, Bo Ji
- 会议:arXiv 2026
- 链接:https://arxiv.org/abs/2605.07859
- GitHub:https://github.com/langzhang2000/EyeCue
核心创新
首次将时间序列眼动数据与自我中心视频融合,实现非侵入式认知分心检测。 EyeCue提出”眼动-上下文交互”建模思路,解决了认知分心难以检测的难题。
背景:认知分心检测的难点
驾驶分心分为三类:
| 类型 | 定义 | 检测难度 | 现有方案 |
|---|---|---|---|
| 手动分心 | 手离开方向盘(如拿手机) | 低 | 摄像头检测肢体动作 |
| 视觉分心 | 视线偏离道路(如看导航) | 中 | 摄像头检测视线方向 |
| 认知分心 | 思维游离,视线仍在道路 | 高 | EEG/问卷(侵入式) |
认知分心最难检测:驾驶员眼睛看着道路,但脑子在想别的事情。传统方法需要戴EEG头环或做检测响应任务,干扰正常驾驶。
核心洞察
研究发现在正常驾驶与认知分心时,眼动模式有显著差异:
- 正常驾驶: 注视点广泛分布在环境中(红绿灯、行人、路牌)
- 认知分心: 注视点集中在特定区域,与驾驶任务无关
graph LR
A[驾驶员眼动数据] --> B{注视点分布}
B -->|广泛分布| C[正常驾驶]
B -->|集中固定| D[认知分心]
E[自我中心视频] --> F[视觉上下文]
F --> G[理解注视对象]
A + E --> H[EyeCue模型]
H --> I[分心状态判断]
EyeCue架构
三大模块
flowchart TB
subgraph 输入
V[自我中心视频]
G[眼动坐标序列]
end
subgraph VideoEncoder[视频编码器]
V --> V1[基于眼动的视频预处理]
V1 --> V2[TimeSformer/VideoMAE]
V2 --> V_CLS[v_CLS 全局特征]
V2 --> P[patch tokens 细粒度特征]
end
subgraph GazeEncoder[眼动编码器]
G --> G1[坐标嵌入]
G1 --> G2[Transformer]
G2 --> G_CLS[g_CLS 全局注视模式]
G2 --> G_T[g_t 帧级注视特征]
end
subgraph GDSQ[眼动驱动语义查询]
P --> S[注视区域patch选择]
G_T --> Q[Query]
S --> K[Key/Value]
Q --> CA[交叉注意力]
CA --> S_CLS[s_CLS 交互特征]
end
V_CLS --> F[特征拼接]
G_CLS --> F
S_CLS --> F
F --> MLP[MLP分类器]
MLP --> Y[分心/正常]
1. 视频编码器(Video Encoder)
- 输入:自我中心驾驶视频(第一人称视角)
- 预处理:基于眼动的三种策略
- 点叠加(Dot Overlay):在注视点画绿点
- 热力图掩码(Heatmap Mask):显示注视分布
- 裁剪帧(Cropped Frame):聚焦注视区域
- 骨干网络:TimeSformer-K600 或 VideoMAE-K400
- 输出:
v_CLS:全局场景表示patch tokens:细粒度视觉特征
2. 眼动编码器(Gaze Encoder)
- 输入:眼动坐标序列
C = {(x_t, y_t)}_{t=1}^n - 处理:
- 坐标投影到与视频patch相同嵌入空间
- 添加可学习的类别token
- 轻量级Transformer编码器(8头注意力,1层)
- 输出:
g_CLS:全局注视模式g_t:帧级注视特征
3. 眼动驱动语义查询(GDSQ)
核心创新模块,建模眼动-视觉上下文交互。
算法流程:
1 | |
直觉解释:
- 眼动特征作为Query:驾驶员用眼睛”问”环境是什么
- 注视区域patch作为Key/Value:环境”回答”驾驶员看到什么
- 通过交叉注意力建模这种”问-答”交互
分类
拼接三个token:[v_CLS, g_CLS, s_CLS] → MLP → 分心/正常
CogDrive数据集
数据集构建
为解决数据集不足问题,作者整合四个现有数据集:
| 数据集 | 场景 | 注视数据 | 视频 |
|---|---|---|---|
| DR(eye)VE | 高速/城市 | ✓ | ✓ |
| BDD-A | 多样化 | ✓ | ✓ |
| DADA-2000 | 事故场景 | ✓ | ✓ |
| TrafficGaze | 交通场景 | ✓ | ✓ |
标注协议(参照DR(eye)VE):
- 定义”正常”与”分心”标准:基于注视-上下文交互
- 两位标注员独立标注 + 领域专家审核
- 标注员一致性 >98%
数据集统计
| 指标 | 数值 |
|---|---|
| 总片段数 | 3,662 |
| 正常片段 | 2,853 |
| 分心片段 | 809 |
| 剪辑长度 | 16帧 |
场景分布
CogDrive覆盖多样化场景:
- 道路类型: 高速、城市、乡村
- 时间段: 白天、黄昏、夜晚
- 天气: 晴天、雨天、雾天
实验结果
主实验:超越所有基线
| 方法 | 准确率 | F1分数 |
|---|---|---|
| EyeCue (TimeSformer) | 74.38% | 0.72 |
| EyeCue (VideoMAE) | 72.15% | 0.70 |
| Gaze-only SVM | 58.3% | 0.55 |
| TimeSformer (仅视频) | 65.2% | 0.62 |
| EgoVideo | 66.8% | 0.64 |
| InternVideo2 | 67.5% | 0.65 |
| Video-LLaVA | 63.4% | 0.60 |
| GazeGPT | 61.2% | 0.58 |
| GazeLLM | 59.8% | 0.56 |
结论: EyeCue比最强基线(InternVideo2)提升7%,证明眼动-上下文交互建模的有效性。
跨数据集泛化
采用留一数据集评估(Leave-One-Dataset-Out):
| 测试集 | 训练集 | 准确率 |
|---|---|---|
| BDD-A | DR(eye)VE + DADA-2000 + TrafficGaze | 71.2% |
| DADA-2000 | DR(eye)VE + BDD-A + TrafficGaze | 70.8% |
| DR(eye)VE | BDD-A + DADA-2000 + TrafficGaze | 73.5% |
结论: 在未见过的数据集上仍能保持>70%准确率,证明强泛化能力。
各模块贡献
| 配置 | 准确率 |
|---|---|
| 仅视频编码器 | 65.2% |
| + 眼动编码器 | 69.5% |
| + GDSQ | 74.38% |
结论: GDSQ模块贡献最大(+4.88%),证明眼动-上下文交互建模的关键作用。
视频预处理策略对比
| 预处理方式 | 准确率 |
|---|---|
| 无预处理 | 71.2% |
| 点叠加 | 72.5% |
| 热力图掩码 | 73.1% |
| 裁剪帧 | 74.38% |
结论: 裁剪帧策略最优,聚焦注视区域减少无关噪声。
代码复现
环境配置
1 | |
模型实现
1 | |
推理流程
1 | |
IMS应用启示
1. 系统架构设计
flowchart TB
subgraph 数据采集
AR[AR眼镜/车载摄像头]
ET[眼动追踪模块]
end
subgraph 预处理
VF[视频帧提取]
GP[注视点坐标]
GC[基于注视裁剪]
end
subgraph 模型推理
VE[视频编码器]
GE[眼动编码器]
GDSQ[GDSQ模块]
end
subgraph 输出
SCORE[分心分数]
ALERT[警报触发]
end
AR --> VF
ET --> GP
VF --> GC
GP --> GC
GC --> VE
GP --> GE
VE --> GDSQ
GE --> GDSQ
VE --> FUSION[特征融合]
GE --> FUSION
GDSQ --> FUSION
FUSION --> SCORE
SCORE --> ALERT
style ALERT fill:#ff6b6b
2. 硬件需求
| 组件 | 规格 | 作用 |
|---|---|---|
| AR眼镜 | Meta Aria Gen 2 / HoloLens | 自我中心视频采集 |
| 眼动追踪 | Tobii Eye Tracker / 内置 | 注视点坐标 |
| 计算单元 | Snapdragon Ride / Orin-X | 模型推理 |
| 内存 | ≥8GB | 视频缓冲 |
3. 实时性优化
模型压缩:
- TimeSformer → 蒸馏到轻量级模型
- INT8量化减少内存占用
流水线优化:
1 | |
4. Euro NCAP 2026合规
| 要求 | EyeCue方案 | 合规性 |
|---|---|---|
| 非侵入式 | 仅需AR眼镜/摄像头 | ✅ 符合 |
| 实时检测 | 30fps推理速度 | ✅ 符合 |
| 多场景泛化 | CogDrive验证 | ✅ 符合 |
| 分心检测 | 准确率74.38% | 🟡 待提升 |
5. 局限与改进方向
局限:
- AR眼镜普及率低,依赖特殊硬件
- 准确率74%仍有提升空间
- 未考虑疲劳叠加效应
改进方向:
- 无眼镜方案: 用中控摄像头替代AR眼镜,重建驾驶员视角
- 多模态融合: 加入方向盘扭矩、车速等车辆信号
- 时序建模增强: 使用Transformer-XL建模长时依赖
- 主动学习: 在线适应个体驾驶员习惯
6. 部署路线图
gantt
title EyeCue IMS集成路线图
dateFormat YYYY-MM-DD
section 原型验证
数据采集系统搭建 :a1, 2026-01-01, 30d
模型离线验证 :a2, after a1, 20d
section 系统集成
嵌入式部署优化 :b1, after a2, 30d
实时推理流水线 :b2, after b1, 20d
section 验证测试
实车数据采集 :c1, after b2, 30d
Euro NCAP场景测试 :c2, after c1, 20d
section 量产准备
功能安全认证 :d1, after c2, 30d
SOP准备 :d2, after d1, 20d
总结
EyeCue首次实现非侵入式认知分心检测,通过眼动-上下文交互建模突破传统方法局限。74.38%的准确率证明方法有效性,为Euro NCAP 2026认知分心检测要求提供可行方案。
关键要点:
- 认知分心可用眼动模式识别(注视点集中 vs 广泛分布)
- 眼动-视频融合优于单模态方法
- GDSQ模块是性能提升的关键
- 需配合AR眼镜或第一人称摄像头部署
IMS开发优先级:高
EyeCue:眼动+自我中心视频融合的认知分心检测框架
https://dapalm.com/2026/07/17/2026-07-17-01-EyeCue-Cognitive-Distraction-Gaze-Egocentric/