zhangzjn/awesome-smart-glasses

37

26 commits

updated Oct 4, 2026

See the code

README

Smart Glasses Survey Logo From Seeing to Acting: Smart Glasses as First-Person Intelligence Platforms

Awesome list badge MIT License arXiv Hugging Face PRs welcome WeChat Group

Jiangning Zhang 1,*,✉ ,  Haojun Chen 1,* ,  Yong Liu 1

1Zhejiang University, APRIL Lab

This repository accompanies our survey From Seeing to Acting: Smart Glasses as First-Person Intelligence Platforms and maintains a structured collection of smart-glasses products/platforms, foundational capabilities, and application scenarios, which will be continuously updated.For more details, kindly refer to our paper 🚀

💬 Researchers and industry practitioners are welcome to join our WeChat group; we look forward to exchanging ideas and collaborating with you.

Survey Pipeline

📰 News

Table of Contents

🎯 Contributions

1️⃣ A formal and hardware-grounded problem definition.

We define smart glasses through a first-person observation stream, a closed-loop mapping from observation and intent to feedback, persistent state, and optional action, and a constrained utility objective that makes latency, energy, thermals, privacy, and social cost explicit. We further consolidate heterogeneous devices into eight verifiable hardware capability axes and route-aware product profiles, converting marketing categories into evidence-bearing experimental substrates.

2️⃣ A compositional capability framework with explicit evidential boundaries.

We synthesize seven interdependent capabilities: first-person perception, multimodal context, persistent spatial state, auditable personal memory, situated agentic action, embodied data interfaces, and cross-cutting deployment constraints. Building upon these building blocks, we present an L0-L5 framework that covers capture, reactive perception, contextual assistance, persistent state, governed action, and embodied coupling. The framework treats levels as task- and evidence-conditioned claims, distinguishes prerequisites from demonstrated capability, and makes clear that L5 crosses the embodiment boundary rather than simply extending the wearer-facing L0-L4 axis.

3️⃣ An application-centered evidence map.

We reorganize the literature into nine application scenes and connect each scene to its required capability loop, representative datasets and benchmarks, research systems, product entry points, affected stakeholders, failure consequences, and missing validation evidence. This structure separates transferable component evidence from direct smart-glasses evidence and clarifies why identical model functions require different thresholds in daily assistance, accessibility, industry, healthcare, education, mobility, social collaboration, spatial intelligence, and embodied intelligence.

4️⃣ A deployment and evaluation blueprint.

We formulate nine coupled design dimensions covering hardware, runtime, perception and inference, memory, feedback, external action, reliability, governance, and reproducibility. On this basis, we provide a claim-conditioned evaluation protocol, a deployment checklist, and an iterative evidence ladder that connects documentation, laboratory measurement, benchmark testing, device-stream replay, fault injection, end-to-end studies, longitudinal deployment, and privacy or security audit. We finally derive eight open challenges and six roadmap directions for building trustworthy first-person embodied-intelligence systems.

Representative Smart-Glasses Products/Platforms

Representative Smart-Glasses Products/Platforms

👓 The table below summarizes some representative smart-glasses products/platforms and their corresponding links (⏰ last update: 2026.09.06).

DateSmart-Glasses Product/PlatformLink
2020-09Project Aria Gen 1Project Aria Gen 1
2023-09Ray-Ban Meta Gen 1Ray-Ban Meta Gen 1
2024-06Even Realities G1Even Realities G1
2025-02Project Aria Gen 2Project Aria Gen 2
2025-05RayNeo X3 ProRayNeo X3 Pro
2025-05XREAL AURAXREAL AURA
2025-06Xiaomi AI GlassesXiaomi AI Glasses
2025-09Ray-Ban Meta Gen 2Ray-Ban Meta Gen 2
2025-09Meta Ray-Ban DisplayMeta Ray-Ban Display
2025-10Oakley Meta VanguardOakley Meta Vanguard
2025-11Xiaodu AI Glasses ProXiaodu AI Glasses Pro
2025-11Quark AI Glasses S1Quark AI Glasses S1
2025-11Quark AI Glasses G1Quark AI Glasses G1
2026-01Rokid AI Glasses StyleRokid AI Glasses Style
2026-01Solos AirGo V2Solos AirGo V2
2026-04RayNeo V4RayNeo V4
2026-06Snap SPECSSnap SPECS
2026-07Halliday G2Halliday G2
2026-08RayNeo iORayNeo iO
Figure: Hardware stack and hardware-based capability-axis consolidation.

Hardware Capability Axes

Foundational Capabilities for Smart Glasses

Figure: Foundational capabilities and L0-L5 cross-capability level framework.

Capabilities and L0-L5 Framework

⏰ We organize the works in chronological order, from the latest to the earliest. 🎨 Colored labels indicate seven foundational capabilities to which the work contributes: First-Person Perception, Multimodal Context Modeling, Persistent Spatial State, Auditable Long-Term Personal Memory, Situated Agentic Action, Embodied Data Interfaces, and Cross-Cutting Deployment Constraints.

CapabilitiesPaper TitleLink
Multimodal Context Modeling
Auditable Long-Term Personal Memory
VoiceMem: Streaming Dual-Brain Memory for Real-Time InteractionarXiv
Auditable Long-Term Personal MemoryEgoMonth: A Month-Level Egocentric Video Benchmark for Long-Term Spatiotemporal MemoryarXiv
Embodied Data InterfacesEgoExoMoCap: Distributed Ego-Exo Human Motion CapturearXiv
First-Person Perception
Embodied Data Interfaces
Cross-Cutting Deployment Constraints
Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied LearningarXiv
Auditable Long-Term Personal MemoryLightMem-Ego: Your AI Memory for Everyday LifearXiv
Cross-Cutting Deployment ConstraintsOpenGlass: A Sensing-Computing Split Architecture for Local MLLM-Driven Real-Time Visual AssistancearXiv
First-Person Perception
Multimodal Context Modeling
Situated Agentic Action
Cross-Cutting Deployment Constraints
EgoSAT: A Comprehensive Benchmark of Egocentric Streaming Interaction UnderstandingarXiv
Cross-Cutting Deployment ConstraintsEPIC: A System Framework for Efficient Egocentric Perception on Embodied AR GlassesarXiv
Embodied Data InterfacesEgoEngine: From Egocentric Human Videos to High-Fidelity Dexterous Robot DemonstrationsarXiv
Persistent Spatial StateSpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World TasksarXiv
Situated Agentic ActionStreaming Interventions: Can Video Large Language Models Correct Mistakes as They Occur?arXiv
Multimodal Context Modeling
Auditable Long-Term Personal Memory
H2HMem: A Multimodal Memory Benchmark for Agents in Human-Human InteractionsarXiv
Embodied Data InterfacesEgoTactile: Learning Grasp Pressure for Everyday Objects from Egocentric VideoarXiv
Cross-Cutting Deployment ConstraintsOpenGlass: Ultra-Low-Power On-Device AI Eyewear with Event-Based VisionarXiv
Embodied Data InterfacesActiveMimic: Egocentric Video Pretraining with Active PerceptionarXiv
Situated Agentic Action
Cross-Cutting Deployment Constraints
Plan, Watch, Recover: A Benchmark and Architectures for Proactive Procedural AssistancearXiv
Multimodal Context Modeling
Auditable Long-Term Personal Memory
Cross-Cutting Deployment Constraints
EGOSTREAM: A Diagnostic Benchmark for Streaming Episodic Memory in Egocentric VisionarXiv
Multimodal Context Modeling
Situated Agentic Action
Cross-Cutting Deployment Constraints
IPIBench: Evaluating Interactive Proactive Intelligence of MLLMs under Continuous StreamsarXiv
Embodied Data InterfacesHumanEgo: Zero-Shot Robot Learning from Minutes of Human Egocentric VideosarXiv
Persistent Spatial StateEgoProx: Evaluating MLLMs on Egocentric 3D Proximity Reasoning Across a Cognitive HierarchyarXiv
Multimodal Context Modeling
Auditable Long-Term Personal Memory
EgoExoMem: Cross-View Memory Reasoning over Synchronized Egocentric and Exocentric VideosarXiv
First-Person Perception
Embodied Data Interfaces
Cross-Cutting Deployment Constraints
EgoKit: Towards Unified Low-Cost Egocentric Data Collection with Heterogeneous DevicesarXiv
Persistent Spatial State
Cross-Cutting Deployment Constraints
Urban Risk-Aware Navigation via VQA-Based Event Maps for People with Low VisionarXiv
Multimodal Context Modeling
Auditable Long-Term Personal Memory
Situated Agentic Action
Personal Visual Context Learning in Large Multimodal ModelsarXiv
Auditable Long-Term Personal Memory
Cross-Cutting Deployment Constraints
Position: Life-Logging Video Streams Make the Privacy-Utility Trade-off InevitablearXiv
Multimodal Context Modeling
Auditable Long-Term Personal Memory
EgoMemReason: A Memory-Driven Reasoning Benchmark for Long-Horizon Egocentric Video UnderstandingarXiv
Situated Agentic ActionEgoPro-Bench: Benchmarking Personalized Proactive Interaction in Egocentric Video StreamsarXiv
Embodied Data InterfacesHumanNet: Scaling Human-Centric Video Learning to One Million HoursarXiv
Situated Agentic ActionPro $^2$ Assist: Continuous Step-Aware Proactive Assistance with Multimodal Egocentric Perception for Long-Horizon Procedural TasksarXiv
Situated Agentic ActionIntention-Aware Semantic Agent Communications for AI GlassesarXiv
Situated Agentic Action
Cross-Cutting Deployment Constraints
PhySE: A Psychological Framework for Real-Time AR-LLM Social Engineering AttacksarXiv
Cross-Cutting Deployment ConstraintsUNSEEN: A Cross-Stack LLM Unlearning Defense against AR-LLM Social Engineering AttacksarXiv
First-Person Perception
Persistent Spatial State
Do MLLMs Understand Pointing? Benchmarking and Enhancing Referential Reasoning in Egocentric VisionarXiv
Embodied Data InterfacesActiveGlasses: Learning Manipulation with Active Vision from Ego-Centric Human DemonstrationarXiv
Multimodal Context ModelingReshaping Inclusive Interpersonal Dynamics through Smart Glasses in Mixed-Vision Social ActivitiesarXiv
Multimodal Context Modeling
Cross-Cutting Deployment Constraints
Active Noise Cancellation on Open-Ear Smart GlassesarXiv
Situated Agentic Action
Cross-Cutting Deployment Constraints
VisionClaw: Always-On AI Agents through Smart GlassesarXiv
Auditable Long-Term Personal Memory
Situated Agentic Action
Ego-Grounding for Personalized Question-Answering in Egocentric VideosarXiv
Persistent Spatial StatePandora: Articulated 3D Scene Graphs from Egocentric VisionarXiv
Situated Agentic ActionEgo2Web: A Web Agent Benchmark Grounded in Egocentric VideosarXiv
Embodied Data InterfacesUniDex: A Robot Foundation Suite for Universal Dexterous Hand Control from Egocentric Human VideosarXiv
Persistent Spatial StateEgoForge: Goal-Directed Egocentric World SimulatorarXiv
First-Person Perception
Embodied Data Interfaces
Ego-1K--A Large-Scale Multiview Video Dataset for Egocentric VisionarXiv
Auditable Long-Term Personal Memory
Cross-Cutting Deployment Constraints
Mind the Gap: Mapping Wearer--Bystander Privacy Tensions and Context-Adaptive Pathways for Camera GlassesarXiv
Situated Agentic ActionEgocentric Co-Pilot: Web-Native Smart-Glasses Agents for Assistive Egocentric AIarXiv
First-Person Perception
Embodied Data Interfaces
Cross-Cutting Deployment Constraints
AoE: Always-On Egocentric Human Video Collection for Embodied AIarXiv
First-Person Perception
Multimodal Context Modeling
Cross-Cutting Deployment Constraints
SUPERGLASSES: Benchmarking Vision Language Models as Intelligent Agents for AI Smart GlassesarXiv
Auditable Long-Term Personal Memory
Cross-Cutting Deployment Constraints
Exploring Multimodal LMMs for Online Episodic Memory Question Answering on the EdgearXiv
Multimodal Context Modeling
Cross-Cutting Deployment Constraints
Conversational Successes and Breakdowns in Everyday Smart Glasses UsearXiv
First-Person Perception
Multimodal Context Modeling
Cross-Cutting Deployment Constraints
SAW-Bench: Learning Situated Awareness in the Real WorldarXiv
First-Person Perception
Multimodal Context Modeling
Cross-Cutting Deployment Constraints
GLIMPSE: Real-Time Text Recognition and Contextual Understanding for VQA in WearablesarXiv
Persistent Spatial State
Embodied Data Interfaces
Cross-Cutting Deployment Constraints
LEVIO: Lightweight Embedded Visual Inertial Odometry for Resource-Constrained DevicesarXiv
First-Person Perception
Cross-Cutting Deployment Constraints
Evaluating OCR Performance for Assistive Technology: Effects of Walking Speed, Camera Placement, and Camera TypearXiv
Auditable Long-Term Personal Memory
Cross-Cutting Deployment Constraints
VisGuardian: A Lightweight Group-based Privacy Control Technique For Front Camera Data From AR Glasses in Home EnvironmentsarXiv
Multimodal Context ModelingAgentic Very Long Video UnderstandingarXiv
Multimodal Context Modeling
Cross-Cutting Deployment Constraints
ROMA: Real-time Omni-Multimodal Assistant with Interactive Streaming UnderstandingarXiv
First-Person Perception
Multimodal Context Modeling
Cross-Cutting Deployment Constraints
WearVQA: A Visual Question Answering Benchmark for Wearables in Egocentric Authentic Real-World ScenariosarXiv
Embodied Data InterfacesEgoMI: Learning Active Vision and Whole-Body Manipulation from Egocentric Human DemonstrationsarXiv
Situated Agentic ActionAI for Service: Proactive Assistance with AI GlassesarXiv
Auditable Long-Term Personal Memory
Cross-Cutting Deployment Constraints
EgoTrigger: Toward Audio-Driven Image Capture for Human Memory Enhancement in All-Day Energy-Efficient Smart GlassesarXiv
Multimodal Context ModelingDailyLLM: Context-Aware Activity Log Generation Using Multi-Modal Sensors and LLMsarXiv
Embodied Data InterfacesEgoVLA: Learning Vision-Language-Action Models from Egocentric Human VideosarXiv
Multimodal Context ModelingAdaVideoRAG: Omni-Contextual Adaptive Retrieval-Augmented Efficient Long Video UnderstandingarXiv
Embodied Data Interfaces
Cross-Cutting Deployment Constraints
EgoZero: Robot Learning from Smart GlassesarXiv
Multimodal Context Modeling
Situated Agentic Action
ContextAgent: Context-Aware Proactive LLM Agents with Open-World Sensory PerceptionsarXiv
Embodied Data InterfacesEgoDex: Learning Dexterous Manipulation from Large-Scale Egocentric VideoarXiv
Multimodal Context Modeling
Auditable Long-Term Personal Memory
EgoLife: Towards Egocentric Life AssistantarXiv
Embodied Data InterfacesEgoSim: An Egocentric Multi-view Simulator and Real Dataset for Body-worn Cameras during Motion and ActivityarXiv
First-Person Perception
Multimodal Context Modeling
Cross-Cutting Deployment Constraints
Vinci: A Real-Time Smart Assistant Based on Egocentric Vision-Language Model for Portable DevicesarXiv
Embodied Data InterfacesEgoMimic: Scaling Imitation Learning via Egocentric VideoarXiv
Multimodal Context Modeling
Persistent Spatial State
Auditable Long-Term Personal Memory
Embodied Data Interfaces
OpenEQA: Embodied Question Answering in the Era of Foundation ModelsIEEE
Auditable Long-Term Personal MemoryMemoro: Using Large Language Models to Realize a Concise Interface for Real-Time Memory AugmentationarXiv
Embodied Data InterfacesEgo-Exo4D: Understanding Skilled Human Activity from First- and Third-Person PerspectivesarXiv
Cross-Cutting Deployment ConstraintsHead-Mounted Display Augmented Reality in Manufacturing: A Systematic ReviewACM DL
First-Person Perception
Multimodal Context Modeling
Situated Agentic Action
Embodied Data Interfaces
HoloAssist: An Egocentric Human Interaction Dataset for Interactive AI Assistants in the Real WorldarXiv
First-Person PerceptionEgoObjects: A Large-Scale Egocentric Dataset for Fine-Grained Object UnderstandingarXiv
First-Person Perception
Multimodal Context Modeling
Persistent Spatial State
Embodied Data Interfaces
Cross-Cutting Deployment Constraints
Project Aria: A New Tool for Egocentric Multi-Modal AI ResearcharXiv
Embodied Data InterfacesEgoPoser: Robust Real-Time Egocentric Pose Estimation from Sparse and Intermittent Observations EverywherearXiv
Multimodal Context ModelingEgoVLPv2: Egocentric Video-Language Pre-Training with Fusion in the BackbonearXiv
Persistent Spatial State
Embodied Data Interfaces
Aria Digital Twin: A New Benchmark Dataset for Egocentric 3D Machine PerceptionarXiv
First-Person Perception
Multimodal Context Modeling
EPIC-Sounds: A Large-Scale Dataset of Actions That SoundarXiv
First-Person Perception
Auditable Long-Term Personal Memory
EgoTracks: A Long-Term Egocentric Visual Object Tracking DatasetarXiv
Persistent Spatial StateLidSonic for Visually Impaired: Green Machine Learning-Based Assistive Smart Glasses with Smart App and ArduinoResearchGate
Embodied Data InterfacesAvatarPoser: Articulated Full-Body Pose Tracking from Sparse Motion SensingarXiv
Multimodal Context Modeling
Embodied Data Interfaces
Assembly101: A Large-Scale Multi-View Video Dataset for Understanding Procedural ActivitiesarXiv
First-Person Perception
Embodied Data Interfaces
Ego4D: Around the World in 3,000 Hours of Egocentric VideoarXiv
Persistent Spatial StateDROID-SLAM: Deep Visual SLAM for Monocular, Stereo, and RGB-D CamerasarXiv
Multimodal Context ModelingQMSum: A New Benchmark for Query-Based Multi-Domain Meeting SummarizationarXiv
First-Person Perception
Embodied Data Interfaces
The IKEA ASM Dataset: Understanding People Assembling Furniture through Actions, Objects and PosearXiv
First-Person Perception
Embodied Data Interfaces
Rescaling Egocentric Vision: Collection, Pipeline and Challenges for EPIC-KITCHENS-100arXiv
First-Person Perception
Persistent Spatial State
In the Eye of the Beholder: Joint Learning of Gaze and Actions in First Person VideoarXiv
Cross-Cutting Deployment ConstraintsEvaluating a Wearable Camera's Social Acceptability In-the-WildACM DL
Embodied Data InterfacesCOIN: A Large-Scale Dataset for Comprehensive Instructional Video AnalysisarXiv
Multimodal Context ModelingAVA Active Speaker: An Audio-Visual Dataset for Active Speaker DetectionarXiv
Cross-Cutting Deployment ConstraintsYour Smart Glasses' Camera Bothers Me! Exploring Opt-In and Opt-Out Gestures for Privacy MediationACM DL
First-Person Perception
Persistent Spatial State
VizWiz Grand Challenge: Answering Visual Questions from Blind PeoplearXiv
Persistent Spatial StateMatterport3D: Learning from RGB-D Data in Indoor EnvironmentsarXiv
Persistent Spatial StateVINS-Mono: A Robust and Versatile Monocular Visual-Inertial State EstimatorarXiv
Persistent Spatial StateScanNet: Richly-Annotated 3D Reconstructions of Indoor ScenesarXiv
Persistent Spatial StateNavCog: A Navigational Cognitive Assistant for the BlindACM DL
Cross-Cutting Deployment ConstraintsIn Situ with Bystanders of Augmented Reality Glasses: Perspectives on Recording and Privacy-Mediating TechnologiesACM DL
Multimodal Context ModelingThe AMI Meeting Corpus: A Pre-AnnouncementSpringer Nature

Application Scenes for Smart Glasses

⏰ For each application scene, we organize the works in chronological order, from the earliest to the latest.

4.1 Daily Situated Assistance

Paper TitleLink
Vinci: A Real-Time Smart Assistant Based on Egocentric Vision-Language Model for Portable DevicesarXiv
AiGet: Transforming Everyday Moments into Hidden Knowledge Discovery with AI Assistance on Smart GlassesarXiv
EgoLife: Towards Egocentric Life AssistantarXiv
ContextAgent: Context-Aware Proactive LLM Agents with Open-World Sensory PerceptionsarXiv
DailyLLM: Context-Aware Activity Log Generation Using Multi-Modal Sensors and LLMsarXiv
AI for Service: Proactive Assistance with AI GlassesarXiv
TeleEgo: Benchmarking Egocentric AI Assistants in the WildarXiv
WearVQA: A Visual Question Answering Benchmark for Wearables in Egocentric Authentic Real-world ScenariosarXiv
ROMA: Real-time Omni-Multimodal Assistant with Interactive Streaming UnderstandingarXiv
GLIMPSE: Real-Time Text Recognition and Contextual Understanding for VQA in WearablesarXiv
SAW-Bench: Learning Situated Awareness in the Real WorldarXiv
Exploring Multimodal LMMs for Online Episodic Memory Question Answering on the EdgearXiv
SUPERGLASSES: Benchmarking Vision Language Models as Intelligent Agents for AI Smart GlassesarXiv
Egocentric Co-Pilot: Web-Native Smart-Glasses Agents for Assistive Egocentric AIarXiv
Ego2Web: A Web Agent Benchmark Grounded in Egocentric VideosarXiv
VisionClaw: Always-On AI Agents through Smart GlassesarXiv
Intention-Aware Semantic Agent Communications for AI GlassesarXiv
EgoMemReason: A Memory-Driven Reasoning Benchmark for Long-Horizon Egocentric Video UnderstandingarXiv
Personal Visual Context Learning in Large Multimodal ModelsarXiv
EgoPro-Bench: Benchmarking Personalized Proactive Interaction in Egocentric Video StreamsarXiv
IPIBench: Evaluating Interactive Proactive Intelligence of MLLMs under Continuous StreamsarXiv
EGOSTREAM: A Diagnostic Benchmark for Streaming Episodic Memory in Egocentric VisionarXiv
EgoSAT: A Comprehensive Benchmark of Egocentric Streaming Interaction UnderstandingarXiv
OpenGlass: A Sensing-Computing Split Architecture for Local MLLM-Driven Real-Time Visual AssistancearXiv
LightMem-Ego: Your AI Memory for Everyday LifearXiv
EgoMonth: A Month-Level Egocentric Video Benchmark for Long-Term Spatiotemporal MemoryarXiv

4.2 Accessibility Assistance

Paper TitleLink
NavCog: A Navigational Cognitive Assistant for the BlindACM DL
VizWiz Grand Challenge: Answering Visual Questions from Blind PeoplearXiv
The Effectiveness of Visual and Audio Wayfinding Guidance on Smartglasses for People with Low VisionACM DL
LidSonic for Visually Impaired: Green Machine Learning-Based Assistive Smart Glasses with Smart App and ArduinoResearchGate
EgoBlind: Towards Egocentric Visual Assistance for the BlindarXiv
Exploring LLM-Based Assistants with Smart Glasses for the Visually ImpairedACM DL
Evaluating OCR Performance for Assistive Technology: Effects of Walking Speed, Camera Placement, and Camera TypearXiv
Active Noise Cancellation on Open-Ear Smart GlassesarXiv
Urban Risk-Aware Navigation via VQA-Based Event Maps for People with Low VisionarXiv

4.3 Industrial Workflow Support

Paper TitleLink
COIN: A Large-Scale Dataset for Comprehensive Instructional Video AnalysisarXiv
Smart Glasses-Based Personnel Proximity Warning System for Improving Pedestrian Safety in Construction and Mining SitesMDPI
Augmented Reality’s Impact in Industry—A Scoping ReviewMDPI
The IKEA ASM Dataset: Understanding People Assembling Furniture through Actions, Objects and PosearXiv
Augmented Reality Smart Glasses in Industrial Assembly: Current Status and Future ChallengesScienceDirect
Assembly101: A Large-Scale Multi-View Video Dataset for Understanding Procedural ActivitiesarXiv
HoloAssist: An Egocentric Human Interaction Dataset for Interactive AI Assistants in the Real WorldarXiv
Head-Mounted Display Augmented Reality in Manufacturing: A Systematic ReviewACM DL
LabOS: The AI-XR Co-scientist that sees and works with humansarXiv
Pro $^2$ Assist: Continuous Step-Aware Proactive Assistance with Multimodal Egocentric Perception for Long-Horizon Procedural TasksarXiv
Plan, Watch, Recover: A Benchmark and Architectures for Proactive Procedural AssistancearXiv
Streaming Interventions: Can Video Large Language Models Correct Mistakes as They Occur?arXiv
Toward a Full-Stack Framework for Industrial Augmented Reality: Benefits, Risks, and Design Considerations for Dependable Deployment in ManufacturingarXiv

4.4 Healthcare and Caregiving

Paper TitleLink
JHU-ISI Gesture and Skill Assessment Working Set (JIGSAWS): A Surgical Activity Dataset for Human Motion ModelingCIRL
Technical Support by Smart Glasses During a Mass Casualty IncidentPubMed
A Systematic Literature Review on Integrating AI-Powered Smart Glasses into Digital Health Management for Proactive Healthcare SolutionsNature
Development of an AI-Powered AR Glasses System for Real-Time First Aid Guidance in Emergency SituationsSpringer Nature
Smart Glasses for Older Adults With Cognitive Impairment: A Scoping ReviewPubMed Central
A Smart-Glasses for Emergency Medical Services via Multimodal Multitask LearningarXiv
Wearable AR for Restorative Breaks: How Interactive Narrative Experiences Support Relaxation for Young PeoplearXiv

4.5 Education and Skills Training

Paper TitleLink
Cross-Task Weakly Supervised Learning from Instructional VideosarXiv
Evaluating the Effectiveness of Learning Design with Mixed Reality in Higher EducationSpringer Nature
Augmented Reality in Medical Education: A Systematic ReviewPubMed Central
Rescaling Egocentric Vision: Collection, Pipeline and Challenges for EPIC-KITCHENS-100arXiv
A Critical Evaluation, Challenges, and Future Perspectives of Using AI and Emerging Technologies in Smart ClassroomsSpringer Nature
The Use of Smart Glasses in Nursing Education: A Scoping ReviewPubMed
Evaluating the Feasibility of Augmented Reality to Support Communication Access for Deaf Students in Experiential Higher Education ContextsarXiv

4.6 Mobility and Transportation Safety

Paper TitleLink
NavCog: A Navigational Cognitive Assistant for the BlindACM DL
Are They Going to Cross? A Benchmark Dataset and Baseline for Pedestrian Crosswalk BehaviorIEEE
PIE: A Large-Scale Dataset and Models for Pedestrian Intention Estimation and Trajectory PredictionResearchGate
The Effectiveness of Visual and Audio Wayfinding Guidance on Smartglasses for People with Low VisionACM DL
Urban Risk-Aware Navigation via VQA-Based Event Maps for People with Low VisionarXiv
Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language ModelsarXiv

4.7 Social Interaction and Collaboration

Paper TitleLink
The AMI Meeting Corpus: A Pre-AnnouncementSpringer Nature
In Situ with Bystanders of Augmented Reality Glasses: Perspectives on Recording and Privacy-Mediating TechnologiesACM DL
Your Smart Glasses' Camera Bothers Me! Exploring Opt-In and Opt-Out Gestures for Privacy MediationACM DL
AVA Active Speaker: An Audio-Visual Dataset for Active Speaker DetectionarXiv
Evaluating a Wearable Camera's Social Acceptability In-the-WildACM DL
QMSum: A New Benchmark for Query-Based Multi-Domain Meeting SummarizationarXiv
Social Acceptance of Smart Glasses in Health Care: Model Evaluation Study of Anticipated Adoption and Social InteractionPubMed Central
VisGuardian: A Lightweight Group-based Privacy Control Technique For Front Camera Data From AR Glasses in Home EnvironmentsarXiv
Conversational Successes and Breakdowns in Everyday Smart Glasses UsearXiv
Mind the Gap: Mapping Wearer--Bystander Privacy Tensions and Context-Adaptive Pathways for Camera GlassesarXiv
Reshaping Inclusive Interpersonal Dynamics through Smart Glasses in Mixed-Vision Social ActivitiesarXiv
Position: Life-Logging Video Streams Make the Privacy-Utility Trade-off InevitablearXiv
H2HMem: A Multimodal Memory Benchmark for Agents in Human-Human InteractionsarXiv

4.8 Spatial Intelligence

Paper TitleLink
VINS-Mono: A Robust and Versatile Monocular Visual-Inertial State EstimatorarXiv
Matterport3D: Learning from RGB-D Data in Indoor EnvironmentsarXiv
In the Eye of the Beholder: Joint Learning of Gaze and Actions in First Person VideoarXiv
ORB-SLAM3: An Accurate Open-Source Library for Visual, Visual-Inertial, and Multimap SLAMarXiv
DROID-SLAM: Deep Visual SLAM for Monocular, Stereo, and RGB-D CamerasarXiv
Aria Digital Twin: A New Benchmark Dataset for Egocentric 3D Machine PerceptionarXiv
Project Aria: A New Tool for Egocentric Multi-Modal AI ResearcharXiv
LEVIO: Lightweight Embedded Visual Inertial Odometry for Resource-Constrained DevicesarXiv
EgoForge: Goal-Directed Egocentric World SimulatorarXiv
Pandora: Articulated 3D Scene Graphs from Egocentric VisionarXiv
Do MLLMs Understand Pointing? Benchmarking and Enhancing Referential Reasoning in Egocentric VisionarXiv
EgoProx: Evaluating MLLMs on Egocentric 3D Proximity Reasoning Across a Cognitive HierarchyarXiv
SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World TasksarXiv

4.9 Embodied Intelligence

Paper TitleLink
Ego4D: Around the World in 3,000 Hours of Egocentric VideoarXiv
AvatarPoser: Articulated Full-Body Pose Tracking from Sparse Motion SensingarXiv
EgoPoser: Robust Real-Time Egocentric Pose Estimation from Sparse and Intermittent Observations EverywherearXiv
Ego-Exo4D: Understanding Skilled Human Activity from First- and Third-Person PerspectivesarXiv
EgoMimic: Scaling Imitation Learning via Egocentric VideoarXiv
EgoSim: An Egocentric Multi-view Simulator and Real Dataset for Body-worn Cameras during Motion and ActivityarXiv
EgoDex: Learning Dexterous Manipulation from Large-Scale Egocentric VideoarXiv
EgoZero: Robot Learning from Smart GlassesarXiv
EgoVLA: Learning Vision-Language-Action Models from Egocentric Human VideosarXiv
EgoBridge: Domain Adaptation for Generalizable Imitation from Egocentric Human DataarXiv
Scalable Vision-Language-Action Model Pretraining for Robotic Manipulation with Real-Life Human Activity VideosarXiv
EgoMI: Learning Active Vision and Whole-Body Manipulation from Egocentric Human DemonstrationsarXiv
EgoScale: Scaling Dexterous Manipulation with Diverse Egocentric Human DataarXiv
AoE: Always-On Egocentric Human Video Collection for Embodied AIarXiv
UniDex: A Robot Foundation Suite for Universal Dexterous Hand Control from Egocentric Human VideosarXiv
ActiveGlasses: Learning Manipulation with Active Vision from Ego-Centric Human DemonstrationarXiv
HumanNet: Scaling Human-Centric Video Learning to One Million HoursarXiv
EgoKit: Towards Unified Low-Cost Egocentric Data Collection with Heterogeneous DevicesarXiv
HumanEgo: Zero-Shot Robot Learning from Minutes of Human Egocentric VideosarXiv
ActiveMimic: Egocentric Video Pretraining with Active PerceptionarXiv
EgoTactile: Learning Grasp Pressure for Everyday Objects from Egocentric VideoarXiv
EgoEngine: From Egocentric Human Videos to High-Fidelity Dexterous Robot DemonstrationsarXiv
EPIC: A System Framework for Efficient Egocentric Perception on Embodied AR GlassesarXiv
Human Universal GraspingarXiv
ForceBand: Learning Forceful Manipulation with sEMGarXiv
EgoWAM: World Action Models Beyond Pixels with In-the-Wild Egocentric Human DataarXiv
Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied LearningarXiv
EgoExoMoCap: Distributed Ego-Exo Human Motion CapturearXiv

📄 Citation

If you find our work helpful, please consider citing our paper:

@misc{zhang2026seeingactingsmartglasses,
      title={From Seeing to Acting: Smart Glasses as First-Person Intelligence Platforms}, 
      author={Jiangning Zhang and Haojun Chen and Yong Liu},
      year={2026},
      eprint={2608.24877},
      archivePrefix={arXiv},
      primaryClass={cs.CV},
      url={https://arxiv.org/abs/2608.24877}, 
}

🤝 Contributing

Contributions are welcome. Please open an issue or submit a pull request to add or correct related smart-glasses products/platforms and works (datasets, benchmarks, methods, systems, and application resources). New entries should include a verifiable paper, official product/project page, or repository link.

🤗 Acknowledgments

We thank the authors, dataset and benchmark creators, product and platform developers, and open-source contributors whose work supports this survey.


GitHub stars GitHub forks GitHub watchers
⭐ Leave this repository a star if you find it helpful! ⭐

zhangzjn/awesome-smart-glasses

37

26 commits

updated Oct 4, 2026

See the code

README

Smart Glasses Survey Logo From Seeing to Acting: Smart Glasses as First-Person Intelligence Platforms

Awesome list badge MIT License arXiv Hugging Face PRs welcome WeChat Group

Jiangning Zhang 1,*,✉ ,  Haojun Chen 1,* ,  Yong Liu 1

1Zhejiang University, APRIL Lab

This repository accompanies our survey From Seeing to Acting: Smart Glasses as First-Person Intelligence Platforms and maintains a structured collection of smart-glasses products/platforms, foundational capabilities, and application scenarios, which will be continuously updated.For more details, kindly refer to our paper 🚀

💬 Researchers and industry practitioners are welcome to join our WeChat group; we look forward to exchanging ideas and collaborating with you.

Survey Pipeline

📰 News

Table of Contents

🎯 Contributions

1️⃣ A formal and hardware-grounded problem definition.

We define smart glasses through a first-person observation stream, a closed-loop mapping from observation and intent to feedback, persistent state, and optional action, and a constrained utility objective that makes latency, energy, thermals, privacy, and social cost explicit. We further consolidate heterogeneous devices into eight verifiable hardware capability axes and route-aware product profiles, converting marketing categories into evidence-bearing experimental substrates.

2️⃣ A compositional capability framework with explicit evidential boundaries.

We synthesize seven interdependent capabilities: first-person perception, multimodal context, persistent spatial state, auditable personal memory, situated agentic action, embodied data interfaces, and cross-cutting deployment constraints. Building upon these building blocks, we present an L0-L5 framework that covers capture, reactive perception, contextual assistance, persistent state, governed action, and embodied coupling. The framework treats levels as task- and evidence-conditioned claims, distinguishes prerequisites from demonstrated capability, and makes clear that L5 crosses the embodiment boundary rather than simply extending the wearer-facing L0-L4 axis.

3️⃣ An application-centered evidence map.

We reorganize the literature into nine application scenes and connect each scene to its required capability loop, representative datasets and benchmarks, research systems, product entry points, affected stakeholders, failure consequences, and missing validation evidence. This structure separates transferable component evidence from direct smart-glasses evidence and clarifies why identical model functions require different thresholds in daily assistance, accessibility, industry, healthcare, education, mobility, social collaboration, spatial intelligence, and embodied intelligence.

4️⃣ A deployment and evaluation blueprint.

We formulate nine coupled design dimensions covering hardware, runtime, perception and inference, memory, feedback, external action, reliability, governance, and reproducibility. On this basis, we provide a claim-conditioned evaluation protocol, a deployment checklist, and an iterative evidence ladder that connects documentation, laboratory measurement, benchmark testing, device-stream replay, fault injection, end-to-end studies, longitudinal deployment, and privacy or security audit. We finally derive eight open challenges and six roadmap directions for building trustworthy first-person embodied-intelligence systems.

Representative Smart-Glasses Products/Platforms

Representative Smart-Glasses Products/Platforms

👓 The table below summarizes some representative smart-glasses products/platforms and their corresponding links (⏰ last update: 2026.09.06).

DateSmart-Glasses Product/PlatformLink
2020-09Project Aria Gen 1Project Aria Gen 1
2023-09Ray-Ban Meta Gen 1Ray-Ban Meta Gen 1
2024-06Even Realities G1Even Realities G1
2025-02Project Aria Gen 2Project Aria Gen 2
2025-05RayNeo X3 ProRayNeo X3 Pro
2025-05XREAL AURAXREAL AURA
2025-06Xiaomi AI GlassesXiaomi AI Glasses
2025-09Ray-Ban Meta Gen 2Ray-Ban Meta Gen 2
2025-09Meta Ray-Ban DisplayMeta Ray-Ban Display
2025-10Oakley Meta VanguardOakley Meta Vanguard
2025-11Xiaodu AI Glasses ProXiaodu AI Glasses Pro
2025-11Quark AI Glasses S1Quark AI Glasses S1
2025-11Quark AI Glasses G1Quark AI Glasses G1
2026-01Rokid AI Glasses StyleRokid AI Glasses Style
2026-01Solos AirGo V2Solos AirGo V2
2026-04RayNeo V4RayNeo V4
2026-06Snap SPECSSnap SPECS
2026-07Halliday G2Halliday G2
2026-08RayNeo iORayNeo iO
Figure: Hardware stack and hardware-based capability-axis consolidation.

Hardware Capability Axes

Foundational Capabilities for Smart Glasses

Figure: Foundational capabilities and L0-L5 cross-capability level framework.

Capabilities and L0-L5 Framework

⏰ We organize the works in chronological order, from the latest to the earliest. 🎨 Colored labels indicate seven foundational capabilities to which the work contributes: First-Person Perception, Multimodal Context Modeling, Persistent Spatial State, Auditable Long-Term Personal Memory, Situated Agentic Action, Embodied Data Interfaces, and Cross-Cutting Deployment Constraints.

CapabilitiesPaper TitleLink
Multimodal Context Modeling
Auditable Long-Term Personal Memory
VoiceMem: Streaming Dual-Brain Memory for Real-Time InteractionarXiv
Auditable Long-Term Personal MemoryEgoMonth: A Month-Level Egocentric Video Benchmark for Long-Term Spatiotemporal MemoryarXiv
Embodied Data InterfacesEgoExoMoCap: Distributed Ego-Exo Human Motion CapturearXiv
First-Person Perception
Embodied Data Interfaces
Cross-Cutting Deployment Constraints
Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied LearningarXiv
Auditable Long-Term Personal MemoryLightMem-Ego: Your AI Memory for Everyday LifearXiv
Cross-Cutting Deployment ConstraintsOpenGlass: A Sensing-Computing Split Architecture for Local MLLM-Driven Real-Time Visual AssistancearXiv
First-Person Perception
Multimodal Context Modeling
Situated Agentic Action
Cross-Cutting Deployment Constraints
EgoSAT: A Comprehensive Benchmark of Egocentric Streaming Interaction UnderstandingarXiv
Cross-Cutting Deployment ConstraintsEPIC: A System Framework for Efficient Egocentric Perception on Embodied AR GlassesarXiv
Embodied Data InterfacesEgoEngine: From Egocentric Human Videos to High-Fidelity Dexterous Robot DemonstrationsarXiv
Persistent Spatial StateSpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World TasksarXiv
Situated Agentic ActionStreaming Interventions: Can Video Large Language Models Correct Mistakes as They Occur?arXiv
Multimodal Context Modeling
Auditable Long-Term Personal Memory
H2HMem: A Multimodal Memory Benchmark for Agents in Human-Human InteractionsarXiv
Embodied Data InterfacesEgoTactile: Learning Grasp Pressure for Everyday Objects from Egocentric VideoarXiv
Cross-Cutting Deployment ConstraintsOpenGlass: Ultra-Low-Power On-Device AI Eyewear with Event-Based VisionarXiv
Embodied Data InterfacesActiveMimic: Egocentric Video Pretraining with Active PerceptionarXiv
Situated Agentic Action
Cross-Cutting Deployment Constraints
Plan, Watch, Recover: A Benchmark and Architectures for Proactive Procedural AssistancearXiv
Multimodal Context Modeling
Auditable Long-Term Personal Memory
Cross-Cutting Deployment Constraints
EGOSTREAM: A Diagnostic Benchmark for Streaming Episodic Memory in Egocentric VisionarXiv
Multimodal Context Modeling
Situated Agentic Action
Cross-Cutting Deployment Constraints
IPIBench: Evaluating Interactive Proactive Intelligence of MLLMs under Continuous StreamsarXiv
Embodied Data InterfacesHumanEgo: Zero-Shot Robot Learning from Minutes of Human Egocentric VideosarXiv
Persistent Spatial StateEgoProx: Evaluating MLLMs on Egocentric 3D Proximity Reasoning Across a Cognitive HierarchyarXiv
Multimodal Context Modeling
Auditable Long-Term Personal Memory
EgoExoMem: Cross-View Memory Reasoning over Synchronized Egocentric and Exocentric VideosarXiv
First-Person Perception
Embodied Data Interfaces
Cross-Cutting Deployment Constraints
EgoKit: Towards Unified Low-Cost Egocentric Data Collection with Heterogeneous DevicesarXiv
Persistent Spatial State
Cross-Cutting Deployment Constraints
Urban Risk-Aware Navigation via VQA-Based Event Maps for People with Low VisionarXiv
Multimodal Context Modeling
Auditable Long-Term Personal Memory
Situated Agentic Action
Personal Visual Context Learning in Large Multimodal ModelsarXiv
Auditable Long-Term Personal Memory
Cross-Cutting Deployment Constraints
Position: Life-Logging Video Streams Make the Privacy-Utility Trade-off InevitablearXiv
Multimodal Context Modeling
Auditable Long-Term Personal Memory
EgoMemReason: A Memory-Driven Reasoning Benchmark for Long-Horizon Egocentric Video UnderstandingarXiv
Situated Agentic ActionEgoPro-Bench: Benchmarking Personalized Proactive Interaction in Egocentric Video StreamsarXiv
Embodied Data InterfacesHumanNet: Scaling Human-Centric Video Learning to One Million HoursarXiv
Situated Agentic ActionPro $^2$ Assist: Continuous Step-Aware Proactive Assistance with Multimodal Egocentric Perception for Long-Horizon Procedural TasksarXiv
Situated Agentic ActionIntention-Aware Semantic Agent Communications for AI GlassesarXiv
Situated Agentic Action
Cross-Cutting Deployment Constraints
PhySE: A Psychological Framework for Real-Time AR-LLM Social Engineering AttacksarXiv
Cross-Cutting Deployment ConstraintsUNSEEN: A Cross-Stack LLM Unlearning Defense against AR-LLM Social Engineering AttacksarXiv
First-Person Perception
Persistent Spatial State
Do MLLMs Understand Pointing? Benchmarking and Enhancing Referential Reasoning in Egocentric VisionarXiv
Embodied Data InterfacesActiveGlasses: Learning Manipulation with Active Vision from Ego-Centric Human DemonstrationarXiv
Multimodal Context ModelingReshaping Inclusive Interpersonal Dynamics through Smart Glasses in Mixed-Vision Social ActivitiesarXiv
Multimodal Context Modeling
Cross-Cutting Deployment Constraints
Active Noise Cancellation on Open-Ear Smart GlassesarXiv
Situated Agentic Action
Cross-Cutting Deployment Constraints
VisionClaw: Always-On AI Agents through Smart GlassesarXiv
Auditable Long-Term Personal Memory
Situated Agentic Action
Ego-Grounding for Personalized Question-Answering in Egocentric VideosarXiv
Persistent Spatial StatePandora: Articulated 3D Scene Graphs from Egocentric VisionarXiv
Situated Agentic ActionEgo2Web: A Web Agent Benchmark Grounded in Egocentric VideosarXiv
Embodied Data InterfacesUniDex: A Robot Foundation Suite for Universal Dexterous Hand Control from Egocentric Human VideosarXiv
Persistent Spatial StateEgoForge: Goal-Directed Egocentric World SimulatorarXiv
First-Person Perception
Embodied Data Interfaces
Ego-1K--A Large-Scale Multiview Video Dataset for Egocentric VisionarXiv
Auditable Long-Term Personal Memory
Cross-Cutting Deployment Constraints
Mind the Gap: Mapping Wearer--Bystander Privacy Tensions and Context-Adaptive Pathways for Camera GlassesarXiv
Situated Agentic ActionEgocentric Co-Pilot: Web-Native Smart-Glasses Agents for Assistive Egocentric AIarXiv
First-Person Perception
Embodied Data Interfaces
Cross-Cutting Deployment Constraints
AoE: Always-On Egocentric Human Video Collection for Embodied AIarXiv
First-Person Perception
Multimodal Context Modeling
Cross-Cutting Deployment Constraints
SUPERGLASSES: Benchmarking Vision Language Models as Intelligent Agents for AI Smart GlassesarXiv
Auditable Long-Term Personal Memory
Cross-Cutting Deployment Constraints
Exploring Multimodal LMMs for Online Episodic Memory Question Answering on the EdgearXiv
Multimodal Context Modeling
Cross-Cutting Deployment Constraints
Conversational Successes and Breakdowns in Everyday Smart Glasses UsearXiv
First-Person Perception
Multimodal Context Modeling
Cross-Cutting Deployment Constraints
SAW-Bench: Learning Situated Awareness in the Real WorldarXiv
First-Person Perception
Multimodal Context Modeling
Cross-Cutting Deployment Constraints
GLIMPSE: Real-Time Text Recognition and Contextual Understanding for VQA in WearablesarXiv
Persistent Spatial State
Embodied Data Interfaces
Cross-Cutting Deployment Constraints
LEVIO: Lightweight Embedded Visual Inertial Odometry for Resource-Constrained DevicesarXiv
First-Person Perception
Cross-Cutting Deployment Constraints
Evaluating OCR Performance for Assistive Technology: Effects of Walking Speed, Camera Placement, and Camera TypearXiv
Auditable Long-Term Personal Memory
Cross-Cutting Deployment Constraints
VisGuardian: A Lightweight Group-based Privacy Control Technique For Front Camera Data From AR Glasses in Home EnvironmentsarXiv
Multimodal Context ModelingAgentic Very Long Video UnderstandingarXiv
Multimodal Context Modeling
Cross-Cutting Deployment Constraints
ROMA: Real-time Omni-Multimodal Assistant with Interactive Streaming UnderstandingarXiv
First-Person Perception
Multimodal Context Modeling
Cross-Cutting Deployment Constraints
WearVQA: A Visual Question Answering Benchmark for Wearables in Egocentric Authentic Real-World ScenariosarXiv
Embodied Data InterfacesEgoMI: Learning Active Vision and Whole-Body Manipulation from Egocentric Human DemonstrationsarXiv
Situated Agentic ActionAI for Service: Proactive Assistance with AI GlassesarXiv
Auditable Long-Term Personal Memory
Cross-Cutting Deployment Constraints
EgoTrigger: Toward Audio-Driven Image Capture for Human Memory Enhancement in All-Day Energy-Efficient Smart GlassesarXiv
Multimodal Context ModelingDailyLLM: Context-Aware Activity Log Generation Using Multi-Modal Sensors and LLMsarXiv
Embodied Data InterfacesEgoVLA: Learning Vision-Language-Action Models from Egocentric Human VideosarXiv
Multimodal Context ModelingAdaVideoRAG: Omni-Contextual Adaptive Retrieval-Augmented Efficient Long Video UnderstandingarXiv
Embodied Data Interfaces
Cross-Cutting Deployment Constraints
EgoZero: Robot Learning from Smart GlassesarXiv
Multimodal Context Modeling
Situated Agentic Action
ContextAgent: Context-Aware Proactive LLM Agents with Open-World Sensory PerceptionsarXiv
Embodied Data InterfacesEgoDex: Learning Dexterous Manipulation from Large-Scale Egocentric VideoarXiv
Multimodal Context Modeling
Auditable Long-Term Personal Memory
EgoLife: Towards Egocentric Life AssistantarXiv
Embodied Data InterfacesEgoSim: An Egocentric Multi-view Simulator and Real Dataset for Body-worn Cameras during Motion and ActivityarXiv
First-Person Perception
Multimodal Context Modeling
Cross-Cutting Deployment Constraints
Vinci: A Real-Time Smart Assistant Based on Egocentric Vision-Language Model for Portable DevicesarXiv
Embodied Data InterfacesEgoMimic: Scaling Imitation Learning via Egocentric VideoarXiv
Multimodal Context Modeling
Persistent Spatial State
Auditable Long-Term Personal Memory
Embodied Data Interfaces
OpenEQA: Embodied Question Answering in the Era of Foundation ModelsIEEE
Auditable Long-Term Personal MemoryMemoro: Using Large Language Models to Realize a Concise Interface for Real-Time Memory AugmentationarXiv
Embodied Data InterfacesEgo-Exo4D: Understanding Skilled Human Activity from First- and Third-Person PerspectivesarXiv
Cross-Cutting Deployment ConstraintsHead-Mounted Display Augmented Reality in Manufacturing: A Systematic ReviewACM DL
First-Person Perception
Multimodal Context Modeling
Situated Agentic Action
Embodied Data Interfaces
HoloAssist: An Egocentric Human Interaction Dataset for Interactive AI Assistants in the Real WorldarXiv
First-Person PerceptionEgoObjects: A Large-Scale Egocentric Dataset for Fine-Grained Object UnderstandingarXiv
First-Person Perception
Multimodal Context Modeling
Persistent Spatial State
Embodied Data Interfaces
Cross-Cutting Deployment Constraints
Project Aria: A New Tool for Egocentric Multi-Modal AI ResearcharXiv
Embodied Data InterfacesEgoPoser: Robust Real-Time Egocentric Pose Estimation from Sparse and Intermittent Observations EverywherearXiv
Multimodal Context ModelingEgoVLPv2: Egocentric Video-Language Pre-Training with Fusion in the BackbonearXiv
Persistent Spatial State
Embodied Data Interfaces
Aria Digital Twin: A New Benchmark Dataset for Egocentric 3D Machine PerceptionarXiv
First-Person Perception
Multimodal Context Modeling
EPIC-Sounds: A Large-Scale Dataset of Actions That SoundarXiv
First-Person Perception
Auditable Long-Term Personal Memory
EgoTracks: A Long-Term Egocentric Visual Object Tracking DatasetarXiv
Persistent Spatial StateLidSonic for Visually Impaired: Green Machine Learning-Based Assistive Smart Glasses with Smart App and ArduinoResearchGate
Embodied Data InterfacesAvatarPoser: Articulated Full-Body Pose Tracking from Sparse Motion SensingarXiv
Multimodal Context Modeling
Embodied Data Interfaces
Assembly101: A Large-Scale Multi-View Video Dataset for Understanding Procedural ActivitiesarXiv
First-Person Perception
Embodied Data Interfaces
Ego4D: Around the World in 3,000 Hours of Egocentric VideoarXiv
Persistent Spatial StateDROID-SLAM: Deep Visual SLAM for Monocular, Stereo, and RGB-D CamerasarXiv
Multimodal Context ModelingQMSum: A New Benchmark for Query-Based Multi-Domain Meeting SummarizationarXiv
First-Person Perception
Embodied Data Interfaces
The IKEA ASM Dataset: Understanding People Assembling Furniture through Actions, Objects and PosearXiv
First-Person Perception
Embodied Data Interfaces
Rescaling Egocentric Vision: Collection, Pipeline and Challenges for EPIC-KITCHENS-100arXiv
First-Person Perception
Persistent Spatial State
In the Eye of the Beholder: Joint Learning of Gaze and Actions in First Person VideoarXiv
Cross-Cutting Deployment ConstraintsEvaluating a Wearable Camera's Social Acceptability In-the-WildACM DL
Embodied Data InterfacesCOIN: A Large-Scale Dataset for Comprehensive Instructional Video AnalysisarXiv
Multimodal Context ModelingAVA Active Speaker: An Audio-Visual Dataset for Active Speaker DetectionarXiv
Cross-Cutting Deployment ConstraintsYour Smart Glasses' Camera Bothers Me! Exploring Opt-In and Opt-Out Gestures for Privacy MediationACM DL
First-Person Perception
Persistent Spatial State
VizWiz Grand Challenge: Answering Visual Questions from Blind PeoplearXiv
Persistent Spatial StateMatterport3D: Learning from RGB-D Data in Indoor EnvironmentsarXiv
Persistent Spatial StateVINS-Mono: A Robust and Versatile Monocular Visual-Inertial State EstimatorarXiv
Persistent Spatial StateScanNet: Richly-Annotated 3D Reconstructions of Indoor ScenesarXiv
Persistent Spatial StateNavCog: A Navigational Cognitive Assistant for the BlindACM DL
Cross-Cutting Deployment ConstraintsIn Situ with Bystanders of Augmented Reality Glasses: Perspectives on Recording and Privacy-Mediating TechnologiesACM DL
Multimodal Context ModelingThe AMI Meeting Corpus: A Pre-AnnouncementSpringer Nature

Application Scenes for Smart Glasses

⏰ For each application scene, we organize the works in chronological order, from the earliest to the latest.

4.1 Daily Situated Assistance

Paper TitleLink
Vinci: A Real-Time Smart Assistant Based on Egocentric Vision-Language Model for Portable DevicesarXiv
AiGet: Transforming Everyday Moments into Hidden Knowledge Discovery with AI Assistance on Smart GlassesarXiv
EgoLife: Towards Egocentric Life AssistantarXiv
ContextAgent: Context-Aware Proactive LLM Agents with Open-World Sensory PerceptionsarXiv
DailyLLM: Context-Aware Activity Log Generation Using Multi-Modal Sensors and LLMsarXiv
AI for Service: Proactive Assistance with AI GlassesarXiv
TeleEgo: Benchmarking Egocentric AI Assistants in the WildarXiv
WearVQA: A Visual Question Answering Benchmark for Wearables in Egocentric Authentic Real-world ScenariosarXiv
ROMA: Real-time Omni-Multimodal Assistant with Interactive Streaming UnderstandingarXiv
GLIMPSE: Real-Time Text Recognition and Contextual Understanding for VQA in WearablesarXiv
SAW-Bench: Learning Situated Awareness in the Real WorldarXiv
Exploring Multimodal LMMs for Online Episodic Memory Question Answering on the EdgearXiv
SUPERGLASSES: Benchmarking Vision Language Models as Intelligent Agents for AI Smart GlassesarXiv
Egocentric Co-Pilot: Web-Native Smart-Glasses Agents for Assistive Egocentric AIarXiv
Ego2Web: A Web Agent Benchmark Grounded in Egocentric VideosarXiv
VisionClaw: Always-On AI Agents through Smart GlassesarXiv
Intention-Aware Semantic Agent Communications for AI GlassesarXiv
EgoMemReason: A Memory-Driven Reasoning Benchmark for Long-Horizon Egocentric Video UnderstandingarXiv
Personal Visual Context Learning in Large Multimodal ModelsarXiv
EgoPro-Bench: Benchmarking Personalized Proactive Interaction in Egocentric Video StreamsarXiv
IPIBench: Evaluating Interactive Proactive Intelligence of MLLMs under Continuous StreamsarXiv
EGOSTREAM: A Diagnostic Benchmark for Streaming Episodic Memory in Egocentric VisionarXiv
EgoSAT: A Comprehensive Benchmark of Egocentric Streaming Interaction UnderstandingarXiv
OpenGlass: A Sensing-Computing Split Architecture for Local MLLM-Driven Real-Time Visual AssistancearXiv
LightMem-Ego: Your AI Memory for Everyday LifearXiv
EgoMonth: A Month-Level Egocentric Video Benchmark for Long-Term Spatiotemporal MemoryarXiv

4.2 Accessibility Assistance

Paper TitleLink
NavCog: A Navigational Cognitive Assistant for the BlindACM DL
VizWiz Grand Challenge: Answering Visual Questions from Blind PeoplearXiv
The Effectiveness of Visual and Audio Wayfinding Guidance on Smartglasses for People with Low VisionACM DL
LidSonic for Visually Impaired: Green Machine Learning-Based Assistive Smart Glasses with Smart App and ArduinoResearchGate
EgoBlind: Towards Egocentric Visual Assistance for the BlindarXiv
Exploring LLM-Based Assistants with Smart Glasses for the Visually ImpairedACM DL
Evaluating OCR Performance for Assistive Technology: Effects of Walking Speed, Camera Placement, and Camera TypearXiv
Active Noise Cancellation on Open-Ear Smart GlassesarXiv
Urban Risk-Aware Navigation via VQA-Based Event Maps for People with Low VisionarXiv

4.3 Industrial Workflow Support

Paper TitleLink
COIN: A Large-Scale Dataset for Comprehensive Instructional Video AnalysisarXiv
Smart Glasses-Based Personnel Proximity Warning System for Improving Pedestrian Safety in Construction and Mining SitesMDPI
Augmented Reality’s Impact in Industry—A Scoping ReviewMDPI
The IKEA ASM Dataset: Understanding People Assembling Furniture through Actions, Objects and PosearXiv
Augmented Reality Smart Glasses in Industrial Assembly: Current Status and Future ChallengesScienceDirect
Assembly101: A Large-Scale Multi-View Video Dataset for Understanding Procedural ActivitiesarXiv
HoloAssist: An Egocentric Human Interaction Dataset for Interactive AI Assistants in the Real WorldarXiv
Head-Mounted Display Augmented Reality in Manufacturing: A Systematic ReviewACM DL
LabOS: The AI-XR Co-scientist that sees and works with humansarXiv
Pro $^2$ Assist: Continuous Step-Aware Proactive Assistance with Multimodal Egocentric Perception for Long-Horizon Procedural TasksarXiv
Plan, Watch, Recover: A Benchmark and Architectures for Proactive Procedural AssistancearXiv
Streaming Interventions: Can Video Large Language Models Correct Mistakes as They Occur?arXiv
Toward a Full-Stack Framework for Industrial Augmented Reality: Benefits, Risks, and Design Considerations for Dependable Deployment in ManufacturingarXiv

4.4 Healthcare and Caregiving

Paper TitleLink
JHU-ISI Gesture and Skill Assessment Working Set (JIGSAWS): A Surgical Activity Dataset for Human Motion ModelingCIRL
Technical Support by Smart Glasses During a Mass Casualty IncidentPubMed
A Systematic Literature Review on Integrating AI-Powered Smart Glasses into Digital Health Management for Proactive Healthcare SolutionsNature
Development of an AI-Powered AR Glasses System for Real-Time First Aid Guidance in Emergency SituationsSpringer Nature
Smart Glasses for Older Adults With Cognitive Impairment: A Scoping ReviewPubMed Central
A Smart-Glasses for Emergency Medical Services via Multimodal Multitask LearningarXiv
Wearable AR for Restorative Breaks: How Interactive Narrative Experiences Support Relaxation for Young PeoplearXiv

4.5 Education and Skills Training

Paper TitleLink
Cross-Task Weakly Supervised Learning from Instructional VideosarXiv
Evaluating the Effectiveness of Learning Design with Mixed Reality in Higher EducationSpringer Nature
Augmented Reality in Medical Education: A Systematic ReviewPubMed Central
Rescaling Egocentric Vision: Collection, Pipeline and Challenges for EPIC-KITCHENS-100arXiv
A Critical Evaluation, Challenges, and Future Perspectives of Using AI and Emerging Technologies in Smart ClassroomsSpringer Nature
The Use of Smart Glasses in Nursing Education: A Scoping ReviewPubMed
Evaluating the Feasibility of Augmented Reality to Support Communication Access for Deaf Students in Experiential Higher Education ContextsarXiv

4.6 Mobility and Transportation Safety

Paper TitleLink
NavCog: A Navigational Cognitive Assistant for the BlindACM DL
Are They Going to Cross? A Benchmark Dataset and Baseline for Pedestrian Crosswalk BehaviorIEEE
PIE: A Large-Scale Dataset and Models for Pedestrian Intention Estimation and Trajectory PredictionResearchGate
The Effectiveness of Visual and Audio Wayfinding Guidance on Smartglasses for People with Low VisionACM DL
Urban Risk-Aware Navigation via VQA-Based Event Maps for People with Low VisionarXiv
Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language ModelsarXiv

4.7 Social Interaction and Collaboration

Paper TitleLink
The AMI Meeting Corpus: A Pre-AnnouncementSpringer Nature
In Situ with Bystanders of Augmented Reality Glasses: Perspectives on Recording and Privacy-Mediating TechnologiesACM DL
Your Smart Glasses' Camera Bothers Me! Exploring Opt-In and Opt-Out Gestures for Privacy MediationACM DL
AVA Active Speaker: An Audio-Visual Dataset for Active Speaker DetectionarXiv
Evaluating a Wearable Camera's Social Acceptability In-the-WildACM DL
QMSum: A New Benchmark for Query-Based Multi-Domain Meeting SummarizationarXiv
Social Acceptance of Smart Glasses in Health Care: Model Evaluation Study of Anticipated Adoption and Social InteractionPubMed Central
VisGuardian: A Lightweight Group-based Privacy Control Technique For Front Camera Data From AR Glasses in Home EnvironmentsarXiv
Conversational Successes and Breakdowns in Everyday Smart Glasses UsearXiv
Mind the Gap: Mapping Wearer--Bystander Privacy Tensions and Context-Adaptive Pathways for Camera GlassesarXiv
Reshaping Inclusive Interpersonal Dynamics through Smart Glasses in Mixed-Vision Social ActivitiesarXiv
Position: Life-Logging Video Streams Make the Privacy-Utility Trade-off InevitablearXiv
H2HMem: A Multimodal Memory Benchmark for Agents in Human-Human InteractionsarXiv

4.8 Spatial Intelligence

Paper TitleLink
VINS-Mono: A Robust and Versatile Monocular Visual-Inertial State EstimatorarXiv
Matterport3D: Learning from RGB-D Data in Indoor EnvironmentsarXiv
In the Eye of the Beholder: Joint Learning of Gaze and Actions in First Person VideoarXiv
ORB-SLAM3: An Accurate Open-Source Library for Visual, Visual-Inertial, and Multimap SLAMarXiv
DROID-SLAM: Deep Visual SLAM for Monocular, Stereo, and RGB-D CamerasarXiv
Aria Digital Twin: A New Benchmark Dataset for Egocentric 3D Machine PerceptionarXiv
Project Aria: A New Tool for Egocentric Multi-Modal AI ResearcharXiv
LEVIO: Lightweight Embedded Visual Inertial Odometry for Resource-Constrained DevicesarXiv
EgoForge: Goal-Directed Egocentric World SimulatorarXiv
Pandora: Articulated 3D Scene Graphs from Egocentric VisionarXiv
Do MLLMs Understand Pointing? Benchmarking and Enhancing Referential Reasoning in Egocentric VisionarXiv
EgoProx: Evaluating MLLMs on Egocentric 3D Proximity Reasoning Across a Cognitive HierarchyarXiv
SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World TasksarXiv

4.9 Embodied Intelligence

Paper TitleLink
Ego4D: Around the World in 3,000 Hours of Egocentric VideoarXiv
AvatarPoser: Articulated Full-Body Pose Tracking from Sparse Motion SensingarXiv
EgoPoser: Robust Real-Time Egocentric Pose Estimation from Sparse and Intermittent Observations EverywherearXiv
Ego-Exo4D: Understanding Skilled Human Activity from First- and Third-Person PerspectivesarXiv
EgoMimic: Scaling Imitation Learning via Egocentric VideoarXiv
EgoSim: An Egocentric Multi-view Simulator and Real Dataset for Body-worn Cameras during Motion and ActivityarXiv
EgoDex: Learning Dexterous Manipulation from Large-Scale Egocentric VideoarXiv
EgoZero: Robot Learning from Smart GlassesarXiv
EgoVLA: Learning Vision-Language-Action Models from Egocentric Human VideosarXiv
EgoBridge: Domain Adaptation for Generalizable Imitation from Egocentric Human DataarXiv
Scalable Vision-Language-Action Model Pretraining for Robotic Manipulation with Real-Life Human Activity VideosarXiv
EgoMI: Learning Active Vision and Whole-Body Manipulation from Egocentric Human DemonstrationsarXiv
EgoScale: Scaling Dexterous Manipulation with Diverse Egocentric Human DataarXiv
AoE: Always-On Egocentric Human Video Collection for Embodied AIarXiv
UniDex: A Robot Foundation Suite for Universal Dexterous Hand Control from Egocentric Human VideosarXiv
ActiveGlasses: Learning Manipulation with Active Vision from Ego-Centric Human DemonstrationarXiv
HumanNet: Scaling Human-Centric Video Learning to One Million HoursarXiv
EgoKit: Towards Unified Low-Cost Egocentric Data Collection with Heterogeneous DevicesarXiv
HumanEgo: Zero-Shot Robot Learning from Minutes of Human Egocentric VideosarXiv
ActiveMimic: Egocentric Video Pretraining with Active PerceptionarXiv
EgoTactile: Learning Grasp Pressure for Everyday Objects from Egocentric VideoarXiv
EgoEngine: From Egocentric Human Videos to High-Fidelity Dexterous Robot DemonstrationsarXiv
EPIC: A System Framework for Efficient Egocentric Perception on Embodied AR GlassesarXiv
Human Universal GraspingarXiv
ForceBand: Learning Forceful Manipulation with sEMGarXiv
EgoWAM: World Action Models Beyond Pixels with In-the-Wild Egocentric Human DataarXiv
Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied LearningarXiv
EgoExoMoCap: Distributed Ego-Exo Human Motion CapturearXiv

📄 Citation

If you find our work helpful, please consider citing our paper:

@misc{zhang2026seeingactingsmartglasses,
      title={From Seeing to Acting: Smart Glasses as First-Person Intelligence Platforms}, 
      author={Jiangning Zhang and Haojun Chen and Yong Liu},
      year={2026},
      eprint={2608.24877},
      archivePrefix={arXiv},
      primaryClass={cs.CV},
      url={https://arxiv.org/abs/2608.24877}, 
}

🤝 Contributing

Contributions are welcome. Please open an issue or submit a pull request to add or correct related smart-glasses products/platforms and works (datasets, benchmarks, methods, systems, and application resources). New entries should include a verifiable paper, official product/project page, or repository link.

🤗 Acknowledgments

We thank the authors, dataset and benchmark creators, product and platform developers, and open-source contributors whose work supports this survey.


GitHub stars GitHub forks GitHub watchers
⭐ Leave this repository a star if you find it helpful! ⭐