AI眼镜这几年一直热闹,但热闹和清楚是两回事。消费者走进店里,或者打开电商页面,看到的是“AI原生”“多模态交互”“万物互联”“随身大脑”之类的话术。问题是,一副眼镜到底智能到什么程度?它只能听懂“播放音乐”,还是能理解“帮我安排下午的路线,顺便提醒我带伞”?它是一次性执行命令,还是能记住你的习惯,跨设备替你处理事情?过去,这些问题几乎没有统一答案。

现在,答案开始有了。国家标准化指导性技术文件《人工智能 终端智能化分级 第6部分:眼镜》(GB/Z 177.6,2026)正式发布。这是国内首个专门针对AI眼镜的智能化分级国家标准,把AI眼镜的能力从低到高划成L1到L4四个档位。它的价值不在于多了一个标准编号,而在于给消费者一把看得懂的尺子,也给厂商一条能对照的技术路线。
一把迟到的尺子
AI眼镜市场并不缺产品,缺的是评价语言。手机有跑分,电视有分辨率,耳机有降噪深度,到了AI眼镜,很多核心体验却停在形容词层面。厂商说“智能”,消费者只能猜。有人把基础语音助手装进眼镜,就敢叫AI智能;有人把传统蓝牙连接换个说法,包装成万物互联。宣传口径不统一,最后受伤的是两类人:一类是普通消费者,买完才发现所谓智能只是换了个形态的蓝牙音箱;另一类是真做技术创新的厂商,它们的能力被淹没在低水平价格战和夸张营销里。
标准的出现,首先解决的是“怎么定义”。它采用“2+N”架构。“2”是参考框架和总体要求两项基础文件,界定什么是AI终端、怎么分级、怎么判定;“N”是面向具体品类的细分规范,首批覆盖手机、电脑、电视、眼镜、汽车座舱、音箱、耳机七大品类。本次发布的正是眼镜部分。这个架构意味着,AI眼镜不再是一个孤立品类,它被放进AI终端的整体评价体系里,同时又有针对眼镜形态的专门要求。
这很重要。眼镜不是手机,也不是音箱。它的佩戴位置、交互方式、显示能力、续航限制、拍摄伦理、音频私密性,都和别的终端不同。如果只用一套笼统的AI终端标准去套,厂商很容易找到模糊空间。现在有了“第6部分:眼镜”,评价对象明确了,测试方法也有了落地依据。
L1到L4:从“听话”到“主动干活”
标准把AI眼镜的智能化水平划分为四个等级。这四个等级不是简单的功能叠加,而是能力性质的变化。
L1响应级是入门门槛。核心能力是感知和执行:能识别语音指令,完成简单动作响应,比如设置闹钟、播放音乐。这个级别并非没有用。对很多人来说,眼镜能解放双手,完成最基础的语音操作,已经比掏出手机方便。但必须说清楚,L1的本质仍是“听话”。它听到指令,执行动作,离理解复杂意图还有距离。过去不少产品实际停在这个水平,却喜欢用更高级的词汇包装自己。分级之后,这种模糊空间会被压缩。
L2工具级进入认知和规划层面。它支持多轮对话理解和任务分解,能根据你的描述查询天气、规划路线。注意,这里的关键不是“能查天气”,而是“多轮”和“任务分解”。用户说“我明天要去杭州,帮我看看要不要带伞”,系统需要理解时间、地点、意图,拆成查询天气、判断降水、给出建议等步骤。它不再只是关键词匹配,而是开始像一个工具型助手。对日常信息查询和简单任务处理来说,L2已经能覆盖大量场景。消费者如果需求就是这些,未必需要为更高等级支付溢价。
L3辅助级要求推理和记忆能力。它可以解析复杂意图、融合多源信息、进行任务规划调度,还能建立长期记忆,记住你的偏好和习惯。这个级别是分水岭。没有长期记忆的AI,每次对话都像第一次见面,很难成为真正的助理。L3不只是模型更聪明,还要求系统能调度任务、调用工具、融合不同来源的信息,并在时间里积累对用户的理解。它开始从“工具”走向“助理”。但能力越强,责任也越重。长期记忆意味着数据管理、权限边界、用户控制都必须跟上,否则智能会变成负担。
L4协同级是最高档位,代表自主和进化能力:能在跨设备场景中自主决策、协同工作,并具备持续学习优化的能力。到了这个级别,AI眼镜不再只是一个独立设备,而是跨设备协同的一部分。它要知道什么时候该调用手机,什么时候该连接汽车座舱,什么时候该和耳机、音箱配合。它还要在持续使用中学习优化,而不是靠出厂设定吃老本。L4代表当前消费级AI眼镜的最高能力水准,但它也不是所有用户的必需品。等级高不等于适合所有人,需求匹配比盲目追高更重要。
标准围绕感知、认知、执行、记忆四大维度设置硬性要求。等级越高,产品就越能解析复杂用户意图,实现多源信息融合推理、任务规划调度、动态工具调用以及长期记忆等高阶功能。这里最值得注意的是“硬性要求”四个字。过去厂商可以自己定义智能,现在必须在统一维度上接受判定。感知不行,认知不够,执行不稳,记忆没有,就不能靠营销话术跨级。

三类形态,同一套评价依据
这份标准覆盖三类AI眼镜产品:AI音频眼镜、AI拍摄眼镜、AI+AR眼镜。无论是外置骨传导翻译眼镜、带摄像头拍摄眼镜,还是全息显示AR眼镜,都能获得统一的评价依据。
这一点对市场很有意义。不同形态的AI眼镜,过去常常各说各话。音频眼镜强调翻译和通话,拍摄眼镜强调第一视角记录,AR眼镜强调显示和交互。它们的产品逻辑不同,但一旦都叫“AI眼镜”,消费者就会自然比较:谁更智能?谁只是硬件不同?现在标准把评价语言统一了。音频眼镜不能因为形态简单就逃避认知和记忆要求,AR眼镜也不能因为有显示就自动被认定为高级。显示是能力,但不是智能的全部。拍摄是能力,也不是智能的全部。最终要看感知、认知、执行、记忆四个维度上的实际表现。
标准的发布不是终点,而是行业规范化发展的起点。目前相关部门正面向产业开展AI眼镜智能化能力相关测试评价工作。未来消费者在选购AI眼镜时,可以直接对照等级标识判断产品能力,而不需要再被厂商的营销话术带节奏。当然,标识要真正有用,前提是测试评价足够严谨,认证过程足够透明。如果等级标识被滥用,标准也会被稀释。所以,标准落地只是第一步,执行才是关键。
标准化背后的产业逻辑
过去几年,AI眼镜市场概念繁杂,各家宣传口径并不统一。有的产品把基础的语音助手功能吹成“AI智能”,有的则把传统的蓝牙连接包装成“万物互联”。消费者缺乏判断依据,厂商之间也陷入低水平价格战,真正有技术壁垒的创新产品反而难以脱颖而出。
标准的落地有望改变这种局面。它为研发端提供了明确的技术路线图:厂商可以根据目标等级反向推导需要补足的能力短板。想做L2,就要把多轮对话和任务分解做扎实;想做L3,就要解决推理、多源融合、任务调度和长期记忆;想做L4,就要跨设备协同和持续学习。这比空洞地喊“AI原生”有用得多。
它也为认证端提供了可操作的测试方法,第三方检测机构可以据此出具权威评级报告。更重要的是,标准把“感知、认知、执行、记忆”四个能力维度拆解成可量化指标,让AI眼镜从“玄学”走向“科学”。过去消费者只能看参数表上的芯片型号、电池容量、重量克数,这些数字背后到底意味着什么智能体验,完全靠想象。现在,等级标识会成为一个更直接的判断入口。
业内观点认为,这套分级体系与工信部等五部门此前联合发布的《人工智能应用百人谈》中提出的“智能体能力成熟度模型”形成呼应,共同构建起从终端设备到系统平台的完整评价生态。换句话说,AI眼镜分级不是孤立的。它和更广泛的AI终端、智能体评价体系连接在一起。终端有终端的等级,系统有系统的成熟度,二者共同构成一套从设备到平台的评价网络。
对消费者意味着什么
对普通用户来说,这份标准最直接的价值是降低选购门槛。以前买AI眼镜,你只能看参数表上的芯片型号、电池容量、重量克数。芯片强,不代表交互自然;电池大,不代表任务调度聪明;重量轻,不代表能理解复杂指令。现在只需要看等级标识:L1产品适合基础语音交互需求,L2产品能满足日常信息查询和简单任务处理,L3产品可以承担更复杂的助理型工作,L4产品则代表了当前消费级AI眼镜的最高能力水准。
这不是说等级可以替代一切。佩戴舒适度、镜片素质、续航、隐私设计、生态兼容性,仍然是购买时要考虑的东西。但等级至少把“智能”从广告词里拉出来,变成一个可以对照的维度。消费者不必再被“AI原生”“多模态”这些词绕晕,而是可以直接问:它是L几?它能不能多轮对话?有没有长期记忆?能不能跨设备协同?
更重要的是,标准倒逼厂商从“堆料竞争”转向“能力竞争”。过去一些厂商喜欢把硬件参数吹上天,但实际智能体验大打折扣。分级标准出来后,硬件堆得再高,如果软件能力达不到对应等级的要求,也拿不到相应的标识。这有助于市场回归理性,让真正有技术实力的企业脱颖而出。
“智商大于堆料”这句话,不是否定硬件。没有好的芯片、传感器、音频模组、显示模组,AI眼镜也做不好。但硬件是基础,不是答案。用户买的是体验,不是零件清单。AI眼镜要让人戴得出去,也要让人用得明白。分级标准给了一把尺子,接下来要看厂商怎么量,检测机构怎么测,消费者怎么选。市场不会因为一份标准立刻变干净,但至少,它开始有一把公共的尺子了。