你戴的AI眼镜,可能跑着一个“减配”的大模型
2026-09-07 15:57:59

先别急着反驳。


打开你手里那副AI眼镜的语音助手,连续问它三个问题:第一个是“今天天气怎么样”,第二个是“帮我记一下明天下午三点开会”,第三个是“你觉得我最近拍的那张照片构图有什么问题”。前两个大概率能答上来,第三个开始支吾,或者给出一个通用到没用的回答。

这不是某一家品牌的问题。端侧AI——跑在设备本地、不依赖云端服务器的AI模型——目前普遍处于一种“能用,但不好用”的尴尬状态。能用,是因为基础语音交互、简单指令执行、预制问答这些功能已经跑通了。不好用,是因为一旦涉及复杂推理、多轮上下文理解、跨模态任务,端侧模型就露怯。


消费者不一定理解这背后的技术差异。他们只是觉得,宣传片里的AI眼镜和手里的AI眼镜,像是两款产品。宣传片里能实时翻译、能识别物体、能像助理一样对话;实际用起来,语音唤醒偶尔失灵,翻译延迟明显,物体识别范围有限,对话超过三轮就开始跑偏。


问题出在哪儿?


算力、功耗、发热:三角死锁

把一个大模型塞进眼镜里,比把大模型装进手机难得多。这个判断听起来反常识——手机体积更大,眼镜更小,当然更难。但难处远不止体积。


一副智能眼镜对重量极其敏感。超过50克,长时间佩戴就会不舒服;超过80克,大多数人根本不想戴。这个重量限制直接约束了电池容量。手机可以轻松塞进4500毫安时的电池,眼镜可能连500毫安时都很难做到。电池小,意味着算力预算极低。


算力芯片本身也是个问题。端侧AI需要专用的神经网络处理器,但高性能芯片的功耗和发热都不低。眼镜的镜腿空间狭小,散热能力极差。芯片持续高负载运转,镜腿会发烫,用户会直接感受到不适。所以端侧模型必须被“压着跑”——限制算力、限制功耗、限制运行时间。


这就形成了一个三角死锁:要更强的模型,就需要更多算力;更多算力带来更高功耗和发热;更高功耗需要更大电池;更大电池增加重量;重量增加又牺牲佩戴体验。每个环节都在往同一个方向挤压,结果就是端侧模型不得不做减法。


最直接的减法是模型本身。云端模型可以轻松跑到几百亿甚至上千亿参数,端侧模型通常被压缩到几十亿参数以内。这个差距不是线性的,是数量级的。一个30亿参数的模型和一个300亿参数的模型,在语言理解、推理深度、知识广度上的差异,任何一个用户都能在日常对话中感受到。


这就是“阉割版”说法的来源。严格来说,端侧模型不是把云端模型“砍一刀”那么简单,而是重新设计、重新训练、重新优化的结果。但对消费者来说,体感就是“它不够聪明”。


工程上的坎,比模型本身更难跨

参数规模只是一道坎。更大的挑战在于工程实现。


第一道坎是模型压缩与蒸馏。把一个大模型的能力压缩到小模型里,这个过程不是简单的裁剪,而是需要用大模型作为“老师”,让“学生”模型在海量交互中模仿老师的输出。这个过程的损耗是不可避免的。一个经过蒸馏的7B模型,在某些基准测试上可能接近70B模型的表现,但在开放域对话、长尾知识、复杂推理上,差距依然明显。模型压缩的每一步都在权衡:保什么、舍什么、什么时候妥协。


第二道坎是推理优化。端侧推理需要针对特定芯片做深度适配。同样的模型,在A芯片上跑得流畅,在B芯片上可能卡顿。这不仅是算力差异,还涉及内存带宽、算子支持、量化方案这些底层细节。一个团队如果只是把开源模型拿来,不做针对性优化,跑出来的效果和做了深度调优的团队完全两回事。这个差距在产品体验上会被无限放大。


第三道坎是场景适配。通用大模型回答泛泛的问题没问题,但戴在脸上的设备需要理解语境。用户说“看看前面的路牌”,模型需要知道摄像头在拍什么,需要和视觉模块协作。用户说“帮我回复一下刚才那条消息”,模型需要理解“刚才那条”指向哪条消息,需要和通讯模块打通。这些场景不是靠模型能力就能解决的,需要端侧模型和整个软硬件系统深度集成。做得不好的结果是:模型本身不笨,但用户觉得它笨,因为它在具体场景里使不上劲。


第四道坎更隐蔽:持续学习。云端模型可以不断更新,昨天用户反馈的问题今天就能修复。端侧模型更新慢得多。用户拿到的固件版本决定了模型版本,如果厂商不再推送更新,模型就停在原地。这意味着端侧AI的真实体验高度依赖厂商的长期投入。那些只想赚一笔硬件钱的品牌,不会投入资源持续优化模型。眼镜用了半年,AI能力就和买来时一样,甚至会因为后台服务关停而变得更差。


“能用”到“好用”,隔着无数次打磨

行业里有一种说法:端侧大模型的竞争,本质上不是算法竞赛,而是工程竞赛。这话有些绝对,但抓住了要害。算法决定了上限,工程决定了下限。用户感受到的是下限,不是上限。


一个典型的例子是语音唤醒。听起来简单,但要做到戴着眼镜在嘈杂环境里准确唤醒、不误触发,需要大量的声学模型训练和场景数据积累。地铁里、马路边、咖啡馆里,背景噪音完全不同。如果唤醒成功率只有90%,意味着每十次喊“打开AI”,就有一次没反应。用户不会觉得这是技术局限,只会觉得产品不行。


再比如多模态理解。眼镜的摄像头视野和手机不同,用户看到的东西和摄像头拍到的东西存在偏差。模型需要理解这种偏差,理解用户“看前面”时指的是哪个方向,理解环境光线不足时拍到的模糊物体可能是什么。这些细节需要大量真实场景数据去训练,需要不断迭代。实验室里的演示效果再好,到了真实环境就露怯的例子太多了。


秋果计划在做的事情,方向不算新奇,但难在坚持。端侧AI的算力困局是整个行业共同的难题,这不是一家公司能独自解决的问题。但在算法优化和场景化调优上持续投入,把大模型能力真正落地到穿戴设备,这件事本身就有价值。行业里做端侧AI的公司很多,愿意在“打磨”这件事上花时间的,比想象中少。因为打磨没有惊天动地的新闻点,只有一轮一轮的测试、反馈、修复、再测试。


数贸会现场展示的东西,观众看到的是最终体验。但最终体验的背后是无数个被否掉的版本、无数次参数调整、无数个深夜的调试。这些过程不会出现在宣传材料里,但它们决定了用户拿到产品后的第一感受。


端侧AI的算力困局短期内不会有根本性突破。芯片制程进步带来的红利在放缓,电池能量密度的提升比预期慢,散热技术也没有革命性方案。这意味着端侧模型在可预见的未来,仍然需要在“减配”和“体验”之间做精细的平衡。谁能在资源极度受限的条件下,把体验做到接近云端模型的水平,谁就掌握了穿戴设备AI化的下一阶段入口。


这个判断并不复杂,但做起来每一步都很重。真正能把大模型装进眼镜里的公司,跨过的不是一道坎,是一连串坎的组合:算力坎、功耗坎、重量坎、模型压缩坎、场景适配坎、持续更新坎。每道坎都在劝退一批人。留下来的,是愿意把“能用”推到“好用”的那些。


9月23日,数贸会现场。如果你正好在,可以去体验一下。不用听介绍,戴上试试就知道,一副眼镜里的AI到底是“减配”还是“够用”,你的耳朵和眼睛会告诉你答案。这个答案比任何参数表和宣传稿都诚实。

核心产品
    联系方式
      Public QR Code
      官方公众号
      Affairs QR Code
      商务合作