智能手机统治了已往十几年的数字生态,,,,它是注重力的黑洞,,,,是我们最私密的随身之物。。但手机从设计之初就是为「人盯着它」而生的——它的所有逻辑,,,,都止于屏幕。。 AI 的需求却恰恰相反:它需要一连感知物理天下——见你所见,,,,听你所闻,,,,随时在场,,,,而非等你解锁屏幕才醒来。。 当 AI 真正成为一种基础能力,,,,它早晚要从屏幕里破壳而出,,,,寻找属于它自己的形状。。这将是一个漫长的探索和演化历程。。 「AI 器物志」栏目由此而来,,,,爱范儿想和你一起一连视察:AI 怎样改变硬件设计,,,,怎样重塑人机交互,,,,以及更主要的——AI 将以怎样的形态进入凯时AG日常生涯???? 这是「AI 器物志」的第 19 篇文章。。
已往两年里,,,,AI 最显着的转变不但是模子变智慧,,,,而是它的定位从少数人的专业工具,,,,转酿成了日常生涯的基础能力。。
现在,,,,我们更是习惯了在走路、开车、做饭甚至摸鱼时代,,,,随时随地向 AI 发出指令。。
图|Google
只不过随着频率提高,,,,以 PC 时代键鼠交互为主的人机交互方式正在逐渐袒露出短板——
「手动打字」需要用户先有一个想法,,,,再将散乱的思绪组织成连贯语言,,,,还要在叙述中坚持一定的逻辑关系,,,,才华将脑壳里想的酿成 AI 能够明确的提醒。。
The Passion of Creation|Leonid Pasternak
而在键盘的另一边,,,,手机时代所主导的「语音输入」就险些没有这样的桎梏。。
事实讲话和打字最大的区别,,,,就是语音允许人们一边输出,,,,一边思索、增补和修正,,,,相比键盘输入更靠近头脑原本爆发的方式。。
别的,,,,语音输入不需要稳固的桌面情形,,,,也不要求用户一连垂头,,,,更不必优异的文字表达能力——
关于绝大大都没有受过系统写作训练的通俗人来说,,,,语音远比文字输入更靠近「真正的自然交互」。。
这种普遍的需求之下,,,,自然也催生出了一批围绕语音入口睁开的产品。。
好比势头正盛的 Plaud,,,,主打的就是将录音、转写和总结包装成完整事情流;;
成为样板产品的 Typeless 则认真删除语气词、举行名堂洗濯后「帮你成文」。。
诸如光帆 Lightwear 之类的可衣着装备则更进一步,,,,试图整合出一条古板智能手机之外,,,,全场景的完整 AI 使用流。。
图|光帆科技
这些产品的形态各不相同,,,,押注的却是统一件事:
下一代 AI 入口,,,,未须要求用户坐下来、翻开应用并认真打字。。
「自然语言交互」听上去很是先进,,,,但它先进的地方着实是相同效率,,,,手艺原理上并没有什么惊天地泣鬼神的地方。。
门槛最低的方案,,,,就是一副 TWS 耳机加手机上的 AI,,,,就能组成一个 24 小时在线的虚拟副手。。
初代 AirPods 广告《Bounce》|Apple
事实耳机原来就在耳朵里,,,,手机系统与第三方 app 也有现成的语音转写、快捷指令和跨应用输入。。
不需要任何专用硬件,,,,就可以把你散碎的下令转达给任何一个 AI 模子。。
更残酷的是,,,,它的速率、兼容性和跨装备能力,,,,仍然优于市面上大大都号称「开创先河」的专用 AI 硬件——
图|Mashable
然而现真相形是,,,,这套近乎无门槛的组合,,,,真正的瓶颈不在手机、而在麦克风对情形人声的处理。。
就拿 AirPods 为例,,,,由于 AirPods 的麦克风战略强调声音自然度、不肯意给人声降噪,,,,在多人情形里经;;岱浩鸾芪в镅缘纳粢徊⑹章薜阶晌淖值奈侍狻。
这关于打电话或者发语音没什么,,,,但关于 AI 输入,,,,一旦提醒词「夹生」,,,,就很容易获得完全不相关的回覆:
相比之下,,,,国产品牌的 TWS 耳机普遍接纳磷泣激进的人声隔离战略,,,,牺牲了一些通透模式自然度,,,,换来了电话和 AI 语音时代更好的准确率。。
若是往更深层看,,,,这意味着在 AI 成为「主流使用场景」确当下,,,,耳机优劣的评价标准正在改变——
已往耳机比的是音质、延迟和降噪,,,,未来除了前面这些,,,,更要较量人声降噪的强度、准确性和疏散能力。。
甚至我们可以说,,,,耳机麦克风正在从逐渐被人遗忘的通话配件,,,,一举酿成了最前端的 AI 控制器。。
Mission: Impossible (1996)
语音指挥的第二条蹊径,,,,则是智能眼镜。。
只管智能眼镜总是强调「给人生加上一块 HUD」,,,,但从商品化效果来看,,,,唯一乐成的智能眼镜仍是以语音、照相和开放式音频为焦点的基础款。。
图|Laptop Mag
这背后的原因倒不重大:眼镜显示系统会牺牲重量、续航和本钱,,,,更需要从 0 作育一套全新的用户使用习惯。。
而「望见什么问什么,,,,AI 讲给你听」,,,,自己就足够组成一个相对清晰的 AI 卖点了。。
但智能眼镜的问题在于,,,,它的「无感」更多保存于宣传片里。。
事实当一副带摄像头的眼镜一连朝向别人时,,,,对方很难判断装备是否正在拍摄或者收音,,,,这种不确定性自己就会制造社交压力。。
再加上受限于体积和续航,,,,智能眼镜的麦克风阵列、通话降噪和扬声器效果,,,,纷歧定比成熟的 TWS 耳机更好。。
图|Stuff
更主要的是,,,,在现在智能眼镜的销售模式中,,,,这类产品往往与品牌客户端和云端模子深度绑定,,,,用户在模子选择、数据迁徙和跨装备切换方面缺乏自由度。。
最简朴的例子就是 Meta。。
Meta Ray-Ban 智能眼镜在各个方面都较量平衡,,,,却强制用户毗连 Meta AI,,,,不可作为蓝牙音频装备直接叫醒 Siri 或者其他智能助手。。
图|Engadget
这种水平的绑定让智能眼镜虽然成为了「语音 AI 交互」的代表性产品,,,,却很难成为谁人主流产品。。
第三条蹊径,,,,则是 2026 年以来逐渐兴起的蹊径——为语音输入 AI 制造自力硬件入口。。
好比刚刚 OpenAI 与 Work Louder 联名的的 Codex Micro,,,,就是一块面向 AI 智能体的外置控制台。。
并且上面专门设置了一个用于语音输入的 push-to-talk(PTT)按键:
图|OpenAI
只管 Codex Micro 自己没有麦克风,,,,PTT 需要挪用电脑毗连的其他收音装备,,,,但这种设计依然具有象征意义:
语音输入已经不再只是 UI 中的一个小图标,,,,而最先逐渐获得类似鼠标右键、手机照相键或者键盘指纹一样的稳固的物理位置。。
将语音输入单独作为一个按键设置,,,,基本上认可了这种 AI 交互方式的高频属性——甚至对某些用户可能比 26 个字母键都要更高频。。
罗永浩演示 TNT
而 PTT/TNT 更进一步的设想,,,,就是彻底挣脱屏幕。。
爱范儿之前爆料过,,,,OpenAI 正在妄想的若干硬件产品中,,,,就包括一个无屏的便携装备,,,,通过语音、摄像头和情形传感器明确用户所处的情境。。
图|MacRumors
若是 OpenAI 真的这样设计,,,,无异于认可了一经 Humane AI Pin 的蹊径。。
虽然,,,,背后有 ChatGPT 和 Codex 做背书,,,,OpenAI 的徽章肯定会比 Humane 的更适用。。
与此同时,,,,面临 AI 语音交互最难绕开的两个问题:公共场合说出个人安排的尴尬,,,,以及嘈杂情形中的识别失真,,,,研究者们也有了一些奇思妙想。。
好比近期泛起的一些「超声波舌部行动识别」装备,,,,通过抵在下颌的超声波探头读取舌头运动,,,,再用机械学习将其解码为语言:
图|Hackaday
另一些研究则实验把传感器装进眼镜或头显,,,,通过面颊、颧骨和口部的细微运动识别无声指令——之前被苹果悄悄收购的 Q.ai 就是研究这个偏向的。。
这些装置距离消耗级产品仍然很远,,,,识别规模、准确率和佩带体验也保存显着限制,,,,但偏向已经足够清晰。。
未来的「语音输入」未必真的需要爆发声音——所谓语音交互,,,,最终可能演化为对人类发声行动、口型以致面部肌肉活动的直接识别。。
图|Game Anim
帮我算算 token 用量
归根结底,,,,为什么语音输入能够在 AI 时代获得逾越键盘的声望,,,,照旧由于人类不是纯粹的「视觉动物」。。
换言之,,,,人们虽然习惯于用眼睛吸收信息,,,,但并不善于用视觉信号发送信息。。
在转达信息这件事上,,,,我们仍然遵照着 30 万年前的习惯:发出「咕咕嘎嘎」的声音就是要比打手势效率高。。
《九品芝麻官之白面包青天》(1994)
用语音指挥 AI,,,,看似是一种相对低效的使用方式——人在讲话时经常重复、跑题,,,,表达也很难称得上精炼。。
但它最大的特点,,,,就是消弭了 AI 的工具感。。
无论用户潜意识里把 AI 看成下属、秘书照旧同伴,,,,以对话作为交流前言,,,,始终比填写下令框更靠近人类本源的协作方式:
然而「语音交互」虽然便当,,,,这种便当的隐性本钱也在上升。。
古板 STT 工具只认真把声音转换成文字,,,,最终模子用来计费的只有转换后的文本输入与输出 token;;
而 Typeless 之类的「文本洗濯」工具还要特殊挪用模子,,,,对口语举行整理和改写,,,,再把整理后的内容发送给另一个 AI,,,,中心又叠加了一层 token 消耗。。
图|MakeUseOf
而当各家的多模态模子进入「原生音频」的阶段之后,,,,由于需要一连处理声音、上下文、语气、打断和输出,,,,一个事情阶段内的 token 消耗量往往是纯文本的 10 倍或更高。。
虽然与高清图片和视频处理相比,,,,语音处理的总 token 本钱依然不算离谱,,,,但它已经不再是一个可以忽略的隶属功效。。
尤其在长时间实时对话中,,,,用户很难像输入文字那样自动控制信息长度,,,,模子却必需一连维持毗连、明确上下文并天生反馈。。
图|Mashable
这就导致 AI 语音交互越自然,,,,背后的盘算历程反而越重大,,,,用户最终的消耗本钱也就更高。。
这一点险些成为了最近 AI 厂商们的一种「阳谋」——
事实勉励语音交互一方面利益多多,,,,另一方面更是将 token 消耗量推上一个新台阶,,,,没有厂商会和收费过不去。。
因此,,,,关于模子厂商以及配件品牌来说,,,,未来 AI 营业的竞争不但是能不可听懂人话。。
更要害的是,,,,谁能以更低延迟、更少冗算和更透明的计费,,,,协调洽差别模态营业之间重大的本钱差别。。
事实让人们启齿对 AI 降P蘑不难,,,,真正难的是让人们想要一直说下去。。
克日,,,,在浙江杭州技师学院操场上,,,,一架供销社的T100植保无人机徐徐升空,,,,旋翼搅动气流,,,,机身稳稳悬停后沿预设航线低飞掠过。;;绽镒白徘逅,,,,细密水雾匀称洒落。。一名西席带着几个学生站在操场边,,,,紧盯航向和高度数据,,,,时时发出调解指令。。