凯时AG

环球热门新闻资讯
2026-07-24 21:24:12
首页 > 新闻 > 时政要闻 > 正文

全天下都在讲 AI 话|AI 器物志

智能手机统治了已往十几年的数字生态,,,,它是注重力的黑洞,,,,是我们最私密的随身之物。 。但手机从设计之初就是为「人盯着它」而生的——它的所有逻辑,,,,都止于屏幕。 。 AI 的需求却恰恰相反:它需要一连感知物理天下——见你所见,,,,听你所闻,,,,随时在场,,,,而非等你解锁屏幕才醒来。 。 当 AI 真正成为一种基础能力,,,,它早晚要从屏幕里破壳而出,,,,寻找属于它自己的形状。 。这将是一个漫长的探索和演化历程。 。 「AI 器物志」栏目由此而来,,,,爱范儿想和你一起一连视察:AI 怎样改变硬件设计,,,,怎样重塑人机交互,,,,以及更主要的——AI 将以怎样的形态进入凯时AG日常生涯? ? ?? 这是「AI 器物志」的第 19 篇文章。 。

已往两年里,,,,AI 最显着的转变不但是模子变智慧,,,,而是它的定位从少数人的专业工具,,,,转酿成了日常生涯的基础能力。 。

现在,,,,我们更是习惯了在走路、开车、做饭甚至摸鱼时代,,,,随时随地向 AI 发出指令。 。

图|Google

只不过随着频率提高,,,,以 PC 时代键鼠交互为主的人机交互方式正在逐渐袒露出短板——

「手动打字」需要用户先有一个想法,,,,再将散乱的思绪组织成连贯语言,,,,还要在叙述中坚持一定的逻辑关系,,,,才华将脑壳里想的酿成 AI 能够明确的提醒。 。

The Passion of Creation|Leonid Pasternak

而在键盘的另一边,,,,手机时代所主导的「语音输入」就险些没有这样的桎梏。 。

事实讲话和打字最大的区别,,,,就是语音允许人们一边输出,,,,一边思索、增补和修正,,,,相比键盘输入更靠近头脑原本爆发的方式。 。

别的,,,,语音输入不需要稳固的桌面情形,,,,也不要求用户一连垂头,,,,更不必优异的文字表达能力——

关于绝大大都没有受过系统写作训练的通俗人来说,,,,语音远比文字输入更靠近「真正的自然交互」。 。

这种普遍的需求之下,,,,自然也催生出了一批围绕语音入口睁开的产品。 。

好比势头正盛的 Plaud,,,,主打的就是将录音、转写和总结包装成完整事情流;;

成为样板产品的 Typeless 则认真删除语气词、举行名堂洗濯后「帮你成文」。 。

诸如光帆 Lightwear 之类的可衣着装备则更进一步,,,,试图整合出一条古板智能手机之外,,,,全场景的完整 AI 使用流。 。

图|光帆科技

这些产品的形态各不相同,,,,押注的却是统一件事:

下一代 AI 入口,,,,未须要求用户坐下来、翻开应用并认真打字。 。

「自然语言交互」听上去很是先进,,,,但它先进的地方着实是相同效率,,,,手艺原理上并没有什么惊天地泣鬼神的地方。 。

门槛最低的方案,,,,就是一副 TWS 耳机加手机上的 AI,,,,就能组成一个 24 小时在线的虚拟副手。 。

初代 AirPods 广告《Bounce》|Apple

事实耳机原来就在耳朵里,,,,手机系统与第三方 app 也有现成的语音转写、快捷指令和跨应用输入。 。

不需要任何专用硬件,,,,就可以把你散碎的下令转达给任何一个 AI 模子。 。

更残酷的是,,,,它的速率、兼容性和跨装备能力,,,,仍然优于市面上大大都号称「开创先河」的专用 AI 硬件——

图|Mashable

然而现真相形是,,,,这套近乎无门槛的组合,,,,真正的瓶颈不在手机、而在麦克风对情形人声的处理。 。

就拿 AirPods 为例,,,,由于 AirPods 的麦克风战略强调声音自然度、不肯意给人声降噪,,,,在多人情形里经;;岱浩鸾芪в镅缘纳粢徊⑹章薜阶晌淖值奈侍狻 。

这关于打电话或者发语音没什么,,,,但关于 AI 输入,,,,一旦提醒词「夹生」,,,,就很容易获得完全不相关的回覆:

相比之下,,,,国产品牌的 TWS 耳机普遍接纳磷泣激进的人声隔离战略,,,,牺牲了一些通透模式自然度,,,,换来了电话和 AI 语音时代更好的准确率。 。

若是往更深层看,,,,这意味着在 AI 成为「主流使用场景」确当下,,,,耳机优劣的评价标准正在改变——

已往耳机比的是音质、延迟和降噪,,,,未来除了前面这些,,,,更要较量人声降噪的强度、准确性和疏散能力。 。

甚至我们可以说,,,,耳机麦克风正在从逐渐被人遗忘的通话配件,,,,一举酿成了最前端的 AI 控制器。 。

Mission: Impossible (1996)

语音指挥的第二条蹊径,,,,则是智能眼镜。 。

只管智能眼镜总是强调「给人生加上一块 HUD」,,,,但从商品化效果来看,,,,唯一乐成的智能眼镜仍是以语音、照相和开放式音频为焦点的基础款。 。

图|Laptop Mag

这背后的原因倒不重大:眼镜显示系统会牺牲重量、续航和本钱,,,,更需要从 0 作育一套全新的用户使用习惯。 。

而「望见什么问什么,,,,AI 讲给你听」,,,,自己就足够组成一个相对清晰的 AI 卖点了。 。

但智能眼镜的问题在于,,,,它的「无感」更多保存于宣传片里。 。

事实当一副带摄像头的眼镜一连朝向别人时,,,,对方很难判断装备是否正在拍摄或者收音,,,,这种不确定性自己就会制造社交压力。 。

再加上受限于体积和续航,,,,智能眼镜的麦克风阵列、通话降噪和扬声器效果,,,,纷歧定比成熟的 TWS 耳机更好。 。

图|Stuff

更主要的是,,,,在现在智能眼镜的销售模式中,,,,这类产品往往与品牌客户端和云端模子深度绑定,,,,用户在模子选择、数据迁徙和跨装备切换方面缺乏自由度。 。

最简朴的例子就是 Meta。 。

Meta Ray-Ban 智能眼镜在各个方面都较量平衡,,,,却强制用户毗连 Meta AI,,,,不可作为蓝牙音频装备直接叫醒 Siri 或者其他智能助手。 。

图|Engadget

这种水平的绑定让智能眼镜虽然成为了「语音 AI 交互」的代表性产品,,,,却很难成为谁人主流产品。 。

第三条蹊径,,,,则是 2026 年以来逐渐兴起的蹊径——为语音输入 AI 制造自力硬件入口。 。

好比刚刚 OpenAI 与 Work Louder 联名的的 Codex Micro,,,,就是一块面向 AI 智能体的外置控制台。 。

并且上面专门设置了一个用于语音输入的 push-to-talk(PTT)按键:

图|OpenAI

只管 Codex Micro 自己没有麦克风,,,,PTT 需要挪用电脑毗连的其他收音装备,,,,但这种设计依然具有象征意义:

语音输入已经不再只是 UI 中的一个小图标,,,,而最先逐渐获得类似鼠标右键、手机照相键或者键盘指纹一样的稳固的物理位置。 。

将语音输入单独作为一个按键设置,,,,基本上认可了这种 AI 交互方式的高频属性——甚至对某些用户可能比 26 个字母键都要更高频。 。

罗永浩演示 TNT

而 PTT/TNT 更进一步的设想,,,,就是彻底挣脱屏幕。 。

爱范儿之前爆料过,,,,OpenAI 正在妄想的若干硬件产品中,,,,就包括一个无屏的便携装备,,,,通过语音、摄像头和情形传感器明确用户所处的情境。 。

图|MacRumors

若是 OpenAI 真的这样设计,,,,无异于认可了一经 Humane AI Pin 的蹊径。 。

虽然,,,,背后有 ChatGPT 和 Codex 做背书,,,,OpenAI 的徽章肯定会比 Humane 的更适用。 。

与此同时,,,,面临 AI 语音交互最难绕开的两个问题:公共场合说出个人安排的尴尬,,,,以及嘈杂情形中的识别失真,,,,研究者们也有了一些奇思妙想。 。

好比近期泛起的一些「超声波舌部行动识别」装备,,,,通过抵在下颌的超声波探头读取舌头运动,,,,再用机械学习将其解码为语言:

图|Hackaday

另一些研究则实验把传感器装进眼镜或头显,,,,通过面颊、颧骨和口部的细微运动识别无声指令——之前被苹果悄悄收购的 Q.ai 就是研究这个偏向的。 。

这些装置距离消耗级产品仍然很远,,,,识别规模、准确率和佩带体验也保存显着限制,,,,但偏向已经足够清晰。 。

未来的「语音输入」未必真的需要爆发声音——所谓语音交互,,,,最终可能演化为对人类发声行动、口型以致面部肌肉活动的直接识别。 。

图|Game Anim

帮我算算 token 用量

归根结底,,,,为什么语音输入能够在 AI 时代获得逾越键盘的声望,,,,照旧由于人类不是纯粹的「视觉动物」。 。

换言之,,,,人们虽然习惯于用眼睛吸收信息,,,,但并不善于用视觉信号发送信息。 。

在转达信息这件事上,,,,我们仍然遵照着 30 万年前的习惯:发出「咕咕嘎嘎」的声音就是要比打手势效率高。 。

《九品芝麻官之白面包青天》(1994)

用语音指挥 AI,,,,看似是一种相对低效的使用方式——人在讲话时经常重复、跑题,,,,表达也很难称得上精炼。 。

但它最大的特点,,,,就是消弭了 AI 的工具感。 。

无论用户潜意识里把 AI 看成下属、秘书照旧同伴,,,,以对话作为交流前言,,,,始终比填写下令框更靠近人类本源的协作方式:

然而「语音交互」虽然便当,,,,这种便当的隐性本钱也在上升。 。

古板 STT 工具只认真把声音转换成文字,,,,最终模子用来计费的只有转换后的文本输入与输出 token;;

而 Typeless 之类的「文本洗濯」工具还要特殊挪用模子,,,,对口语举行整理和改写,,,,再把整理后的内容发送给另一个 AI,,,,中心又叠加了一层 token 消耗。 。

图|MakeUseOf

而当各家的多模态模子进入「原生音频」的阶段之后,,,,由于需要一连处理声音、上下文、语气、打断和输出,,,,一个事情阶段内的 token 消耗量往往是纯文本的 10 倍或更高。 。

虽然与高清图片和视频处理相比,,,,语音处理的总 token 本钱依然不算离谱,,,,但它已经不再是一个可以忽略的隶属功效。 。

尤其在长时间实时对话中,,,,用户很难像输入文字那样自动控制信息长度,,,,模子却必需一连维持毗连、明确上下文并天生反馈。 。

图|Mashable

这就导致 AI 语音交互越自然,,,,背后的盘算历程反而越重大,,,,用户最终的消耗本钱也就更高。 。

这一点险些成为了最近 AI 厂商们的一种「阳谋」——

事实勉励语音交互一方面利益多多,,,,另一方面更是将 token 消耗量推上一个新台阶,,,,没有厂商会和收费过不去。 。

因此,,,,关于模子厂商以及配件品牌来说,,,,未来 AI 营业的竞争不但是能不可听懂人话。 。

更要害的是,,,,谁能以更低延迟、更少冗算和更透明的计费,,,,协调洽差别模态营业之间重大的本钱差别。 。

事实让人们启齿对 AI 降P蘑不难,,,,真正难的是让人们想要一直说下去。 。

克日,,,,在浙江杭州技师学院操场上,,,,一架供销社的T100植保无人机徐徐升空,,,,旋翼搅动气流,,,,机身稳稳悬停后沿预设航线低飞掠过。 ;;绽镒白徘逅,,,,细密水雾匀称洒落。 。一名西席带着几个学生站在操场边,,,,紧盯航向和高度数据,,,,时时发出调解指令。 。

责任编辑:黄佩瑜

【网站地图】