不知道各人有没有这种感受,,,,,每次想和 AI 好好说句话,,,,,总以为哪哪儿都拧巴。。
特殊是,,,,,和 AI 们直接语音相同时,,,,,你能很显着的感受出来 AI 和人的差别。。
由于说究竟,,,,,现在的 AI 语音更像在玩回合制游戏,,,,,你语言它闭嘴,,,,,它语言你挨听。。
你不可自然地停留、插话,,,,,它也分不清你是在跟它语言,,,,,照旧在跟旁边的人语言。。
这种交互上的硬伤,,,,,直接把 AI 死死钉在了答题机和代码工具的生态位上。。
上个月,,,,,OpenAI 就推出了 GPT-Live,,,,,可以做到在语言的同时一连听取用户输入,,,,,获得了外界不少好评。。
但不少人体现,,,,,这有啥,,,,,都是玩剩下的了,,,,,由于早在今年 4 月,,,,,豆包的语音通话模式中,,,,,就已经升级了这一功效。。
前两天,,,,,豆包更是反手直接升级了自家的视频通话能力,,,,,接入了原生音视频多模态全双工大模子 SeedRealtime,,,,,说是能支持更好的音视频明确,,,,,抗滋扰和打断判停能力。。
这个所谓的全模态全双工交互模子,,,,,焦点就是一件事,,,,,针对咱们前面说的几个拧巴的地方,,,,,回合制对话的模式,,,,,举行大版本调解。。
听起来有点意思了,,,,,于是咱们也马上找几个真实场景试了试。。
事实手艺再好再高峻上,,,,,咱们更体贴的,,,,,着实照旧这些新能力究竟实不适用,,,,,用起来能不可更顺、更省心,,,,,真遇到事儿时能不可帮上忙。。
先来个基础的,,,,,看看新版本的豆包视频电话,,,,,究竟照旧不是回合制游戏。。
你还真别说,,,,,现在这个版本的豆包更智慧了,,,,,之前视频的时间,,,,,它就像一个单线程生物,,,,,耳朵和嘴巴只能有 1 个在事情,,,,,它若是启齿语言,,,,,就很难闻声你的新指令;;;;当它在听你语言的时间,,,,,那它就没法思索。。
现在的豆包就好许多,,,,,哪怕在叭叭叭的语言,,,,,但只要听到你的声音,,,,,它立马住嘴,,,,,还会凭证你的新提问修改。。
并且,,,,,你们也能从这个测试里看出来,,,,,它对人类的提问、断句判断更好了。。
以前,,,,,你可能只是卡壳了一下,,,,,整句话并没有说完,,,,,它却 get 不到,,,,,自顾自地就最先回覆你,,,,,但现在,,,,,它基本上都能分辨得出你究竟说没说完,,,,,对话历程更像和一个小姐姐在面扑面谈天。。
不但云云,,,,,现在的豆姐确实有了更强的抗滋扰能力。。
搁以前,,,,,它像长了个顺风耳一样,,,,,身边有点其它新闻,,,,,很容易误判是你的新指令,,,,,转头去回应那些杂音了,,,,,但现在,,,,,它像是有了声纹解锁一样,,,,,基本做到和你 1 对 1 私聊。。
并且,,,,,我们还发明,,,,,现在的豆包视频的识别速率杠杠的。。
好比下面,,,,,我们在玩一个小游戏的时间,,,,,让它帮我们举行武将选择,,,,,就咱这滑动的速率,,,,,效果豆包的识别又快又准。。
在测试中,,,,,我们还发明,,,,,哪怕面临在编辑部玩游戏,,,,,一个人在前面打,,,,,后面坐着几个狗头智囊的情形。。
豆包也完万能 hold 住这样多人对话的重大场景,,,,,它能随时随地在线听各人伙语言,,,,,清晰地分辨出语言工具、内容。。
就连陶醉操作的同事小声嘀咕了一句 “ 怎么冲刺 ”,,,,,都被豆包精准抓包,,,,,然后打上了一个不怎么会玩的标签。。
接下来,,,,,我们给豆包上了点强度,,,,,恰恰编辑部在装测试平台,,,,,我们让豆包当个装机能手,,,,,指导下该怎么操作。。
效果豆包只是简朴扫了眼,,,,,就知道这台测试平台进度怎样。。
紧接着,,,,,我们发明,,,,,豆包除了能在装机历程中指导怎么做,,,,,还能在误操作时,,,,,自动提醒。。
豆包甚至还超有眼力见,,,,,实时盯着我的手部行动,,,,,在装内存条的时间,,,,,自动提条件醒注重正反面,,,,,并且别用蛮力硬怼。。
并且我们发明,,,,,豆包完全可以全流程跟踪装机这种大型使命,,,,,由于就在我们凭证豆包的指导装完显卡,,,,,以为大功告成准备收工时。。
这哥们儿居然查漏补缺了:你丫的显卡的供电线还没接呢!
甚至连角落里最容易被忽略的主板 CPU 供电线,,,,,都被豆包发明了,,,,,主打一个你随便折腾,,,,,哥们兜底。。
并且在这个历程中,,,,,我们还发明了豆包强盛的影象功效。。
由于全程开着视频,,,,,等我们装完测试平台,,,,,准备脱离影棚的时间,,,,,想起来有台测试机不知道放哪儿了。。
于是,,,,,我突然想到,,,,,有没有可能豆包知道,,,,,效果它还真记着了。。
要知道,,,,,这可不但是听懂话,,,,,而简直就是 AI 磕了哆啦 A 梦的影象面包。。
我就问,,,,,平时和真正的人类打电话,,,,,谁会帮你记自己随手放的工具????但豆包偏偏就帮你盯在眼里了。。
若是说装机只是在影棚里的极客游戏,,,,,那在人声鼎沸、流程重大的真实医院里,,,,,豆包还顶得住吗????
于是,,,,,我们把豆包带到了医院,,,,,想试试,,,,,更新完的视频能力能不可辅助一些老人等特殊人群,,,,,在大医院里单独看病。。
到医院门口后,,,,,咱主打一个两眼一抹黑,,,,,问豆包先去哪儿取号。。
豆包体现,,,,,眼前的这个人工挂号窗口,,,,,或者边上的自主取号机取号就行。。
并且,,,,,豆包还知心地给了建议,,,,,告诉我们若是提前预约好了,,,,,人工窗口排队人多,,,,,那照旧选自助取号较量利便。。
凭证指导取好预约号之后,,,,,常见的问题就是不知道该怎么上楼找到自己的诊室,,,,,特殊是一些大医院,,,,,很容易把病人给绕晕了,,,,,但现在,,,,,你只要给豆包看一看,,,,,它会告诉你怎么走。。
同样的,,,,,到了诊室门口,,,,,现在许多医院都得先签到才会进入排队行列,,,,,但差别医院、科室的签到、报到规则、机械都不大一样,,,,,不少人都会傻眼,,,,,豆包就能一眼告诉你怎么操作。。
我们整一个测试下来,,,,,从医院大门最先,,,,,豆包一步步带我们去自助机取号、然后找到电梯抵达指定楼层、签到。。。。。。除了途经的护士小姐姐和路人,,,,,会用希奇的眼光视察世超,,,,,险些挑不出任何误差。。
以是,,,,,在取号、找楼层、识别签到装备这些流程性使命上,,,,,豆包已经能提供全程陪同的资助。。
以是,,,,,总得看下来,,,,,豆包的视频能力确实有了不小的提升,,,,,但在我们看来,,,,,最有意思的前进并不是豆包能多认几个工具、或者说能更快地举行反映,,,,,而是它真的在实验明确你的语气、声音等等,,,,,真学会了像人一样和人相同。。
咱们也去研究了一下,,,,,为啥现在豆包的视频能力前进得这么快,,,,,发明真正的元勋就是它底层的SeedRealtime。。
以前 AI 里所谓的视频通话,,,,,实质上都是流水线:
AI 先听到声音,,,,,然后转成文字,,,,,看一眼屏幕截图,,,,,综合起来处理思索,,,,,最后天生语音回覆。。
这种串联思绪,,,,,每个方法的反映处理再快,,,,,连起来就显得慢半拍。。
但 SeedRealtime 最狠的一点,,,,,是将声音、画面、时序与表达,,,,,全都融进了一个端到端模子。。
这么一来,,,,,看听说在统一套系统里举行,,,,,不分方法不分前后,,,,,AI 就能通过手势和现场画面,,,,,秒懂你说的 “ 这个,,,,,内个儿 “ 指的是啥,,,,,也才华精准地过滤掉旁人的杂音。。
同样的,,,,,能一连明确视频里的场景转变,,,,,AI 也就能分得清啥时间该闭嘴,,,,,啥时间能自动启齿提醒了。。
最后,,,,,给人的体现就是明确察言观色,,,,,像个真正的人了。。
在搞明确了这些底层逻辑后,,,,,你就会发明,,,,,豆包这次展现出来的能力,,,,,也是现在整个 AI 行业死磕的偏向之一。。
隔邻的外洋大厂们也在提实时语音、多模态交互和思索模子,,,,,除了咱们前面提到的 GPT?Live,,,,,OpenAI 也还拿出 Thinking Machines 露脸,,,,,但它的功效还在演示阶段、没法让公众随手洞开了用。。
以是豆包的这个音视频全双工能力,,,,,才是真正最先往我们期待的贾维斯偏向进化了。。
虽然了,,,,,这离贾维斯尚有不少距离,,,,,现在你还得随处举个手机,,,,,视频通话也受网络、续航等等条件。。
但至少从这次体验看,,,,,AI 助手正在从 “ 你问一句、它答一句 ”,,,,,酿成一个能边看、边听、边协助的角色。。
再多说两句,,,,,咱们突然以为手机这个形态,,,,,有点制约未来 AI 的能力了,,,,,若是这个视频能力未来可以跳出到手机以外,,,,,像是智能眼镜、手环、AI 小硬件 ( 虽然,,,,,得搞定续航、散热、网络、算力等等问题 ),,,,,或许真是一个完全崭新的原生 AI 天下了。。
以是,,,,,不久的未来,,,,,若是看到谁在大街上嘀嘀咕咕,,,,,别以为人家是魔怔了,,,,,或许他正在和豆包打电话呢。。