Earlier
ThoughtJul 26
Click to view

周末试用了 OpenAI 的语音模式,应该就用了之前发布的 GPT-Live 技术,整体感受:

  1. 在声调、口吻、轻重变化上都更接近真人对话;
  2. 中间会有不少语气词和过渡语,类似人在思考时的习惯用语——其实也是在降低模型压力;
  3. 对于我的输入打断有比较好的停止和回应,接近一个好的聆听者。

当然和真人对话依旧有很大的差异——那就是在真实对话中,如果我在思考,真人也知道我在思考,通常会静静等我想好,给我思考的空间。

当前 GPT-Live 的这种呼吸感还是不强,可能在我思考的间隙就会开始说话,这会让我很焦虑。

如果一个语音交互模型能够识别到内容,发现我可能处于思考状态,能够只给出一个类似“我在听”的回应,那么整个语音交互的体验就会再上一个台阶。

ThoughtJul 20

看到一句很有道理的话:完美主义本质上是不能抓住重点,分不清主次。

ThoughtJul 9
Click to view

昨天 OpenAI 发布了 GPT-Live,用来替代 ChatGPT 的语音模式。

  • GPT-Live 的做法是把回合制扔掉,直接上全双工。它同时接收音频流和生成音频流,每秒做多次决策:该听、该说、该安静、该插话、该调工具。
  • 另一个有意思的设计是他们把对话体验和深度推理拆开了。GPT-Live 自己只负责流式交互这一件事,遇到需要搜索、需要推理的重活儿,就异步委托给 GPT-5.5,自己继续跟用户聊着。等后台结果好了,再塞回对话流里。
  • 还有个细节:他们给 GPT-Live 单独做了语音安全。因为全双工是流式输出,安全检测不能等一句话说完再判断,得在说话的过程中实时介入。具体怎么做的没说,比如是在 token 级加安全头、还是旁路跑一个轻量安全模型监听输出流。但方向是对的——语音场景下,安全不能后置。

后续如果能够支持视频和屏幕共享的语音交互,那就更有意思了。

ThoughtJun 1
Click to view

周末猫丢了,家里一起想个各种办法,找了半天找不着。最后还是找了专业的找猫团队,10 分钟就解决了。不得不说,找猫就是非常典型的 AI 中短期内无法替代的工作:

  1. 对操作的精细度要求极高,难以学习;
  2. 操作流当中存在大量无法简单描述的“经验”和“判断”,工作流难以很好地定义;
  3. 缺乏大量公开资料,或者视频学习材料(需求少、领域比较冷门)。
AI

第 1 页,共 2 • 21 篇

小天

小天

拥抱 AI,保留人味儿

RSS 订阅
/sitemap.xml/feed.xml
文章
21
标签
5

热门标签