【抢先体验】开通使用 ChatGPT 语音版功能保姆级教程

image.png
大家好,我是苍何,一个土木转码的非典型程序员,也是一名技术管理者,同时也是 AI 应用的探索者。今天在视频号上看到和 ChatGPT 语音对话的视频,其声音的真实感太让人震撼了,于是也想去抢先体验一下 ChatGPT 语音版功能

网上搜索了许久,没找到相关实用教程,且很难找到语音版的入口。据 OpenAI 官方消息,在接下来的两周内,将向 Plus 和企业用户推出语音功能。那我们如何抢先体验该功能呢?

OpenAI官方对语音版的说明

本文将分享如何抢先体验 ChatGPT 语音版,并详细讲解使用指南。

一、什么是 ChatGPT 语音版

2023年9月25日 OpenAI 推出多模态功能,即 ChatGPT 将支持语音和图像。新的语音功能由新的文本到语音模型提供支持,该模型能够仅通过文本和几秒钟的示例语音生成类似人类的音频。OpenAI 与专业配音演员合作创作了每个声音。还使用开源语音识别系统 Whisper 将口语转录为文本。

**ChatGPT 语音版说白了就是能直接通过语音和 ChatGPT 进行对话,**让人震惊的是其声音的真实感和回答的逻辑性一度逼近贾维斯的感觉。

OpenAI 关于语音版公告

二、如何开通使用 ChatGPT 语音版

由于此功能现在还属于内侧阶段,仅部分用户能体验到,我这里说的是我亲测有效的方法(前提需要安卓手机)。大体流程是:安卓手机安装 Google Play,申请加入 Beta 测试,下载 ChatGPT Beta 版本,开通 plus 账号,打开语音入口。
以下是流程图。

2.1、申请加入 Beta 测试

这是最关键的一步,就是目前从应用商店下载的都是稳定版,很多未受邀请用户暂时无法体验,那我们需要申请加入 Beta 测试才可抢先体验该功能。这里以安卓的 Google Play 为例,演示如何加入 Beta 测试。

申请加入 Beta 测试

账号申请 Beta 测试需要几分钟,加入成功后我们就可以看到如上图提示,这个时候我们直接下载测试版本。一般而言,测试版本非稳定版本,但确是最新版本,也是我们抢先体验功能的基础。

2.2、开通 plus 账号

目前仅有 plus 账号才可抢先体验,所以需要开通。如何开通 plus 相信大家都已经会了,这里不赘述,但值得注意的是,由于 OpenAI 的封控策略,一定要注意尽量不要在 web 端开通以及尽量保证网络的「清洁」。

2.3、开通语音入口

打开设置
设置页面
点击 Beta Features

点击 Beta Features

开启 Voice conversations

开启 Voice conversations

注意:这里的 Browse with Bing 是 ChatGPT 的联网功能,我们以前需要通过插件联网,现在直接打开这个开关即可联网了。

点击主页图标

点击主页图标

开启语音对话

开启语音对话

查看对话历史

查看对话历史
我们每进行的一轮语音对话,均会以文本的形式进行对话展示,方便随时进行查看。

三、ChatGPT 语音版使用指南

3.1、哪些用户可以进行语音对话?

Plus 和 ChatGPT 企业计划的所有用户。其中 ChatGPT 企业计划管理员可以在管理工作区设置中为其用户切换可用性。预计一周之后会慢慢开放。

3.2、哪些应用程序可以进行语音对话?

语音对话可在适用于 iOS 和 Android 的 ChatGPT 移动应用程序上进行。

3.3、有多少个语音选项?

ChatGPT 从五种逼真的输出声音中进行选择,每种声音都有自己独特的音调和字符。可以通过 Setttings-Speech-Voice 进行声音选择。个人试验看 Breeze 对中文支持性更好。

语音设置

五种声音类型

3.4、我可以在语音对话中使用哪些模型?

GPT 3.5 和GPT 4 可用于语音对话。
请记住,对于Plus用户,GPT-4 每 3 小时有50条消息的上限。对于企业计划上的用户,没有消息上限。

3.5、我可以为语音对话设置音量限制吗?

在 ChatGPT 中,语音对话没有音量限制。音量将在设备本身上设置。

3.6、我可以在同一对话中使用ChatGPT视觉功能和语音对话吗?

可以使用视觉功能在聊天中启动语音对话,就像可以使用 GPT 3.5 或 GPT 4 在对话中启动语音对话一样。

3.7、为什么需要打开聊天记录和培训才能使用语音对话?

聊天记录和来自数据控件的培训必须切换,以便能够进行语音对话,以便可以查看对话的笔录。

主要是使用数据来提高模型性能,以何使用内容 (包括语音聊天的转录) 来改善服务和选择。

3.8、语音对话会不会保存音频

在测试版期间,来自语音对话的音频片段不会保存。ChatGPT 将音频片段发送到 Whisper API 以转录它们,但处理后不会保留它们。

要找到历史对话,可以在 ChatGPT 对话历史中找到语音对话中的文本转录。

3.9、语音对话是免提的吗?

一旦你进入语音对话,它是免提的,直到你退出语音对话。(相信以后会慢慢开放更多功能)
有手动控件,可暂停,继续和退出语音对话。

3.10、语音对话使用

开始对话:
要开始语音对话,需要点击耳机图标。建立连接后,ChatGPT 将听你讲话。
开启对话

暂停语音对话:
暂停语音对话
中断语音对话:
当ChatGPT正在说话时,您可以点击以中断:
中断

或者你可以点击停止图标:
停止图标
恢复语音对话:
点击恢复图标,然后重新开始
恢复语音对话
取消语音对话的静音:
点击取消静音。
点击取消静音
退出语音对话:
要退出语音模式,请点击 X 图标以结束语音对话,并返回到使用 ChatGPT 的基于文本的对话。
退出语音对话

3.11、可以让语音对话暂停多久?

没有限制,理论上可以无限时间暂停。

3.12、 收到 “对不起,我不能帮忙” 的回复是什么原因?

这是由于 ChatGPT 的安全措施造成的。如果提示符合,可以通过聊天中的“竖起大拇指/竖起大拇指” 选项向 ChatGPT 发送反馈。

四、总结

想象一下,当语音对话支持 API,我们可以把他集成到手机(虽然现在的 sari 也能如此,但还不够智能),放到人型机器人上,那不就是现实版的贾维斯吗?相信这一天不远了。拥抱 AI 才是普通人的破局之道。

全文完,你的点赞是对苍何创作最大鼓励\(^ ^)/


苍何个人介绍.png

创作不易,如果本文对你有帮助,欢迎点赞、收藏加关注,你的支持和鼓励,是我创作的最大动力。
文章最下方关注图片.gif

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.hqwc.cn/news/127951.html

如若内容造成侵权/违法违规/事实不符,请联系编程知识网进行投诉反馈email:809451989@qq.com,一经查实,立即删除!

相关文章

互联网项目有哪些值得做的

互联网已经融入了我们生活的方方面面,从电商巨头到科技创新,互联网带来的变革和便利无处不在。而在这个信息广泛的时代,越来越多的人开始思考如何利用互联网去创造价值。现如今,互联网项目的形式多种多样,有些让我们的…

python—如何提取word中指定内容

假设有一个Word,该Word中存在 “联系人” 关键字,如何将该Word中的联系人所对应的内容提取出来呢? 该Word内容如下所示: 要在给定的Word文档中提取出与"联系人"关键字对应的内容,可以使用Python的py…

详解链表oJ<反转链表,链表的中间节点及链表的回文>

hello,大家好,这里是Dark FlameMaster,今天和大家分享的是有关数据结构链表的几道题目,链表的中间节点,反转链表及判断链表是否为回文结构,放在一起讲解会印象更加深刻。 文章目录 一,链表的中间节点二&…

你的librosa和scikit-learn打架了吗?

被这个问题困扰好久!!!!!!!!!!!!!! 我的原来版本librosa0.7.1 和 scikit-learn1.3.1 一直拆了按,按…

【力扣每日一题】2023.10.7 股票价格跨度

目录 题目: 示例: 分析: 代码: 题目: 示例: 分析: 给我们一个数组表示不同时间的股票的价格,要我们按照顺序返回每天的股票价格跨度,价格跨度就是股票价格小于或等于…

Python3操作Redis最新版|CRUD基本操作(保姆级)

Python3中类的高级语法及实战 Python3(基础|高级)语法实战(|多线程|多进程|线程池|进程池技术)|多线程安全问题解决方案 Python3数据科学包系列(一):数据分析实战 Python3数据科学包系列(二):数据分析实战 Python3数据科学包系列(三):数据分析实战 Win11查看安装的Python路…

C#练习题-构造函数

文章目录 前言题目习题1运行示例 习题2运行示例 参考答案习题1习题2 其他文章 前言 本篇文章的题目为C#的基础练习题,构造函数部分。做这些习题之前,你需要确保已经学习了构造函数的知识。 本篇文章可以用来在学完构造函数后加深印象,也可以…

HTTPS工作过程,国家为什么让http为什么要换成https,Tomcat在MAC M1电脑如何安装,Tomcat的详细介绍

目录 引言 一、HTTPS工作过程 二、Tomcat 在访达中找到下载好的Tomcat文件夹(这个要求按顺序) zsh: permission denied TOMCAT的各部分含义: 引言 在密码中一般是:明文密钥->密文(加密) &#xff…

分布式数据库(林子雨慕课课程)

文章目录 4. 分布式数据库HBase4.1 HBase简介4.2 HBase数据模型4.3 HBase的实现原理4.4 HBase运行机制4.5 HBase的应用方案4.6 HBase安装和编程实战 4. 分布式数据库HBase 4.1 HBase简介 HBase是BigTable的开源实现 对于网页搜索主要分为两个阶段 1.建立整个网页索引&#xf…

必备的常见芯片封装

-网友:这什么破封装,这么难焊! -工程师:你才焊过几种芯片封装呀,SOT封装都觉得难? 我们常见的芯片封装: 第一种,DIP封装,DIP即双列直插式封装,引脚从芯片两…

三十二、【进阶】hash索引结构

1、hash索引结构 (1)简述: hash索引,就是采用一定的hash算法,将键值换算成新的hash值,映射到对应的槽位上,然后存储在hash表中。 (2)图示: 2、hash索引结构…

Scratch3.0下载

通俗易懂,直接上链接 链接:https://pan.baidu.com/s/1n-QFEQWT8im8BHQu1wIjtg?pwd1016 提取码:1016