ChatGPT重磅更新:新增语音和图像功能 可以看、听、说

beifangdelang2023-09-26 11:06:12TechWeb.com.cn

9月26日消息,据外媒报道,当地时间周一,美国人工智能研究公司OpenAI宣布,其AI聊天机器人工具ChatGPT现在可以“看、听、说”,这暗指这款广受欢迎的聊天机器人可以同时接收图像和语音输入,并通过语音进行回复。

ChatGPT是OpenAI于2022年11月30日推出的一种新型AI聊天机器人工具,可根据用户的要求快速生成文章、故事、歌词、散文、笑话,甚至代码,并回答各类疑问。

当地时间周一,OpenAI表示,将开始在ChatGPT中推出新的语音和图像功能,新功能将于未来两周内面向Plus和企业用户推出。

该公司表示,新功能允许用户进行语音对话或向ChatGPT展示其正在谈论的内容。其中,语音功能将在iOS和Android平台上推出,而图像功能将在所有平台上推出。不过,该公司将逐步部署语音和图像功能。

在语音方面,新功能允许用户进行语音对话,提供更直观的交互方式。该功能由一个新的文本转语音模型提供支持,能够通过文本和几秒钟的语音样本生成类似人类的音频,且与专业配音演员合作,提供5种可供用户自行选择的声音。此外,该功能还能使用开源语音识别系统Whisper,将用户说的话转录成文本。

外媒报道称,语音输入和输出功能使ChatGPT具有与亚马逊Alexa等语音助手相同的功能。

在图像方面,新功能允许用户上传图像与ChatGPT交互,且支持上传多张图像。如果要聚焦图像的特定部分,可以使用移动应用中的绘图工具。

OpenAI表示,图像理解由多模态GPT-3.5和GPT-4提供支持。这些模型将语言推理能力应用于各种图像,如照片、屏幕截图以及包含文字和图像的文档。

据悉,GPT-4是OpenAI在今年3月14日推出的最新一代大型语言模型。它是一个多模态大型语言模型,支持图像和文本输入,以文本形式输出;扩写能力增强,能处理超过25000个单词的文本;更具创造力,并且能够处理更细微的指令。(小狐狸)

研究发现,OpenAI的GPT-4o道德推理能力胜过人类专家

6月24日消息,近期的一项研究表明,OpenAI最新的聊天机器人GPT-4o能够提供道德方面的解释和建议,且质量优于“公认的”道德专家所提供的建议。据TheDecoder当地时间周六报道,美国北卡罗莱纳大学教堂山分校和艾伦AI...

AI助力全球最大科技公司总市值突破10万亿美元 Nvidia超越Facebook、微软超越苹果领先

全球最大的科技巨头估值已超过1万亿美元,部分归功于生成式人工智能的投资和进步,估值总计超过10万亿美元,其中Nvidia超越Facebook成为新秀,而Microsoft则取代苹果领先。目前,包括Microsoft、Apple、Google、Amaz...

讯飞星火大模型正式发布代码及多模态能力

8月15日,讯飞星火认知大模型V2.0升级发布会召开,发布代码能力和多模态能力升级,同时发布并升级搭载讯飞星火认知大模型V2.0能力的多项应用和产品。技术获得重大突破的同时,搭载讯飞星火认知大模型核心能力的应用...

OpenAI已训练CriticGPT模型:基于GPT-4 用于发现ChatGPT生成内容错误

6月28日消息,据外媒报道,随着GPT系列大模型的不断升级,OpenAI所训练的ChatGPT也在拥有更强的能力,但这也带来了一些挑战,它所生成的内容中存在的错误也越来越隐蔽,逐渐到了AI训练师难以发现的程度。而为了应对...

德国反垄断机构负责人:人工智能可能会强化大企业主导地位

10月10日消息,德国反垄断办公室负责人安德里亚斯·蒙特(AndreasMundt)近日警告称,人工智能可能会进一步强化大型科技公司的市场主导地位,监管机构应密切关注任何反竞争行为。蒙特的言论表明监管机构普遍担心,拥...

上一篇:OpenAI更新ChatGPT:支持图片和语音输入
下一篇:消息称因供应链产能升级,台积电生产的AI芯片未来将变得“更加昂贵”