品玩5月14日讯,在今天凌晨的直播中,OpenAI 宣布推出全新大语言模型GPT-4o 模型,能够跨音频、视觉和文本进行实时推理。
GPT-4o标志着实现更自然人机交互的重大进步。它能够接收文本、音频和图像的任意组合作为输入,并输出同样多样化的组合。在最短232毫秒内响应音频输入,平均响应时间320毫秒,与人类在对话中的反应时间类似。在处理英语和编程方面与GPT-4 Turbo表现相当,非英语文本处理上则有显著提升。此外,GPT-4o在API中的运行速度更快,成本也降低了50%。在视觉和音频理解能力上,GPT-4o明显优于现有模型。
OpenAI端到端训练的新模型GPT-4o覆盖了文本、视觉和音频,这意味着所有输入和输出都由同一个神经网络处理。由于GPT-4o是第一个结合所有这些模态的模型,所以团队对模型能力和局限性仍在探索中。
0 条评论
请「登录」后评论