免费 HTML 网页托管平台

***** - 首页 - 微博

借助DeepL翻译下GPT-4的博文:
![](http://h5.sinaimg.cn/upload/2015/09/25/3/timeline_card_small_web_default.png)网页链接

GPT-4
我们已经创建了GPT-4,这是OpenAI在扩大深度学习方面的最新里程碑。GPT-4是一个大型的多模态模型(接受图像和文本输入,发出文本输出),虽然在许多现实世界的场景中能力不如人类,但在各种专业和学术基准上表现出人类水平的表现。例如,它通过了模拟的律师考试,分数在应试者的前10%左右;相比之下,GPT-3.5的分数则在后10%左右。我们花了6个月的时间,利用我们的对抗性测试项目以及ChatGPT的经验,反复调整GPT-4,从而在事实性、可引导性和拒绝超出护栏方面取得了我们有史以来最好的结果(尽管远非完美)。

在过去的两年里,我们重建了整个深度学习堆栈,并与Azure一起,为我们的工作负荷从头开始共同设计了一台超级计算机。一年前,我们训练了GPT-3.5,作为该系统的第一次 "试运行"。我们发现并修复了一些错误,并改进了我们的理论基础。因此,我们的GPT-4训练运行(至少对我们来说是如此!)空前稳定,成为我们第一个训练性能能够提前准确预测的大型模型。随着我们继续专注于可靠的扩展,我们的目标是磨练我们的方法,以帮助我们越来越提前地预测和准备未来的能力--我们认为这对安全至关重要。

我们正在通过ChatGPT和API发布GPT-4的文本输入功能(有一个等待名单)。为了准备更广泛地提供图像输入功能,我们正在与一个合作伙伴紧密合作,以开始。我们也正在开源OpenAI Evals,这是我们自动评估人工智能模型性能的框架,允许任何人报告我们模型中的缺点,以帮助指导进一步的改进。

Capabilities 能力

在闲聊中,GPT-3.5和GPT-4之间的区别可能是微妙的。当任务的复杂性达到足够的阈值时,差异就会显现出来--GPT-4比GPT-3.5更可靠,更有创造性,能够处理更细微的指令。

为了了解这两种模型之间的差异,我们在各种基准上进行了测试,包括模拟最初为人类设计的考试。我们通过使用最新的公开测试(就奥数和AP自由回答问题而言)或购买2022-2023年版的练习考试来进行。我们没有为这些考试做专门的培训。考试中的少数问题是模型在训练中看到的,但我们认为结果是有代表性的--详情请见我们的技术报告。

我们还在为机器学习模型设计的传统基准上评估了GPT-4。GPT-4的性能大大超过了现有的大型语言模型,与大多数最先进的(SOTA)模型并驾齐驱,这些模型可能包括针对基准的制作或额外的训练协议。

许多现有的ML基准是用英语写的。为了初步了解其他语言的能力,我们使用Azure Translate(见附录)将MMLU基准--一套涵盖57个主题的14000个多选题--翻译成了各种语言。在测试的26种语言中的24种语言中,GPT-4的表现优于GPT-3.5和其他LLM(Chinchil

页面加载耗时: 4 ms