小模型狂飙！6家巨头争相发布小模型And哈希游戏- 哈希游戏平台- 官方网站rej Karpathy：大语言的尺寸竞争正在倒退

作者:小编2024-12-14 19:38:28

　　哈希游戏- 哈希游戏平台- 哈希游戏官方网站

小模型狂飙！6家巨头争相发布小模型And哈希游戏- 哈希游戏平台- 哈希游戏官方网站rej Karpathy：大语言模型的尺寸竞争正在倒退

　　大语言模型的尺寸竞争正在倒退... 我打赌我们会看到非常非常小的模型“思考”得非常好且可靠。很可能存在一个GPT-2参数的设置，大多数人会认为GPT-2是“聪明的”。当前模型如此大的原因是因为我们在训练期间仍然非常浪费——我们要求它们记住互联网，令人惊讶的是，它们确实做到了，并且可以例如背诵常见数字的SHA哈希值，或回忆非常深奥的事实。（实际上，大语言模型在记忆方面非常出色，质量上远胜于人类，有时只需要一次更新就能记住大量细节，并且长时间记住）。但想象一下，如果你要在闭卷考试中背诵互联网的任意段落，给出前几个词。这是当今模型的标准（预）训练目标。更难的是，因为思考的演示在训练数据中是与知识“纠缠”的。因此，模型必须先变大，然后才能变小，因为我们需要它们（自动化）的帮助将训练数据重构和模塑成理想的、合成的格式。这是一个改进的阶梯——一个模型帮助生成下一个模型的训练数据，直到我们获得“完美的训练集”。当你在这个训练集上训练GPT-2时，它将是一个非常强大且聪明的模型，以今天的标准来看。也许MMLU会低一些，因为它不会完美记住所有的化学知识。也许它需要偶尔查找一些东西以确保准确。

上一篇丨

谷歌的量子芯片宣告了比特币的终结哈希游戏- 哈希游戏平台- 官方网站

下一篇丨

哈希游戏- 哈希游戏平台- 官方网站公司简介

全国咨询热线： 400-123-4567

哈希游戏

哈希游戏| 哈希游戏平台| 哈希游戏APP

小模型狂飙！6家巨头争相发布小模型And哈希游戏- 哈希游戏平台- 官方网站rej Karpathy：大语言的尺寸竞争正在倒退

联系我们