描述
RETRO,即检索增强 Transformer,代表了一种通过将检索机制直接集成到 Transformer 架构中来改进语言模型的创新方法。与仅依赖增加参数数量和训练数据规模的传统大型语言模型(LLMs)不同,RETRO 通过能够从海量数据库中检索相关文本片段来增强其 Transformer 基础。该数据库可以包含数万亿个 token,涵盖网页、书籍、新闻文章和代码等多种文本类型。
RETRO 的核心创新在于它能够通过其检索系统访问整个训练数据集,而不是受限于训练期间看到的数据。这是通过对与输入相似的文本片段执行最近邻搜索来实现的,并返回这些片段及其续写。这些检索到的序列随后会影响模型对下一个文本片段的预测。RETRO 架构在文档级别的标准自注意力机制与在更细粒度的片段级别对这些检索到的邻居进行交叉注意力机制之间进行了策略性地交织。
这种检索增强的过程能够显著提高文本续写的准确性和事实性。此外,RETRO 增强了模型预测的可解释性,并通过检索数据库提供了一条直接干预的途径,以提高生成文本的安全性和可靠性。在 Pile 等基准测试上的实验结果表明,一个拥有 75 亿参数的 RETRO 模型在多项数据集上可以超越参数量远大于它的标准 Transformer,例如 Jurassic-1(1750 亿参数)和 Gopher(2800 亿参数)。RETRO 的性能随着检索数据库规模的增加而持续提升,证明了其可扩展性和有效性,至少可达 2 万亿 token。
RETRO 对于需要高事实准确性和主题一致性的应用尤其有益。通过检索利用外部知识,它可以生成更具依据和相关性的输出。这使其成为研究人员和开发人员在仅靠参数扩展之外,寻求突破语言模型能力界限的强大工具。该模型在实验样本中突显的保持主题一致和生成正确信息的能力,进一步印证了其在实际应用中的优势。
RETRO 语言模型亮点
检索增强 Transformer 架构
访问数万亿 token 数据库
交织的自注意力和交叉注意力机制
提高事实准确性
增强主题一致性
提高预测的可解释性
通过检索数据库进行直接干预的途径
随数据库规模持续提升的性能
在基准测试中超越更大的标准 Transformer
可扩展至 2 万亿 token
RETRO 语言模型入门
访问模型:获取 RETRO 模型访问权限。
身份验证:设置必要的身份验证凭据。
设置环境:配置您的开发环境。
通过 API 集成:利用提供的 API 端点进行集成。
优化:针对特定任务微调参数和检索设置。
RETRO 语言模型的使用案例
- 事实性文本生成
- 主题内容创作
- 增强语言理解
- 研究与开发
- AI 安全研究
- 代码生成
- 信息检索集成








