首页 > 快讯 > 大模型推演迎来革新！CMU携手英伟达推出Multiverse，达成极速并行生成能力

大模型推演迎来革新！CMU携手英伟达推出Multiverse，达成极速并行生成能力

发布时间：2025-06-18 10:11:38 | 责任编辑：张毅 | 浏览量：193 次

随着人工智能的发展，大型语言模型（LLM）的应用越来越广泛，但目前的推理方式仍然存在不少局限性。传统的自回归生成方式需要逐个生成 token，效率较低且无法充分利用现代硬件的并行计算能力。为了解决这一问题，卡耐基梅隆大学(CMU)与英伟达的研究团队推出了一种名为 Multiverse 的新型生成模型，旨在实现原生并行生成，从根本上改变我们对 LLM 推理的理解。
Multiverse 并不仅仅是加快生成速度，而是重新思考了模型的架构。研究者们发现，当前主流的大语言模型在生成过程中其实暗含了一种并行性。通过这一发现，Multiverse 框架采用了类似 MapReduce 的结构，将生成过程分为三个阶段:任务的自适应分解、子任务的并行执行，以及无损结果的合并。这样的设计能够充分发挥计算资源的潜力，实现更高效的推理过程。
根据实验数据显示，Multiverse-32B 模型在相同的上下文长度下，性能较自回归模型提高了近2%。这表明 Multiverse 不仅在速度上有显著提升，还在扩展性上表现优越，能够在不同的批量大小下实现最高两倍的速度提升。为了让这一成果能够更广泛应用，研究团队还开源了整个 Multiverse 生态系统，包括数据、模型权重和训练细节，方便其他研究者进行进一步探索。
在实际应用中，Multiverse 能够根据生成需求灵活调整，并通过一种专用的控制标签实现顺序与并行生成的动态切换，确保生成内容的连贯性和逻辑性。这项技术的推出无疑为自然语言处理领域注入了新的活力，让我们期待它在实际应用中的表现。

CMU（卡耐基梅隆大学）与英伟达携手推出的Multiverse是一个全新的生成式建模框架，旨在通过原生并行生成技术彻底改变大语言模型（LLM）的推理方式。

技术原理

Multiverse框架基于MapReduce范式构建，将生成过程分为三个阶段：

Map阶段：自适应地将任务分解为多个子任务。
Process阶段：并行执行这些子任务，充分利用现代硬件的并行计算能力。
Reduce阶段：无损合并子任务的结果，确保生成内容的连贯性和逻辑性。

性能优势

实验结果显示，Multiverse-32B模型在相同上下文长度下，平均性能比传统自回归模型高出1.87%，并且在不同批量大小下实现了高达两倍的速度提升。这种并行生成机制不仅提高了效率，还展现了优越的扩展性。

应用前景

Multiverse不仅提升了生成速度，还重新思考了模型架构，使其能够根据生成需求灵活调整，并通过专用控制标签实现顺序与并行生成的动态切换。此外，研究团队开源了整个Multiverse生态系统，包括数据、模型权重、引擎和训练细节，方便其他研究者进一步探索。

这项技术的推出为自然语言处理领域带来了新的视角，有望推动大模型推理技术的进一步发展。

©️版权声明：
本网站(https://aigc.izzi.cn)刊载的所有内容，包括文字、图片、音频、视频等均在网上搜集。
访问者可将本网站提供的内容或服务用于个人学习、研究或欣赏，以及其他非商业性或非盈利性用途，但同时应遵守著作权法及其他相关法律的规定，不得侵犯本网站及相关权利人的合法权利。除此以外，将本网站任何内容或服务用于其他用途时，须征得本网站及相关权利人的书面许可，并支付报酬。
本网站内容原作者如不愿意在本网站刊登内容，请及时通知本站，予以删除。