Can large language models explore in-context? 大语言模型能进行上下文探索吗? 我们研究了当代大语言模型(LLMs)在多大程度上能够进行探索,这在强化学习和决策制定中是一个核心能力。我们专注于现有LLMs的本质性能,不借助训练干预。我们在简单的多臂赌博机(multi-armed bandit)环境中部署L…
Uni-SMART: Universal Science Multimodal Analysis and Research Transformer Uni-SMART: 通用科学的多模态分析研究 Transformer 在科学研究及其应用领域,科学文献分析极为重要,它使研究人员得以在前人的基础上发展自己的工作。然而,科学知识的快速发展导致学术文章数…
Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context Gemini 1.5:跨数百万Token实现多模态理解 在本报告中,我们展示了 Gemini 系列最新的模型,Gemini 1.5 Pro,这是一个计算高效的多模态混合专家模型。它能…
VisionLLaMA: A Unified LLaMA Interface for Vision Tasks VisionLLaMA: 视觉任务的统一 LLaMA 接口 大语言模型基于 Transformer 架构构建,主要处理文本输入。其中,LLaMA 是众多开源实现中的佼佼者。那么,相同的 Transformer 能否用于处理 2D 图像呢?…
MobileLLM: Optimizing Sub-billion Parameter Language Models for On-Device Use Cases MobileLLM: 针对移动设备使用场景优化的亚十亿参数语言模型 本文针对在移动设备上部署高效的大型语言模型(LLMs)的迫切需求进行研究,这一需求源于云计算成本的上升和延迟问题的…