o1的风又吹到多模态，直接吹翻了GPT-4o-mini

发布于 2024-11-19 14:49

浏览

0收藏

开源LLaVA-o1：一个设计用于进行自主多阶段推理的新型VLM。与思维链提示不同，LLaVA-o1独立地参与到总结、视觉解释、逻辑推理和结论生成的顺序阶段。

LLaVA-o1超过了一些更大甚至是闭源模型的性能，例如Gemini-1.5-pro、GPT-4o-mini和Llama-3.2-90B-Vision-Instruct。

o1的风又吹到多模态，直接吹翻了GPT-4o-mini-AI.x社区

基础模型与LLaVA-o1的比较。基础模型Llama-3.2-11B-Vision-Instruct在推理过程中有明显的缺陷，整个推理过程中出现了几个错误。相比之下，LLaVA-o1首先概述问题，从图像中解释相关信息，然后进行逐步推理过程，并最终得出一个有充分支持的结论。

o1的风又吹到多模态，直接吹翻了GPT-4o-mini-AI.x社区

LLaVA-o1如何炼成

LLaVA-o1模型的结构化推理框架，专门的数据集和训练方法，以及推理时的阶段性束搜索策略，来提高模型在复杂任务中的推理能力和扩展性。

结构化推理阶段：

总结阶段（Summary Stage）：LLaVA-o1在这一阶段提供对问题的高层次总结，概述它打算解决的问题的主要方面。
图像描述阶段（Caption Stage）：如果存在图像，LLaVA-o1提供与问题相关的图像元素的简洁概述，帮助理解多模态输入。
推理阶段（Reasoning Stage）：在初始总结的基础上，LLaVA-o1进行结构化、逻辑推理，得出初步答案。
结论阶段（Conclusion Stage）：在最后阶段，LLaVA-o1根据前面的推理综合答案。结论阶段的输出是直接提供给用户的响应，而前三个阶段是内部的“隐藏阶段”，代表LLaVA-o1的推理过程。
四对特殊标签：<SUMMARY></SUMMARY>、<CAPTION></CAPTION>、<REASONING></REASONING>和<CONCLUSION></CONCLUSION>

数据准备和模型训练：

由于现有的视觉问题回答（VQA）数据集缺乏训练LLaVA-o1所需的详细推理过程，研究者们编译了一个新的数据集LLaVA-o1-100k，整合了多个广泛使用的VQA数据集的样本。
使用GPT-4o生成包括总结、图像描述、推理和结论的详细推理过程，并将这些编译成LLaVA-o1-100k数据集。
选择了Llama-3.2-11B-Vision-Instruct模型作为基础模型，并使用LLaVA-o1-100k数据集进行全参数微调。

o1的风又吹到多模态，直接吹翻了GPT-4o-mini-AI.x社区

有效的推理时扩展使用阶段性束搜索：

训练完成后的目标是在推理期间进一步增强模型的推理能力。LLaVA-o1的输出设计为结构化，提供了理想的粒度，用于推理时扩展。
采用阶段性束搜索方法，该方法在每个推理阶段生成多个候选结果，并选择最佳结果以继续生成过程。
通过在每个阶段进行有效的验证，这种方法验证了结构化输出在提高推理时扩展中的有效性。

推理方法的示意图。最佳选择法（Best-of-N search）生成N个完整的响应，并从中选择最好的一个；句子级束搜索（Sentence-level Beam Search）为每个句子生成多个候选项并选择最好的一个。相比之下，LLaVA-o1的阶段性束搜索（Stage-level Beam Search）为每个推理阶段（例如，总结、标题、推理和结论）生成候选项，并在每个阶段选择最佳选项。最佳选择法在粗略层面上操作，而句子级束搜索过于细致，而LLaVA-o1的方法实现了最佳平衡并取得了最佳性能。

o1的风又吹到多模态，直接吹翻了GPT-4o-mini-AI.x社区

有无阶段性束搜索的LLaVA-o1性能比较。LLaVA-o1的阶段性束搜索在模型推理过程中有效地选择了更好的推理。

o1的风又吹到多模态，直接吹翻了GPT-4o-mini-AI.x社区

实验数据

LLaVA-o1在多模态推理基准测试中相较于其基础模型Llama-3.2-11B-Vision-Instruct实现了8.9%的性能提升。
LLaVA-o1在各种基准测试中不仅超越了基础模型，还超过了一些更大甚至是闭源模型，例如Gemini-1.5-pro、GPT-4o-mini和Llama-3.2-90B-Vision-Instruct。
结构化标签（structured tags）对于模型性能至关重要。去除这些标签后，模型性能显著下降，说明这些标签有助于推理过程并提高了模型性能。

o1的风又吹到多模态，直接吹翻了GPT-4o-mini-AI.x社区

https://arxiv.org/pdf/2411.10440
LLaVA-o1: Let Vision Language Models Reason Step-by-Step
https://github.com/PKU-YuanGroup/LLaVA-o11.
2.
3.

本文转载自PaperAgent

标签

GPT

视觉解释

已于2024-11-19 14:50:43修改

相关推荐

GPT-4o热潮来袭：探索图生文本的奥秘（多模态大模型系列之一）

鱼虫子 • 5768浏览 • 0回复
GPT-4o 到底有多强？模型图文多模态能力评测结果全公开

恋恋青鸟 • 7180浏览 • 0回复
英伟达最强劲敌Groq一招绝杀GPU，反超GPT-4o mini2倍，AI大佬Karpathy：直接飞升AGI!

51CTO技术栈 • 2061浏览 • 0回复
基于GPT-4o-mini，使用LangChain打造AI搜索智能体

小虎哦哦 • 3161浏览 • 0回复
OpenAI o1推理模型基础入门

51CTO内容精选 • 1964浏览 • 0回复
Meta首个开源多模态模型Llama 3.2横空出世，能力不输GPT4o-mini；小扎：开源的拐点来了！

51CTO技术栈 • 2724浏览 • 0回复
o1推理扩展的风吹到了RAG，性能飙升58.9%！

PaperAgent • 2158浏览 • 0回复
击败GPT-4o、仅次于o1！英伟达重磅开源超强大模型--Nemotron

Aceryt • 2746浏览 • 0回复
重磅开源Nemotron大模型：击败GPT-4o、仅次于o1！

51CTO技术栈 • 1601浏览 • 0回复
o1快慢思考的风又吹到了Agent！

PaperAgent • 2453浏览 • 0回复
o1蒙特卡洛树的风又吹到了Agentic工作流！

PaperAgent • 2365浏览 • 0回复
超GPT-4o，1240亿参数！最强开源多模态模型 Pixtral Large！

Aceryt • 1817浏览 • 0回复
o1的规划能力如何？LRM是未来吗？

探索AGI • 1540浏览 • 0回复
微软：GPT-4o-mini只有8B，o1-mini仅100B

PaperAgent • 1599浏览 • 0回复
Kimi深夜炸场：满血版多模态o1级推理模型！OpenAI外全球首次！Jim Fan：同天两款国产o1绝对不是巧合！

51CTO技术栈 • 1446浏览 • 0回复
Cline 3.2 重磅更新：免费调用 Claude Sonnet 3.5 和 GPT 4o，开发效率直接拉满！

凝固的雨_1 • 1.3w浏览 • 0回复
OpenAI o3-mini 干翻了 DeepSeek R1？

PyTorch研习社 • 1583浏览 • 0回复
大模型对决：DeepSeek R1与o3-mini

丢翅膀的鱼 • 1710浏览 • 0回复
Vision-R1：多模态领域的DeepSeek R1-Zero，7B参数比肩OpenAI O1

Syrupup • 1398浏览 • 0回复

PaperAgent

这个用户很懒，还没有个人简介

帖子

声望

粉丝

关注

51CTO

51CTO博客

51CTO学堂

o1的风又吹到多模态，直接吹翻了GPT-4o-mini

LLaVA-o1如何炼成

实验数据

目录