鸿蒙开发者社区

WOT技术大会

公众号矩阵

移动端

视频课免费课排行榜短视频直播课软考学堂

全部课程软考华为认证厂商认证 IT技术 PMP项目管理免费题库

文章资源问答课堂专栏直播

51CTO

鸿蒙开发者社区

51CTO技术栈

51CTO官微

51CTO学堂

51CTO博客

CTO训练营

鸿蒙开发者社区订阅号

51CTO软考

51CTO学堂APP

51CTO学堂企业版APP

鸿蒙开发者社区视频号

51CTO软考题库

AI.x社区

登录/注册
51CTO

中国优质的IT技术网站

51CTO博客

专业IT技术创作平台

51CTO学堂

IT职业在线教育平台

清华唐杰团队新作：一口气生成2万字，大模型开卷长输出精华

发布于 2024-8-15 13:04

1865浏览

0收藏

一口气生成2万字，大模型输出也卷起来了！

清华&智谱AI最新研究，成功让GLM-4、Llama-3.1输出长度都暴增。

相同问题下，输出结果直接从1800字增加到7800字，翻4倍。

要知道，目前大模型的生成长度普遍在2k以下。这对于内容创作、问题回答等都存在影响，可能导致模型回答问题不全面、创造性降低等。

该研究由智谱AI创始人、清华大学教授李涓子和唐杰共同领衔。

清华唐杰团队新作：一口气生成2万字，大模型开卷长输出-AI.x社区

论文及代码都已放在GitHub上开源。

有网友已经抢先体验。LongWriter-llama3.1-8b可生成万字长文《罗马帝国衰落史》，在MacBook Pro 2018（32GB）上就能运行。

输出内容很准确，可以得A++。

清华唐杰团队新作：一口气生成2万字，大模型开卷长输出-AI.x社区

9B模型搞定万字输出

本项研究主要包括3方面工作。

分析文本生成长度限制因素
提出AgentWrite
扩展LLM输出窗口大小

首先，研究人员构建了一个测试工具LongWrite-Ruler。通过测试多个大模型，他们发现所有模型在生成超过2000字的文本时都遇到了困难。

进一步分析用户和大模型的交互日志，研究人员发现只有超过1%的用户请求明确提到要生成超过2000字的文本。

为此，他们改变了模型在监督式微调（SFT）阶段使用的数据集的最大输出长度。

结果发现，模型的最大输出长度与SFT数据集中的最大输出长度呈显著正相关。

所以得出结论，现有模型在输出长度上受限主要是因为SFT数据集中缺少长输出样本。

即使模型在预训练阶段见过更长的序列，但是SFT阶段缺乏长文本样本，还是会影响输出长度。

清华唐杰团队新作：一口气生成2万字，大模型开卷长输出-AI.x社区

为了克服这个限制，研究人员提出了AgentWrite。

这是一个基于Agent的pipline。

清华唐杰团队新作：一口气生成2万字，大模型开卷长输出-AI.x社区

它允许将超长文本生成任务分解为多个子任务，每个子任务处理其中的一段。

具体流程是AgentWrite先根据用户指令制定出一个详细的写作计划，计划包括每个段落的主要内容点和目标词数。根据计划，AgentWrite依次提示模型生成每个段落的内容。

清华唐杰团队新作：一口气生成2万字，大模型开卷长输出-AI.x社区

在AgentWrite基础上，团队利用GPT-4o生成了6000个长输出SFT数据，输出长度在2k到32k词之间，构成了数据集LongWriter-6k。并将这些数据添加到训练过程中。

为了验证方法的有效性，团队还提出了一个LongBench-Write。其中包含了多样化的用户写作指令，输出长度规格分别为0-500词、500-2000词、2000-4000词以及4000词以上。

评估结果显示，使用AgentWrite后模型输出长度明显增加。

清华唐杰团队新作：一口气生成2万字，大模型开卷长输出-AI.x社区

通过直接偏好优化（DPO），GLM-4-9B在一众模型中实现了最佳性能。

清华唐杰团队新作：一口气生成2万字，大模型开卷长输出-AI.x社区

手速快的网友已经抢先实测。

Reddit上一位网友让LongWriter-llama3.1-8b生成罗马帝国衰败史，整体需要22分钟（与硬件有关），平均每秒生成3.34个token。

清华唐杰团队新作：一口气生成2万字，大模型开卷长输出-AI.x社区

生成内容比较公式化，回答不同问题的结构、节奏相似。

无论如何这是个好的开始，带来的提升很明显。

清华唐杰团队新作：一口气生成2万字，大模型开卷长输出-AI.x社区

研究团队也表示未来将进一步扩展模型的输出长度和输出质量，同时也会开始研究如何在不牺牲生成质量的情况下提高效率。

本文转自量子位，作者：量子位

原文链接:https://mp.weixin.qq.com/s/rdeBsGZDgMWz-5PzfaTlzA

标签

赞

收藏

回复

举报

回复

相关推荐

万字长文解析：大模型需要怎样的硬件算力

pangguiyu • 1.5w浏览 • 0回复
从API到Agent：万字长文洞悉LangChain工程化设计

wx5bbef785639a1 • 4090浏览 • 0回复
万字长文解析：2024年的机器消除学习

AIGC最前线 • 2729浏览 • 0回复
【乘风进阶学习季】夏日初长，乘风而上，码出未来！

AI.x社区官方账号 • 52.9w浏览 • 36回复
极佳、中科院等9机构联合首发 | 3万字长文全面解析世界模型(内容生成/自动驾驶等)

angel • 5169浏览 • 0回复
Hinton万字访谈：用更大模型「预测下一个词」值得全力以赴

轻薄滴假象 • 2047浏览 • 0回复
老黄一口气解密三代GPU！粉碎摩尔定律打造AI帝国，量产Blackwell解决ChatGPT全球耗电难题

duhorse • 2448浏览 • 0回复
AI首次实时生成视频！尤洋团队新作，网友：这是新纪元

angel • 2423浏览 • 0回复
大语言模型的前世今生：万字长文完整梳理所有里程碑式大语言模型（LLMs）

angel • 6595浏览 • 0回复
万字综述：全面梳理 FP8 训练和推理技术

amei2000go • 1.0w浏览 • 0回复
今天一口气开源3个重磅！压轴戏期待拉满，R2、V4、被提名

51CTO技术栈 • 1624浏览 • 0回复
DeepSeek一口气开源3个项目，还有梁文锋亲自参与，昨晚API大降价

轻薄滴假象 • 1922浏览 • 0回复
【万字长文】深度剖析：RAG、AI Agent与Agentic RAG的融合发展|值得收藏

Halo咯咯 • 3086浏览 • 0回复
AI挑西瓜：每一口都是甜蜜暴击

InfonityAI智推星 • 1559浏览 • 0回复
如何高效地为「推理模型」编写最佳提示词？万字长文介绍

Baihai_IDP • 1853浏览 • 0回复
百度一口气上线文心4.5和X1!实力震惊硅谷！API价格又打下来了，R1还得对半砍！

51CTO技术栈 • 1134浏览 • 0回复
万字解析非结构化文档中的隐藏价值：多模态检索增强生成（RAG）的前景

柏企阅文 • 696浏览 • 0回复
万字综述 LLM 训练中的 Overlap 优化：字节 Flux 等7种方案

amei2000go • 940浏览 • 0回复
万字长文深度剖析基于 MCP 实现 AI 应用架构设计新范式的落地实践

玄姐聊AGI • 912浏览 • 0回复

LV.5

这个用户很懒，还没有个人简介

觉得TA不错？点个关注精彩不错过

98

帖子

802

声望

0

粉丝

关注

最近发布

何恺明开辟分形图像生成新范式！计算效率提高4000倍，首次实现高分辨率逐像素生成 2025-02-26 11:59:41发布
达摩院开源VideoLLaMA3：仅7B大小，视频理解拿下SOTA | 在线可玩 2025-02-14 13:02:21发布

热门推荐

王炸！MCP 架构设计深度剖析 & 使用 Spring AI + MCP 四步教你实现 Agent 智能体开发 0回复

实操干货！MCP 全解析，手把手教你基于 MCP 开发 Agent 0回复

从 Manus 到 DeepSearcher，2025年最值得关注的十大 Agent 智能体架构设计 0回复

Dify从入门到高阶系列二：手把手教学！超详细的Dify知识库配置全攻略 0回复

MCP协议之MCP-server(sse方式)实践 0回复

上一篇： AI斗图神器：普通视频秒变meme，手绘动画轻松融入，了解一下？

下一篇：蜘蛛侠妖娆起舞，下一代ControlNet来了！贾佳亚团队推出，即插即用，还能控制视频生成

社区精华内容

目录

9B模型搞定万字输出

Copyright © 2005-2025 51CTO.COM 京ICP证060544版权所有未经许可请勿转载

恭喜您，今日已阅读两篇内容，特奖励+2声望，快来「登录」领取吧。