当前位置:

首页 > 业界资讯 > 新标题:揭秘大模型运行缓慢的原因:人类思维算法的新方向

新标题:揭秘大模型运行缓慢的原因:人类思维算法的新方向

AI研究者往往忽视人类的直觉能力,但其实我们自己也没有完全理解其精妙程度。最近,弗吉尼亚理工大学和微软的一个研究团队提出了一种思维算法(AoT),它将直觉能力与算法方法结合起来,既能保证LLM性能,又能极大地节省成本大型语言模型最近的发展速度非常快,它在解决一般问题、生成代码和遵循指令方面展现出了显著的非凡能力尽管早期的模型依赖于直接回答策略,但当前的研究则转向了线性推理路径,其做法是将问题分解成子任务来发现解决方案,或通过修改上下文来利用外部机制来改变token的生成。与人类认知类似,早期的LLM策略似

AI研究者往往忽视人类的直觉能力,但其实我们自己也没有完全理解其精妙程度。最近,弗吉尼亚理工大学和微软的一个研究团队提出了一种思维算法(AoT),它将直觉能力与算法方法结合起来,既能保证LLM性能,又能极大地节省成本

大型语言模型最近的发展速度非常快,它在解决一般问题、生成代码和遵循指令方面展现出了显著的非凡能力

尽管早期的模型依赖于直接回答策略,但当前的研究则转向了线性推理路径,其做法是将问题分解成子任务来发现解决方案,或通过修改上下文来利用外部机制来改变 token 的生成。

与人类认知类似,早期的 LLM 策略似乎模仿的是即时的 System 1(快速反应),其特征是通过脉冲决策实现。相较之下,思维链(CoT)和 least-to-most prompting(L2M)等更新的一些方法则反映了 System 2(慢速思考)的内省式本质。值得注意的是,通过整合中间推理步骤,可让 LLM 的算术推理能力获得提升。

新标题:揭秘大模型运行缓慢的原因:人类思维算法的新方向

但是,如果任务需要更深度的规划和更广度的思维探索,那么这些的方法的局限性就显现出来了。尽管整合了自我一致性的 CoT(CoT-SC)可使用多个 LLM 输出来达成共识性结果,但由于缺少细致的评估,可能会导致模型走向错误方向。2023 年出现的思维树(ToT)是一种值得注意的解决方案。其中使用一个 LLM 来生成想法,再使用另一个 LLM 来评估这些想法的优点,之后续以「暂停 - 评估 - 继续」的循环。这种基于树搜索的迭代过程明显是有效的,尤其是对于具有较长延续性的任务。研究者认为,这种进展是使用外部工具来增强 LLM,类似于人类使用工具来规避自身工作记忆的限制。

另一方面,增强的LLM方法也存在一些缺点。一个明显的问题是查询数量和计算需求会大幅增加。每次对GPT-4等在线LLM API的查询都会产生大量的费用,并且会导致延迟增加,这对于实时应用来说尤为重要。这些查询累积的延迟可能会降低方案的整体效率。在基础设施方面,持续的交互会给系统带来压力,可能会限制带宽并降低模型的可用性。此外,还不能忽视对环境的影响,频繁的查询会增加已经高耗能的数据中心的能源消耗,进一步增加碳足迹

研究者的优化目标是在保持足够性能的同时,大幅减少当前多查询推理方法所使用的查询数量。这样的优化可以使模型能够处理需要熟练运用世界知识的任务,并引导人们更加负责任和熟练地使用AI资源

通过思考LLM从System 1到System 2的演变,我们可以看到一个关键因素浮出了水面:算法。算法是富有条理的,它能够为人们提供一种探索问题空间、制定策略和构建解决方案的方法。尽管许多主流文献将算法视为LLM的外部工具,但考虑到LLM固有的生成式复现能力,我们是否可以引导这种迭代式逻辑,将算法内化到LLM内部呢?

弗吉尼亚理工大学和微软的一个研究团队将人类推理的复杂精妙和算法方法的富有条理的精确性聚合到了一起,旨在通过融合这两方面来增强LLM内部的推理能力

根据已有的研究,人类在解决复杂问题时会本能地借鉴过去的经验,确保自己进行全面思考而不是狭隘地关注某一细节。而LLM的生成范围仅受其token限制限定,似乎注定要突破人类工作记忆的阻碍

受到这一观察的启发,研究人员开始探究是否可以利用LLM实现类似的分层思考方式,通过参考先前的中间步骤来排除不可行的选项 - 所有这些都在LLM的生成周期内完成。人类擅长直觉敏锐,而算法善于组织化和系统性的探索。当前的CoT等技术往往回避了这种协同性潜力,过于关注LLM的现场准确性。通过利用LLM的递归能力,研究人员构建了一种人类-算法混合方法。这种方法的实现方式是通过使用算法示例,这些示例能够体现探索的本质 - 从最初的候选项到经过验证的解决方案

基于这些观察,研究者提出了思维算法(Algorithm of Thoughts /AoT)。

新标题:揭秘大模型运行缓慢的原因:人类思维算法的新方向

需要重新写作的内容是:论文:https://arxiv.org/pdf/2308.10379.pdf

新标题:揭秘大模型运行缓慢的原因:人类思维算法的新方向

新标题:揭秘大模型运行缓慢的原因:人类思维算法的新方向

从更广义的范围看,这种新方法有望催生出一种上下文学习新范式。这种新方法没有使用传统的监督学习模式,即 [问题,解答] 或 [问题,用于获得解答的后续步骤],而是采用了一种新模式 [问题,搜索过程,解答]。很自然,当通过指令让 LLM 使用某算法时,我们通常预计 LLM 只会简单模仿该算法的迭代式思维。但是,有趣的是 LLM 有能力注入其自身的「直觉」,甚至能使其搜索效率超过该算法本身。

思维算法

研究者表示,他们的研究策略的核心是认识到当前上下文学习范式的主要不足之处。尽管CoT能够提升思维联系的一致性,但偶尔也会出现问题,导致错误的中间步骤

为了说明这一现象,研究者设计了一个实验。用算术任务(如 11 − 2 =)查询 text-davinci-003 时,研究者会在前面添加多个会得到同等输出结果的上下文等式(如 15 − 5 = 10, 8 + 2 = 10)。

新标题:揭秘大模型运行缓慢的原因:人类思维算法的新方向

经过调查发现,发现结果准确度骤降,这表明仅仅在上下文中提供正确的推理可能会无意中损害LLM的基础算术能力

为了减少这种偏差,让示例更加多样化也许是可行的解决方案,但这可能会稍微改变输出的分布。只是添加一些不成功的尝试(就像是随机搜索),可能会无意地鼓励模型重新尝试,而不是真正解决问题。了解了算法行为的真正本质(其中失败的搜索和后续的恢复以及对这些尝试的学习都很重要),研究者整合上下文示例的方式是按照搜索算法的模式,尤其是深度优先搜索(DFS)和广度优先搜索(BFS)。图 1 给出了一个示例。

这篇论文的主要关注点是一类类似于树搜索问题的任务

对于这类任务,需要将主要问题进行分解,并为每个部分构建可行的解决方案。然后,我们需要决定是否采纳或放弃某些路径,并有可能选择重新评估那些具有更大潜力的部分

研究者的方法是利用LLM的迭代能力,在一次统一的生成式扫描中解决每个子集的查询问题。通过限制只进行一两次LLM交互,该方法可以自然地整合来自之前上下文候选项的见解,并解决需要深度探索解答域的复杂问题。研究者还提出了关于思维大小和为LLM提供何种类型上下文示例以提高token效率的见解。下面将介绍树搜索算法的关键组件及其在新框架中的表现形式

1. 分解成子问题。给定一个问题,就算不看实际解决问题方面,构建一个描述可行推理路径的搜索树已经是一项艰巨的任务。任何分解都不仅要考虑子任务之间的相互关系,还要考虑解决各个问题的难易程度。

以简单的多位数加法为例:尽管对计算机而言,将数值转换成二进制数后效率很高,但人类通常认为十进制数更加直观。此外,即便子问题是一样的,执行方法也可能不同。直觉能找到解答步骤之间的捷径,而如果没有直觉,可能就必需更为详细的步骤。

为了创建出正确的 prompt(即上下文算法示例),这些细微之处非常重要,它们决定了 LLM 为了取得可靠表现所需的最少 token 数量。这不仅能满足 LLM 对上下文的限制,而也对 LLM 的能力很重要,因为我们希望 LLM 能使用相似的 token 量解决与其上下文有共鸣的问题。

2. 为子问题提议解答。现目前的一种主流方法涉及到直接采样 LLM token 输出概率。尽管这种方法对一次性答案有效(有一定的限制),但也无力应对一些场景,比如当需要将样本序列整合进后续 prompt 中或在后续 prompt 中评估时。为了尽可能减少模型查询,研究者采用了一种不间断的解答创建过程。即不带任何生成停顿,为主要子问题直接和连续地生成解答。

重写后的内容: 这种方法有很多优点。首先,所有生成的答案都在同一个共享的上下文中,不需要为每个答案生成单独的模型查询进行评估。其次,尽管一开始看起来有些反直觉,但孤立的标记或标记组概率可能无法总是得到有意义的选择。图4展示了一个简单的示意图

新标题:揭秘大模型运行缓慢的原因:人类思维算法的新方向

3. 衡量子问题的前景。如上所述,现有技术依靠额外的提示来识别树节点的潜力,帮助做出有关探索方向的决策。而研究者的观察表明,如果能将最有前途的路径封装在上下文示例中,LLM 会固有地倾向于优先考虑那些有前途的候选项。这能降低对复杂 prompt 工程设计的需求并允许整合复杂精细的启发式方法,不管这些方法是直觉式的或知识驱动的。同样,新方法中不含脱节的 prompt,这使得能在同一个生成结果中即时评估候选项的可行性。

4. 回溯到更好的节点。决定接下来要探索的节点(包括回溯到之前的节点)本质上取决于所选的树搜索算法。尽管之前已有研究为搜索过程采用了编码机制等外部方法,但这会限制其更广泛的吸引力并需要额外的定制。这篇论文提出的新设计主要采用 DFS 方法并辅以剪枝。目标是维持有同一父节点的子节点之间的近邻度,以此鼓励 LLM 优先考虑本地特征而不是远程特征。此外,研究者还提出了基于 BFS 的 AoT 方法的性能指标。研究者表示,借助于模型从上下文示例中收集见解的固有能力,可以消除额外的定制机制的必要性。

实验

研究人员进行了一项实验,对于24点和5x5迷你填词游戏进行了研究。结果显示,AoT方法在性能表现上优于单个提示方法(如标准方法、CoT、CoT-SC),同时也可以媲美利用外部机制的方法(如ToT)

从表1可以清楚地看出,使用LLM进行树搜索的方法明显优于结合了CoT/CoT-SC的标准提示设计方法

新标题:揭秘大模型运行缓慢的原因:人类思维算法的新方向

在迷你填词任务中,表 3 显示了AoT的有效性,其填词成功率超过了之前使用各种提示技术的方法

新标题:揭秘大模型运行缓慢的原因:人类思维算法的新方向

但是,它比 ToT 差。一个重要的观察是 ToT 使用的查询量巨大,超过了 AoT 百倍以上。另一个让 AoT 逊于 ToT 的因素是算法示例中固有的回溯能力没有充分得到激活。如果能完全解锁该能力,会导致生成阶段显著延长。相比之下,ToT 的优势在于可以利用外部记忆来进行回溯。

讨论

AoT 能否在模仿 DFS 的基础上取得突破?

根据图5所示,AoT使用的节点总体上比DFS版本少。DFS在选择要探索的子树时采用了统一的策略,而AoT的LLM则集成了其固有的启发式方法。这种对基本算法的放大体现了LLM递归推理能力的优势

新标题:揭秘大模型运行缓慢的原因:人类思维算法的新方向

算法的选择会如何影响 AoT 的效能?

在实验中发现,表5显示了这三种AoT变体都比单个查询的CoT更优越

新标题:揭秘大模型运行缓慢的原因:人类思维算法的新方向

这一结果符合预期,因为无论算法是什么,它都会进行搜索并重新审视潜在的错误 —— 要么是通过随机搜索变体中的随机尝试,要么是通过深度优先搜索(DFS)或广度优先搜索(BFS)配置中的回溯。值得注意的是,DFS版本的AoT和BFS版本的AoT这两个结构化搜索的效率都优于随机版本的AoT,这突显了算法洞察在解答发现中的优势。但是,BFS版本的AoT落后于DFS版本的AoT。通过更进一步分析BFS版本的AoT的错误,研究者发现,相比于DFS版本的AoT,BFS版本的AoT更难识别最佳操作

在调节 AoT 的行为时,我们需要关注算法示例中的搜索步数

在图6中展示了总搜索步数的影响。其中,AoT(长)和AoT(短)分别表示相对于原始AoT生成结果更长和更短的版本

新标题:揭秘大模型运行缓慢的原因:人类思维算法的新方向

研究结果显示,搜索步骤会对LLM的搜索速度产生隐含的偏差。需要注意的是,即使在采取错误的步骤时,强调探索有潜力的方向仍然非常重要

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
业界资讯
相关文章 更多
4TB数据搬运:物理传输更高效
4TB数据搬运:物理传输更高效

在千兆宽带、5G通信与云服务深度普及的2026年,大众普遍以为超大文件传输已步入“秒级时代”,但现实远未达到这般畅快。当面对数TB乃至数十TB级别的庞大数据集时,当下最可靠、最迅捷且兼顾安全性的传输方案,依然是“物理位移”——依靠人工携带存储介质完成跨地域交付。一位来自河南信阳的用户讲述了真实经历:他曾需将4TB资料从信阳送往郑州,首次尝试纯网络传输,系统预估总耗时近72小时;最终改用专人驱车运送,单程仅需约2.5小时,当天即完成取件与送达,整体效率显著超越线上方式。该实例迅速引发热议,多位资深IT博主随

华为盘古 Ultra MoE 模型发布
华为盘古 Ultra MoE 模型发布

5月30日,华为推出了全新的AI模型——盘古UltraMoE,该模型的参数量达到了7180亿。作为一款接近万亿参数的MoE(MixtureofExperts)模型,它在整个训练过程中完全基于华为的昇腾AI平台完成,标志着华为在超大规模模型训练方面取得了重要进展。盘古UltraMoE的成功训练离不开盘古团队研发的一系列创新技术。例如,Depth-ScaledSandwich-Norm(DSSN)稳定架构的引入,显著改善了超大规模模型训练期间出现的梯度异常及

SOTA大模型加密数据评测:Qwen3仅破10%
SOTA大模型加密数据评测:Qwen3仅破10%

大语言模型面对加密数据,即便最新的Qwen3也会感到压力!尽管当下各类推理模型在多种基准测试中表现优异,但在密码学这样对逻辑严谨性和细节准确性要求极高的专业领域,模型的推理能力还有待深入挖掘。密码学不仅要求模型具备高级数学运算能力和严密的逻辑推理链,还需要其能够精准辨识复杂加密模式中的潜在规律;成功解密要求模型拥有极强的综合推理能力。上海AILab等联合推出的CipherBank测评,使用大量真实隐私场景数据和多种密码算法,严苛挑战当前最先进的大模型。CipherBank的测评结果显示,目前的大语言模型

每2秒解一道高数题!华为揭秘万亿MoE训练系统全流程
每2秒解一道高数题!华为揭秘万亿MoE训练系统全流程

现在,请大家一起来数一下"1"、"2"。OK,仅仅2秒的时间,一个接近万亿规模的MoE大模型就已经掌握了如何解答一道高等数学难题的方法!而且呢,这个大模型还是完全依靠国产设备进行训练的,整个流程都体现了浓浓的“国产”特色。这就是华为借助"昇腾+PanguUltraMoE"这一组合实现的成果——不仅达成了国产算力与国产模型在全流程上的自主可控训练闭环,还在集群训练系统的性能方面达到了行业顶尖水平。有多顶尖?来看一组数据:预训练阶段:昇腾Atlas800TA2万卡集群的MFU提升

美团推出首个语音GUI智能体,端到端语音训练更优
美团推出首个语音GUI智能体,端到端语音训练更优

只需动动嘴,就能操控GUI代理?由美团与浙江大学联合推出的GUIRoboTron-Speech——让你彻底解放双手,直接对设备“发号施令”。这是首个可以直接通过语音指令和屏幕截图进行端到端(End-to-End)决策的自主GUI智能体,致力于为用户提供更自然、高效且无障碍的人机交互方式。从文本到语音,智能代理的新一轮进化目前,基于大语言模型(LLMs)的自主GUI智能体已经能够通过文本指令自动完成跨应用、多步骤的复杂操作,显著提升用户效率。然而,这种依赖文本输入的方式在某些场景中存在明显局限

雷克沙ArmorSD卡测评:全金屬防護三防加持存储更安心
雷克沙ArmorSD卡测评:全金屬防護三防加持存储更安心

无论是专业摄影师还是摄影爱好者,相机内存储卡的可靠性都至关重要,尤其是在恶劣的拍摄环境中,数据存储的安全性更是不可忽视。尽管市场上有多种支持三防功能的移动存储设备用于数据备份,但最常用的SD存储卡由于采用塑料外壳,长期使用后容易出现破损,导致数据损坏,甚至可能损坏相机的存储卡槽,带来的损失不可估量。国际存储品牌雷克沙推出了全新的Armor系列SD存储卡,不仅读写速度快,还采用了不锈钢材质的外壳,具有优异的防水、防尘和防跌落性能,为相机的原始拍摄数据提供了可靠的保护。雷克沙ArmorSD存储卡分为GOLD

Siri等明年!苹果WWDC25给AI交底:画小饼,继续熬
Siri等明年!苹果WWDC25给AI交底:画小饼,继续熬

不求速胜,熬吧。

第一章:计算机系统全方位概述
第一章:计算机系统全方位概述

1.1计算机发展历程[计组]1.0_你好,我是计算机组成原理我们生活在一个信息化程度极高的世界中,我们每天的生活都离不开电脑和手机,这些设备实际上都属于计算机的范畴。计算机的底层结构由硬件构成,在硬件之上,我们会安装操作系统,再在操作系统上运行各种应用软件,这样就能得到一个易于使用的计算机系统。通过计算机网络,这些设备实现了信息的互联互通,这正是我们现在生活的信息化世界的缩影。计算机组成原理这门课研究的就是这些计算机硬件在底层如何协同工作。既然我们要研究硬件,不妨先来看一下大家日常生活中常见的一些硬件

vivo 获批模块化智能手表专利 可调传感器以获得更精准数据
vivo 获批模块化智能手表专利 可调传感器以获得更精准数据

近日,vivo的一项智能手表专利正式获得批准并公开展示。该专利采用模块化设计,通过磁力锁扣和滑动限位槽,用户可以手动调整传感器的位置,以确保健康数据的精准收集。vivo这项专利的核心亮点是其模块化结构。手表由可穿戴主体和可拆卸设备主体两部分组成,用户可以通过滑动限位槽和磁力锁扣,旋转或移动内部传感器模块,将其调整到最佳佩戴位置。这种设计有效提高了健康数据的监测准确性,如心率和血氧等关键指标。对于不同体型和佩戴习惯的用户来说,这种可调节性尤为重要,能够确保传感器与皮肤的紧密接触,减少因位置偏差导致的误差

LCD硬件操作原理详解
LCD硬件操作原理详解

本文参考自百问网-韦东山驱动大全,旨在探讨当前手机中常见的LCD屏幕。LCD与OLED的区别关于LCD和OLED的区别,可以参考以下链接:https://www.zhihu.com/question/22263252/answer/410201820不同接口的LCD硬件操作原理应用工程师眼中的LCDLCD由一个个像素组成,每行有xres个像素,共有yres行,其分辨率为xres*yres。只要我们能够控制任意一个像素的颜色,就可以在LCD上绘制文字和图片。像素的颜色表示像素的颜色通常用红绿蓝三色来表示

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师
macOS

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

WINDOWS 更多
Windows 10
Windows 10
Windows

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘
Windows/macOS/iOS/Android

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。