军事防务数据板块介绍:系统化采集、存储、管理、分析与军事国防安全相关信息的专用数据板块,其核心在于整合全球新兴国防技术(军事人工智能、无人系统等)、热点案例(俄乌战争、美以伊战争)等方面的最新时讯、研究报告/论文、条令法规、案例分析,为战略研判、情报分析、决策支持等提供知识支撑。

摘要:智能体人工智能是人工智能领域新兴的范式,指旨在以最少的人为干预追求复杂目标的自主系统。传统人工智能依赖结构化指令和严密监督,而智能体人工智能展现出适应性、高级决策能力和自给自足性,使其能够在不断变化的环境中动态运行。本综述深入探讨了推动智能体人工智能发展的基础概念、独特特征和核心方法。我们审视了其在医疗、金融和自适应软件系统等各个领域的当前和潜在应用,强调了在现实场景中部署智能体系统的优势。本文还探讨了智能体人工智能带来的伦理挑战,提出了针对目标对齐、资源限制和环境适应性的解决方案。概述了将智能体人工智能安全有效融入社会的框架,强调需要进一步研究伦理考量,以确保对社会产生有益影响。本综述作为对智能体人工智能的全面介绍,指导研究人员、开发人员和政策制定者以负责任和创造性的方式参与其变革潜力的发掘。

索引术语:智能体人工智能,自主系统,人与人工智能协作,适应性,治理框架,伦理人工智能。

A. 动机与背景

智能体人工智能构成了人工智能发展进程中的一次质的飞跃,其定义为能够在变化且不受控的环境中设定复杂目标,并通过自主管理资源来追求这些目标。然而,大多数人工智能系统都是作为受监督的工具构建和运行的,附带了限制和定义。这些系统擅长在特定边界内执行定义明确的任务,但当所尝试的任务没有终止状态或特定参数可供操作时,往往会显著失效。而智能体人工智能可以作为底层操作实体,即,目标导向的,即使在发生剧烈变化且需要在多个此类目标之间切换的情况下亦是如此。

推动智能体人工智能设计的因素之一,是迫切需要能够在更优且复杂的现实条件下运行、并具有显著灵活性空间的工具。例如,在灾害救援、医疗保健和网络安全领域,既需要做出正确决策,又存在相当大的混乱,独立控制局面的能力至关重要。智能体人工智能不仅辅助人类行动;它们还在承担需要高度参与和多任务处理且无需持续人工干预的任务时,增强了人类行动的能力。这种范式转变有望将人工智能的目标领域从被动和反应式扩展到专注于战略规划、信息处理和问题解决,从而在条件成熟时开启一个新时代。

智能体人工智能[1],[2],[3]对社会的影响可能相当可观。随着人工智能日益嵌入更多核心系统和行业,智能体人工智能系统将能够与人类并肩工作,承担可重新分配人力、提高生产力以及参与人类不宜或危险出现的任务。这种变革可能改变各行业的就业结构,实现协同工作,即人工智能执行操作性任务,而人类处理更复杂和更具战略性的角色。

B. 定义与范围

在此意义上,智能体人工智能包含了一类自主人工智能系统[4],这些系统承诺在无人监督的情况下完成一组跨越较长时间的复杂任务。它学习上下文并做出决策。此类系统被设计为以一定程度的自主性运行,使其能够穿越变化的环境、应对意外情况,并随时间优化性能。将自主性和适应性特征结合在一起,以应对面向任务的过程。与基于规则且需要执行指令的经典人工智能[5]以及模式化并生成图像的生成式人工智能不同,智能体人工智能兼具两者之长。

将智能体人工智能与当前人工智能范式并列,有助于明确其边界。例如,经典人工智能从未专注于图像识别或语言翻译[6],[7],而是旨在实现非常狭窄的目标。

首先是生成式人工智能[8]的工作原理。在逆向操作中,它组合通过数字学习到的信息片段,并创建内容,如文字或图像。另一方面,智能体人工智能超越了前两种方法,具有目标导向、输入驱动和适应性特征,使其能够在一段时间内完成复杂和多层次的任务,而无需每次都提供一套指令。

在本综述的此部分,重点在于为何应对智能体人工智能产生兴趣。从其结构和操作特征出发,为何它基于目标,以及这种先进的人工智能类型如何应用于其应用具有独特性的各个领域?此外,本文还探讨了使用基于此类人工智能的系统所产生的各种实际和道德问题,并讨论了应对安全性、透明度和问责制的方法。所提供的智能体人工智能定义使本综述的作者能够准确讨论此类人工智能系统的哪些特征使其区别于其他系统,并有助于对其开展有效和综合的分析。

C. 目标与贡献

本综述论文旨在全面汇集智能体人工智能知识,并界定其边界,以便更广泛的研究人员、开发人员和政策制定者更容易理解。本综述的主要贡献包括:

● 系统梳理构成智能体人工智能系统的核心要素,重点阐述这些系统与其他常识性和生成式人工智能系统的区别。

● 全面研究用于构建和评估智能体人工智能的技术和概念,包括架构、学习方法和训练方法。

● 在不同领域的当前和潜在用途,包括智能体人工智能实际应用有效性的实践案例。

● 突出工程问题,但不限于此:目标设计与收敛、上下文适应和资源限制。

● 本文考量了采用智能体人工智能所涉及的伦理、社会和监管问题,包括责任、公平和透明度等相关关切。

● 对未来研究提出建议,推进关于如何最好地将规模、上下文和伦理问题整合到智能体人工智能实施中的建议。

本文的预期贡献不仅仅是一次文献综述;相反,它们应提供一个有用且组织良好的背景,以阐述智能体人工智能的问题和细节。本文旨在为管理运营实践和技术解决方案提供重要见解,以促进和维持合乎伦理的智能体人工智能系统的发展。

D. 论文结构

本文的其余部分组织如下:

● 第二节介绍了基本概念和定义,有助于将智能体人工智能理解为人工智能大背景下的特定实体。

● 第三节探讨了智能体人工智能的典型结构,包括独立性、灵活性以及选择行动的能力。

● 第四节识别并描述了智能体人工智能构建的方法——结构设计、学习类型以及评估和效率度量形式。

● 第五节讨论了智能体人工智能已找到应用的不同领域,重点关注工业应用以及与人类协同工作的案例。

● 第六节展示了各种体现智能体人工智能系统的比较分析,侧重于评估这些系统时所采用的不同性能度量和指标。

● 第七节解释了智能体人工智能在目标设定和与环境交互方面的技术细节和困难。

● 第八节提出了社会、伦理和治理问题,涉及责任、公平和法律合规。

● 第九节审视了促进智能体人工智能建设性和负责任实施的现有系统,包括监督和监管组件。

● 第十节描述了知识差距和预期的研究与开发工作,同时考量了更新智能体人工智能理念。

● 第十一节提出了本文的最终评述,包括研究结论,以及需要跨学科联系以负责任地推动该领域前进的评论。

本综合综述将为智能体人工智能的当前状态、未来潜力以及为确保其安全有效部署必须应对的挑战提供宝贵见解。

成为VIP会员查看完整内容
21

人工智能(AI)与机器人技术的快速发展已从根本上改变了战争形态,迫切要求从1:1操作员对遥控车辆模式向复杂的一对多(1:N)人机协同架构转型 (Monas, Belford, Nettrour, 2026)[1]。这一转变要求训练并培养士兵,使其运用人工智能赋能的异构无人机部队,以实现远超无辅助人类认知极限的规模与决策速度。这些异构无人机部队是由远程与自主的陆地、空中及濒海载具组成的网络化集群,根据任务、敌情、地形、部队、时间以及民事因素量身定制。控制这些无人机部队的士兵将把低成本、可消耗的数量规模与精锐的指挥与控制(C2)、情报、监视与侦察(ISR)以及打击平台进行同步,从而在速度、节奏和精确杀伤力上取得决定性优势。

本文将探讨,实现完全集成的人工智能无人机部队需要如何修订当前无人系统的军事职业专长(MOSs),并采纳对自主战争至关重要的新技能组合与运用方法。

成为VIP会员查看完整内容
17

本文由美国战争部(DOW)下属非常规战争中心(IWC)资助的一项新研究项目所成。该项目旨在回答这一问题:“何为认知战(CogWar),其与信息作战(IO)、政治战、宣传及其他非动能战争形式有何区别?”[1]回答这一问题至关重要,因为认知战(CogWar)是21世纪非常规战争(IW)领域及空、陆、海、天等其他战争域中信息作战(IO)的根基所在,更是取得胜利——尤其是避免常规战争而实现胜利——的关键。[2]认知战(CogWar)的“域”以人类感知与信念建构的认知功能为作战空间。该作战空间内的斗争旨在争夺敌方与己方民众的感知。例如,其与信息作战(IO)的区别在于,信息作战(IO)争夺的是数据(及信息)本身,而认知战(CogWar)争夺的是赋予信息与数据以意义的语境与感知。[3]认知战优先考量的并非数据,而是数据的意义。认知战的核心问题不再是“人们注意到了哪些数据?”,而是“无论人们是否意识到这些数据,数据如何引导其形成特定的意义建构?”[4]学者、安全联盟及同盟的初步研究表明,尽管认知战(CogWar)的根基与战争本身一样古老,但就实现战略目标而言,其已成为一种新颖且可能更为有效的战争形式。[5]它利用恐惧、焦虑与猜疑等心理武器削弱对手的战斗意志,同时坚定己方民众继续冲突的决心。

成为VIP会员查看完整内容
16

现代国防系统日益复杂,对工程工作流的速度和适应性提出了越来越高的要求。虽然基于模型的系统工程(MBSE)与新兴的系统建模语言版本2(SysML v2)标准为捕获系统行为提供了框架,但其实际使用常常受到手动建模所需的专业知识和时间的限制。本研究探讨了大语言模型(LLMs)是否能够通过从制导、导航与控制(GNC)文本输入自动生成系统建模语言版本2(SysML v2)状态机来帮助克服这一障碍。开发并评估了三种基于Flowise的大语言模型:结构化转换模型(STM),其使用结构化提取和JSON编码过程;示例引导结构化模型(EGSM),其将结构化提取与示例驱动生成配对;以及示例引导上下文模型(EGCM),其应用灵活的参数提取和带有系统建模语言版本2(SysML v2)定义的示例驱动生成。每种模型均使用三个GNC子系统的技术文档进行测试:光电导引头、惯性恒星罗盘和混合导航系统。输出根据评估语法正确性、语义保真度和行为一致性的十个指标进行评价。优先选择70亿至140亿参数的本地大语言模型,因其定制化性能、隐私性和模型自主性,并与更大的模型GPT-4o和Claude 3.7进行了比较。结果表明,所有方法均成功生成了有效的、可重用的系统建模语言版本2(SysML v2)模型,达到了不同的保真度水平。本地模型,尤其是那些使用示例引导策略的模型,在大多数指标上取得了稳健性能,且需要最少的修正。这些发现表明,大语言模型能够支持自动化的系统建模语言版本2(SysML v2)模型生成,并显著降低与基于模型的系统工程相关的技术负担,有可能在国防相关系统开发中实现更广泛的采用。

关键词:大语言模型,系统建模语言版本2,制导、导航与控制

现代国防系统日益复杂,随之而来的是对关键系统的设计、分析和沟通需要更快、更适应性的方法。大语言模型(LLMs)的快速涌现标志着在国防应用中设计、理解和沟通复杂系统方式的一个变革性时刻。随着国防部(DoD)面临加速开发周期和适应不断变化的任务需求的压力,传统的基于文本的文档已被证明是不够的,因其缺乏灵活性、可重用性和可维护性。这些限制与数字孪生的实施不相容,在数字孪生中,动态的、基于模型的表示作为活系统随时间演变。

基于模型的系统工程(MBSE)与即将推出的系统建模语言版本2(SysML v2)标准提供了一种结构化方式,可将系统模型创建为单一事实来源,以可互操作格式捕获行为、结构和数据流。然而,构建MBSE模型所需的专业知识和投入常常限制其实际使用。本研究旨在证明,大语言模型能够通过从制导、导航与控制(GNC)用例的特定领域文本输入自动生成行为模型,从而大幅降低MBSE的门槛。大语言模型具有巨大潜力,可开辟一条更快、更便捷的路径,用于创建准确捕获系统行为并实现跨国防领域可扩展设计的代表性模型。

问题陈述

当前对国防部感兴趣系统的分析和开发状态证明,这些系统的复杂性和快节奏采办需要新颖的解决方案来快速设计、沟通和利用信息。基于模型的系统工程工具提供了通过状态机捕获复杂系统行为来创建描述性、视觉直观模型的方法。这种模型格式允许用户快速发现、共享和跨其他平台复制这些系统。然而,这一过程需要大量的组织投入和MBSE专业知识才能被正确使用。大语言模型可以通过从相关来源材料逻辑地自动生成特定任务的MBSE代码来弥合这一知识差距;从而加快时间表、减少组织负担并促进项目参与。

本研究假设,利用本地和基于服务器的大语言模型结合大语言模型工具将能够实现行为模型的自动生成,这些行为模型表示为基于MBSE的系统建模语言版本2(SysML v2)状态,从而加速系统模型的设计和开发。大语言模型可以通过自动生成准确捕获系统行为的描述性模型,弥合MBSE中广泛的专业知识和组织投入差距。这种方法有潜力增强模型重用性和灵活性,促进模型快速适应不同系统和应用。此外,小型本地大语言模型在可达的必要硬件、定制化性能、隐私性、操作安全性和自主性方面为国防部应用提供优势。更大的基于服务器的大语言模型可以指导关于在安全网络上部署或开发针对任务需求定制的更大的本地托管模型的战略投资决策。

本研究的主要目标是评估使用本地和基于服务器的大语言模型结合开源、低代码用户界面(UI)工具以支持GNC用例行为模型自动生成的可行性和有效性。具体而言,本研究旨在确定与系统建模语言版本2(SysML v2)建模语法和语义对齐的结构化提示工程是否能够使大语言模型将描述性技术文档转换为准确的、基于状态的系统模型。通过以GNC子系统的详细文本描述启动该过程,本研究试图展示如何使用系统建模语言版本2(SysML v2)捕获每个行为状态及其相关组件、功能和数据交互。最终,这项工作旨在表明,大语言模型辅助的模型生成不仅是可实现的,而且能够增强MBSE框架内系统模型开发的速度、可访问性和整体质量。

研究问题

  1. 能否使用大语言模型从特定领域的文本输入生成系统行为描述性模型?2. 大语言模型生成的模型在多大程度上准确表示系统建模语言版本2(SysML v2)中GNC子系统的基于状态的行为?3. 基于大语言模型的模型生成工具是否适用于跨不同系统建模状态机?

方法论

本研究探讨了使用大语言模型支持GNC子系统用例行为模型的创建和自动生成。所采用的建模框架是系统建模语言版本2(SysML v2),这是一种基于MBSE的语言,预计将于2025年获得正式批准和发布。使用开源、低代码UI Flowise开发了三种小型本地大语言模型,该UI能够构建具有定制提示和可调参数的自定义大语言模型链,并结合Ollama框架用于下载和管理所选模型。为建立性能基线,应用了相同的提示结构并使用更大的基于服务器的大语言模型(特别是GPT-4o和Claude 3.7)进行了验证。所有Flowise模型的输出根据十个定义的指标进行评估,评估语法正确性、语义保真度和输入-响应对齐,以确定基于大语言模型的提取、推理和系统建模语言版本2(SysML v2)代码生成的有效性。

本研究的预期贡献是生产定制的基于大语言模型的工具和定制提示,用于为GNC用例自动生成系统建模语言版本2(SysML v2)状态。这一结果不仅提供了代表性的打包模型,还提供了关于利用本地和基于服务器的大语言模型自动生成描述性模型的实用性的背景和见解。

成为VIP会员查看完整内容
17

摘要:本文审视了比德尔的现代兵力运用系统,并将其与多域作战概念的核心要义及原则相关联。文章引入了一种替代性作战概念——涌现、动态、全球与演进(EDGE)作战,其中某些任务必然需要运用人员要素,而其他任务则须由非人类智能实体在社会技术体系内自主执行。EDGE作战概念进而由一种替代性指挥方法作为支撑,该方法被定义为“人-自主指挥”(Human-Autonomy Command),旨在提升认知优势以及作战可用性、通用性与效率。复杂性与涌现研究有助于在两个真实案例中识别自学习、涌现与演进的特征,展示了人类与人工智能执行功能的异质性与适应性行为。研究结果支持构建一种技术无关、适应性强且分布式的“人-自主指挥”方法,尽管任务动态可能有所不同,但该方法能够安全高效地达成任务目标。本文得出结论:现代系统需要演进或让位于替代性方法,以成功支持未来的指挥官、操作人员、自主人工智能体及其相互关联的作战维度。某一领域(即虚拟领域)的行动必须被允许在另一领域(即物理或认知领域)产生涌现的协同作战效应。

关键词:现代战争;多域作战;认知优势;人-自主系统;人-自主指挥

图. 人-自主指挥(HAC)的功能架构。箭头表示信号、标志、符号及行动的流向,这些流向是观察、控制、合作以及对任务环境施加直接影响和在作战环境可控子空间内施加间接影响的手段。人-自主指挥(左)、认知控制(中)以及作战环境中的效应(右)分别对应前文所形式化的“人-自主指挥”、“人-自主系统”与“认知系统性行动协调”建构。

当代及未来的国防与安全作战日益呈现出时间紧迫性、资源紧迫性与安全紧迫性。能力要素之间表现出强烈的功能耦合与相互依存关系。比德尔(Biddle,2004)的现代兵力运用系统需要演进,以成功支持未来的指挥官、操作人员、自主人工智能体,以及它们之间相互关联的作战维度:物理域、虚拟/信息域和认知/社会域。某一领域(即虚拟域)的行动必须被允许在另一领域(即物理域或认知域)产生涌现的协同作战效应。

现代系统代表了一项严谨的学术努力,旨在厘清军事组织将潜在能力转化为作战力量的具体机制。因此,对其有效性进行初步分析是探究军事效能决定因素与特征的重要起点。

格拉维尔(Grauer)与霍罗威茨(Horowitz,2012)报告的研究结果表明,比德尔的现代框架系统并不能独立解释胜负。任务成功毋宁说是物质力量、政权类型以及其他通过特定兵力运用概念得以关联和转化的因素共同作用的结果。即便进一步研究表明现代系统对作战力量的生成并无独立影响,现代系统仍是一项重大的理论成就,因为它描述了一种战场关键因果关系的模型。探究这一框架对于推进关于复杂人类系统如何通过构建主体层面交互来产生有效绩效的通用理论至关重要。

设计与论述结构

本文所述工作旨在探究现代系统是否在当前及未来的多域作战(MDO)中充当军事行为的稳健吸引子,以及它是否仍有资格作为军事组织在其竞争环境中适应并取胜的主要机制之一。

多域作战的一个特例尤为值得关注——涌现、动态、全球与演进(EDGE)作战(Norlander 2025a),其中某些任务必然需要运用人员要素,而其他任务则须由非人类智能实体在社会技术体系内自主执行。EDGE作战要求相关技术能够自主地与其他实体交互,并在无需持续人工监督的情况下应对作战环境(OE)中的变化。除社会技术层面外,还必须关注人-自主系统(HAS)的认知与系统性层面,该系统涵盖自主智能体、人类操作员与指挥官的完整谱系(Norlander 2024a, 2024b, 2024c)。

为了更好地理解HAS的能力与局限,包括其在各类任务与使命中的表现,必须厘清指挥与控制的认知层面。本文定义了一种“人-自主指挥”(HAC)方法,旨在增强认知优势,以管理和维持作战可用性、通用性与效率。复杂适应系统(CAS)研究体系(Holland 1995, 2006)为识别复杂系统中各实体的自学习、涌现与演进特征作出了贡献,展示了异质性与适应性行为。CAS具有自学习、涌现与演进的特征。唯有应用适应性控制策略,方能实现安全高效的控制。将自主适应智能体(AAA)研究体系纳入此项研究工作,使得将智能体视为团队成员、补充人类认知执行功能的视角成为可能,进而形成一种技术无关、适应性强且分布式的系统,尽管任务动态可能有所不同,但该系统能够安全高效地达成任务目标。

成为VIP会员查看完整内容
17

综述 | 基础模型无监督后训练:方法、边界与未来

论文题目:Unsupervised Post-Training of Foundation Models: A Survey 作者:Yijie Xu、Qianyi Cai、Huizai Yao、Yili Wang、Tianfu Wang、Cehao Yang、Xingbo Yao、Zhiyu Guo、Aiwei Liu、Xuming Hu、Weiyu Guo、Hui Xiong 机构:香港科技大学(广州)、香港科技大学、小红书、腾讯微信、香港中文大学、AI2 Robotics 论文链接:https://arxiv.org/pdf/2608.24982

导读

基础模型后训练通常依赖外部监督:人工标注、偏好数据、更强教师模型,或数学验证器、单元测试、可执行环境等外部反馈。本文关注的是另一条正在快速增长的路线:无监督后训练。它只使用未标注输入,并从同一模型谱系自身产生的样本、分布、判断、目标或课程中提取学习信号,进而对参数、适配器、记忆或持久状态进行更新。 这篇综述的价值在于给“无监督后训练”划出严格边界。作者收录 2023 年 1 月至 2026 年 5 月的相关工作,冻结出 94 条方法记录,其中 80 条属于严格无监督后训练。严格定义需要同时满足四个条件:真实发生更新;输入没有标签;更新信号只来自同一模型谱系的样本或判断;任何评判器、打分器或奖励模型都必须来自同一谱系。也就是说,只在推理时搜索、不更新模型,不算;用了外部验证器、工具判定、人工标签或更强教师,也不算。 论文提出一个非常清晰的分类主轴:到底是什么“模型内部对象”提供了更新信号。由此得到四大家族:预测统计优化、样本关系监督、自生成目标自举、内部评估器自举。作者进一步给出一个正交视角:输入何时可见,更新能持续多久。两条视角合在一起,构成了选择和评估无监督后训练方法的技术地图。

1 Introduction:引言

研究背景

基础模型后训练经历了两波外部监督。第一波是人工标签与偏好学习,例如监督微调和基于偏好的强化学习。第二波是外部验证器,例如数学检查器、单元测试和可执行环境,这类信号推动了可验证奖励强化学习。 第三波正在形成:模型只面对未标注提示、文本或目标输入,通过自身生成的样本、分布、判断和课程产生更新信号。它适合标签难以获得、验证器难以迁移或开放式生成难以精确打分的场景,例如领域语料适配、对话、摘要、长上下文和多模态推理。

主要贡献

论文的贡献包括三点。第一,提出严格的边界协议,把信号来源和任务结构分开讨论,避免把外部验证器或教师信号混入无监督后训练。第二,以“更新对象”为核心建立四大家族分类,并用输入可见性和更新持久性给出部署时机图。第三,从跨家族角度讨论适用场景、递归错误传播和部署检查,为未来评测提供统一语言。

2 Scope, Survey Protocol, and Definitions:范围、协议与定义

调研范围

论文覆盖文本和多模态基础模型,从 2023 年 1 月到 2026 年 5 月,聚焦在预训练之后使用未标注输入进行更新的方法。检索覆盖继续预训练、测试时适配、内部一致性、自训练、自奖励和多模态无监督后训练等关键词,最终整理出 80 个严格方法、8 个相邻方法以及若干边界或前驱记录。

严格定义

无监督后训练被定义为:从已微调基础模型出发,使用未标注提示、文本或目标输入,修改模型参数、适配器、记忆或持久局部状态,并且更新信号不来自外部监督。外部监督包括标准答案、验证器反馈、工具执行判定、人工标签和更强教师标签。 作者提出四个边界检查。第一,必须有显式更新。第二,更新信号只能来自未标注输入和同一谱系模型产物。第三,不得引入外部监督。第四,任何评判器、打分器或奖励模型都必须由同一模型谱系产生。这个边界让许多看似相近的方法被归入“相邻轨道”,例如无更新的推理时搜索、工具辅助自训练、人工或种子监督自举、跨模型蒸馏和外部奖励方法。

更新对象

论文把“内部更新对象”定义为产生更新信号的模型派生产物。它可以是预测分布、多个 rollouts 之间的关系、自生成目标、偏好对、候选答案、评判结果或奖励信号。分类不看方法名称,而看梯度实际消费的对象。多数投票如果直接作为奖励,是样本关系监督;如果用来筛选伪标签再做监督训练,则是自生成目标自举。

3 Prediction-Statistic Optimization:预测统计优化

核心机制

第一类方法最直接:从模型在单个观测上的预测统计量提取更新信号,例如负对数似然、熵、置信度或几何规则统计。它不生成伪标签,不构造偏好对,也不训练内部评判器,而是直接优化模型自身分布的某个量。 最典型的形式是继续预训练,即在未标注领域语料上最小化语言模型损失。当瓶颈是领域分布迁移时,这条路线简单有效。相关工作还将预测似然扩展到长上下文扩展、测试时学习和样本局部状态更新。

优势与风险

这类方法路径最短,成本和概念复杂度相对低,适合领域语料适配、长上下文语料扩展和分布漂移下的快速调整。但它的风险也很明确:优化低熵或高置信度不一定等于模型更正确。若内部统计与下游行为不一致,模型可能只是更自信地犯错。因此评测不能只看被优化统计量,还要看独立下游任务、校准和 held-out 质量。

4 Sample-Relation Supervision:样本关系监督

一致性信号

第二类方法不读取单个样本的标量,而是读取多个模型样本之间的关系。内部更新对象可以是聚类质量、一致性得分、多数投票、语义簇、候选答案频率、样本间对比一致等。核心假设是:如果多个独立生成路径聚到同一答案,这个关系本身就包含有用信号。 单提示内部一致性是最简单的版本:对同一提示采样多个回答,按语义聚类、路径一致性或不确定性构造奖励。更常见的路线是测试时强化学习,例如对每个目标问题采样多个 rollouts,用多数答案构造伪奖励,再进行策略优化。

多模态扩展

样本关系监督也迁移到多模态模型。视觉语言模型可以对图像问题生成多个答案,用频率、熵或一致性构造奖励;也可以通过自生成视觉问题、候选回答和多轮一致性形成训练信号。这些方法不依赖图像文本标签、外部 captioner 或外部验证器,而是从模型自身的多模态 rollouts 中提取监督。

关键限制

一致性并不等于正确性。多数投票只有在错误足够分散、答案等价关系稳定时才可靠。如果多个样本共同落入同一个错误模式,训练会把“流行错误”放大。因此论文建议报告样本多样性、错误多数频率、不同答案规范化器下的稳定性,以及开放式改写后的收益是否保持。

5 Self-Generated Target Bootstrapping:自生成目标自举

目标构造

第三类方法先从模型分布中构造可训练目标,再用监督微调或偏好优化训练。目标可以是指令、回答、知识问答、推理链、计划、课程、辩论轨迹或偏好对。与样本关系监督不同,这里的梯度不是直接消费“多数关系”,而是消费被筛选出来的目标数据。 例如,自教式知识获取可以从原始文档生成问答和反思任务;推理自训练可以生成多条思维链,用自一致性筛选后继续微调;课程自举可以让一个模型提出接近另一个模型能力边界的问题,再用内部伪标签训练求解器。

推理与偏好

推理目标是这一家族最大的分支。方法通常生成多条推理轨迹,再按自一致性、置信度、前瞻质量或辩论共识筛选。另一条分支生成偏好对,再用类似偏好优化的目标训练,例如按自一致性、短长上下文表现或内部答案置信度对回答排序。

可检查性

自生成目标的优势是数据对象可检查、可缓存、可复用,也更容易与离线训练流水线结合。风险是选择错误一旦进入目标集,会在后续轮次中持续存在,形成确认偏差。因此需要跟踪目标多样性、重复率、难度分布、轮次间漂移和 held-out 质量。

6 Internal Evaluator Bootstrapping:内部评估器自举

内部评判器

第四类方法把模型自身提升为评估器。内部更新对象不再只是目标,而是同一谱系模型产生的评判器、奖励模型、打分器或元评审。它可以输出成对偏好,也可以输出标量奖励;训练则通过偏好优化或策略梯度消费这些 verdict。 典型路线是自奖励语言模型:同一个模型交替扮演生成者和评判者,把选择与拒绝样本喂给偏好优化。后续方法通过跨轮一致性、元评审、时间锚定等方式缓解偏差放大、评判饱和和梯度消失。

开放式输出

内部评估器适合开放式任务,因为开放式输出很难用答案相等或多数投票来定义正确性。对话、创作、摘要、长文本和多模态生成往往需要语义标准,而不是硬答案。内部评估器能够提供更灵活的语义反馈,但反馈链也更长:评判器本身会漂移,演员和评判器可能共同偏向,错误更难被外部观察。

7 Cross-Family Synthesis:跨家族综合

四种杠杆

四大家族本质上把不同内部代理信号变成更新。预测统计优化利用分布形状;样本关系监督利用多样本聚合;自生成目标自举把选择结果物化为训练数据;内部评估器自举为开放式输出提供语义标准。语义灵活性越强,反馈路径越长,越需要独立评估、一致性约束和多样性保护。

选择原则

如果数据是原始领域语料,问题主要是分布迁移,预测统计优化是直接基线。如果能够负担多样本采样,而且任务存在可靠的答案等价关系,样本关系监督可以利用共识。如果生成目标能被离线检查,自生成目标自举提供清晰的数据接口。如果输出开放且难以定义相等,内部评估器自举更合适,但必须监控评判漂移。

安全检查

每个家族的防护点不同。第一类要检查校准和下游质量,而不是只看熵或似然。第二类要检查样本多样性、错误多数和答案规范化敏感性。第三类要检查目标集多样性和轮次更新。第四类要检查演员与评判器相关性、偏好边际、跨轮一致性和评判饱和。通用要求是保留冻结基线、回滚检查点和独立评测集。

8 Timing of Adaptation:适配时机

两个正交轴

更新对象回答“什么信号驱动更新”,适配时机回答“什么时候看见目标输入、更新能持续多久”。论文用输入可见性和更新持久性构成正交视角。相同更新对象可以被部署到不同时间制度中,因此家族决定监督形态,时机决定部署成本和风险。

主要制度

离线语料适配发生在部署前,目标分布不可见,典型形式包括继续预训练、自奖励和离线自训练。全队列转导适配在目标推理前看到整个目标集合,常见于测试时强化学习。少样本目标适配只看到少量目标样本,再泛化到剩余目标,要求更强泛化。流式持续适配按时间推进,只能使用过去样本。测试实例适配为当前样本临时更新并在边界处重置。序列内适配则在一个长序列的 token 或 chunk 之间更新局部状态。

部署含义

更新越靠近目标输入,潜在收益越针对当前分布,但也越容易引入不稳定性、计算开销和评测污染。更新越持久,越可能积累长期收益,也越可能积累错误。因此无监督后训练不应只报告“有没有提升”,还要报告输入可见性、更新预算、持续时间、是否重置、是否使用 held-out 目标评测。

9 Challenges and Future Directions:挑战与未来方向

递归错误传播

递归错误传播是核心开放问题。内部代理信号不完美时,更新会强化被错误选择或错误奖励的输出,下一轮模型又在更偏的分布上产生新的代理信号。不同家族错误链起点不同:第一类从统计错配开始,第二类从错误多数开始,第三类从目标集污染开始,第四类从评判器漂移开始。

区分信号与结构

论文强调要把信号质量和任务结构分开。boxed answer、有限选项和代码签名可以帮助判断答案等价,但它们并不提供正确答案;单元测试和可执行验证器则提供正确性判定,越过严格无监督边界。未来评测应报告这些结构先验,并测试方法在不同规范化器和开放式改写下是否仍有效。

评测协议

未来跨家族基准需要固定骨干模型、起始检查点、目标划分、采样预算、更新预算、任务结构和 held-out 评测,以区分信号家族、初始化和适配时机的作用。特别是内部反馈训练会强烈依赖起始模型和更新时长,如果协议不统一,很难判断方法本身是否有效。

10 Conclusion:结论

核心结论

这篇综述围绕一个问题组织 80 个严格方法:哪个模型派生对象提供了更新信号?答案形成四类方法:预测统计、样本关系、自生成目标和内部评估器。再加上输入可见性与更新持久性,论文给出了无监督后训练从方法选择到部署评估的完整坐标系。 最重要的权衡是:越语义化的内部信号越能处理开放式输出,但也会产生更长反馈路径,让代理错误被递归放大。无监督后训练的关键不是简单“不给标签也能变强”,而是把更新对象、任务结构和部署时机对齐,并在代理信号进入更新的位置设置防护。

局限性

论文的清单冻结在 2026 年 5 月,之后的新工作没有纳入。代表性结果保留各原论文的骨干、预算、指标和适配协议,因此适合机制级综合,不适合直接做合并效应估计。混合方法按梯度主要消费的更新对象归类。最后,严格边界限制的是更新规则,而不是部署栈;即使训练中没有外部 oracle,实际部署仍需要独立评测、监控和红队测试,防止奖励黑客和静默退化长期积累。

成为VIP会员查看完整内容
14

设计自主无人机蜂群受到广阔设计空间的阻碍,该空间涵盖平台、算法和数量规模的选择。我们在三种典型场景下执行了大规模基于智能体的仿真:蜂群对蜂群战斗、带损耗的协同区域搜索,以及分散目标的追击。展示了如何利用量纲分析和数据缩放将性能数据压缩到缩放函数上,这些函数在数学上简单,却反直觉,因此难以先验预测。这些缩放定律揭示了成功-失败边界,包括急剧的断点,展示了这些断点可被构建为“有效蜂群规模”。此外,展示了该技术如何用于量化智能体数量与平台参数(如速度、感知或武器射程以及损耗率)之间的权衡。此外,展示了在此框架内嵌入最优路径规划循环的好处,这能从定性上改善支配结果的缩放定律。展示的方法具有高度灵活性,能够支持针对大型自主蜂群的快速、预算感知的规模确定与算法选择。

无人机蜂群是为实现目标而协同运作的自主载具群组[15]。计算机处理、无人机间通信以及储能密度方面的技术改进[14],使更大规模的蜂群变得更加可行。然而,设计和部署大型蜂群需要解答诸多设计问题,例如哪些无人机最为合适、使用的最佳协同算法,以及所需的最小无人机数量。财务考量也可能发挥一定作用。

因此,无人机蜂群设计自然涉及关于扩展与权衡行为的问题,以确定最优算法或平台规格——如速度、武器射程或通信距离——或应对与不同平台规格相关的财务或技术限制。例如,固定预算可能允许建造许多缓慢、廉价的无人机,或者少量快速、昂贵的无人机。可能发现算法A在由慢速无人机组成的大型蜂群中表现最佳,而算法B在由快速无人机组成的小型蜂群中效果最好,且使用算法B的小型快速无人机蜂群总体表现更优。因此,设计和部署最优无人机蜂群需要描绘出某些性能指标如何依赖于潜在的大量参数以及离散的算法选择。

此外,性能指标对任何单个参数的依赖性可能十分复杂且不易猜测[13, 21, 9]。例如,性能可能包含一个“缩放断点”,即蜂群中无人机数量的变化导致性能饱和甚至下降[13]。例如,在觅食问题中,拥挤可能抑制性能[20]。另一个例子是最小资源分配,例如在对抗交战中成功所需的最小无人机数量[8]。正如我们所展示的,预测这些缩放断点出现的位置,通常无法借助直觉或简单计算实现。这些缩放断点可能会随其他参数值(如无人机速度或感知距离)而变化。

本文展示了如何利用量纲分析和数据缩放——这些技术在物理学、流体力学及其他复杂系统科学中已十分成熟[6, 2, 12, 34]——来获得将蜂群性能与所有底层参数值关联起来的函数。这些函数在数学上通常很简单,但它们涉及涌现的函数形式(如具有非平凡指数的幂律函数),因此难以或无法猜测。我们还展示了该方法如何自然地回答上述关于扩展与权衡行为的问题,包括缩放断点的位置以及它们如何依赖于其他参数值。这种从局部交互规则到宏观行为的缩放在活性物质与集体运动中十分常见[31, 22, 26, 3]。尽管这些领域的经典模型主要表征自发有序,但在此我们将类似方法应用于对抗性蜂群交战。

尽管展示的技术可用于真实世界数据,但我们使用计算机仿真来生成大型数据集,这些数据集涉及不同算法以及输入参数的广泛变化。我们研究了三种不同场景:其一,红蓝蜂群均试图利用简单蜂群规则相互消灭;其二,智能体蜂群在存在损耗(通过随机故障或某种主动威胁)的情况下搜索区域;其三,蜂群必须访问一定数量的分散目标。我们强调,源自这些仿真的缩放定律是模型本身的数学属性;通过硬件实验验证底层动力学是一个重要但独立的研究问题。

最后请注意,本文部分作者先前的研究曾从优化问题的视角探讨蜂群交战[29, 32, 24, 33, 30]。这些研究假设了动力学和武器的特定模型,并表明可以利用最优控制的直接方法来构建最优轨迹。这通过构建一个性能指标(例如己方无人机的生存概率或达成目标所需的总时间),然后使用标准方法来寻找使该性能指标最大化的最优轨迹。在这些研究中,无人机并未对不断演变的场景做出实时响应,而是按照优化算法确定的预先规划轨迹飞行。我们将优化应用于三个案例研究之一,表明(1)缩放分析仍可应用于分析最优路径的性能,且(2)优化能从总体上改善蜂群的性能。

成为VIP会员查看完整内容
16

美国陆军野战手册3-52《空域》为指挥官、参谋人员及空域分队人员提供了实施空域管制与空域管理所必需的战术。本手册以陆军空地系统(AAGS)、战区空地系统(TAGS)的陆军组成部分以及作战流程为背景,按梯队阐述了陆军及其他军种组成部分的空地系统的角色与职责。

野战手册3-52更新了2016年10月20日版本的野战手册3-52,以反映联合出版物3-52、野战手册3-0、陆军技术出版物3-52.1和陆军技术出版物3-52.2的更新发布。本手册体现了美国空军(USAF)人员与现役陆军师司令部的整合,以实现分散式执行,从而在师属空域内提高联合火力及其他活动的响应能力与灵活性。本出版物的核心思想反映了陆军在联合指挥与控制流程中的作用,即在多域作战期间整合空域需求。

陆军部队作为统一行动这一更大规模国家工作的组成部分而行动。陆军指挥官明白,他们并非独立行动,而是作为更大规模的联合部队或多国部队的一部分,在所有域参与联合作战。他们在此更大框架内整合与同步自身行动与作战,并与超出其直接控制范围的实体展开协作。正如指挥官在整个作战区域内管理地形一样,他们持续与统一行动伙伴协作,以整合空域中的空域用户。(有关统一行动的更多信息,请参见JP 3-0。)

陆军空地系统(AAGS)用于协调与整合陆军空域需求。作为战区空地系统(TAGS)的组成部分,陆军空地系统(AAGS)为陆军与战区空地系统(TAGS)内其他实体之间提供接口。陆军部队运用五项陆军空域原则来整合所有空域用户,这些原则是对空域管制基本原则的补充。所有航空器(包括有人驾驶与无人驾驶)、火力及电子战效应均为空域用户。

空域规划侧重于在任务执行期间为空域管制与空域管理创造条件,从而在降低风险的同时为指挥官提供灵活性。空域分队在规划过程中提供空域领域的专业知识。陆军主要依赖程序管制,这需要预先规划的协调措施,以支持必须整合到联合空中任务分配周期中的空域用户。一体化的联合空中任务分配周期为与联合部队的受影响的组成部分共同执行集中式空域规划提供了场所,以生成战区空域管制命令(ACO)。在当前作战期间,空域管制与管理涉及处理必要数据或信息的及时性,以便在不出现重大延误或影响任务完成的情况下做出明智决策。

与规划中一样,空域分队人员在部队从规划向执行过渡时所执行的准备活动中发挥着不可或缺的作用。这在涉及提升态势理解以及就计划达成共享共识方面尤为相关。

空域分队在整个作战流程中协助指挥官识别与协调空域需求。然而,所有作战职能的参与者在规划中均发挥作用,以正确识别特定空域用户的需求,并在执行期间管制空域用户的活动。空域分队持续评估空域程序,以改进关键空域规划文件,从而更好地支持军事行动。

在执行期间,空域管制与空域管理要求空域分队与用户持续监视与评估所有空域用户的行动,这些行动既支持地面作战,也涉及在地面指挥官作战区域上空空域内行动的空域用户。这种持续评估为指挥所(CP)提供了态势理解,并使部队能够适应需要立即使用空域的情况。

本出版物中的四章及其相关的九个附录构成了陆军在联合部队指挥官战区空地系统(TAGS)内使用空域的条令框架。该框架充分利用了详细空域规划的所有特性。它还侧重于在执行期间对所有空域用户进行动态整合。该框架确保用户遵循联合部队指挥官及兵种合成指挥官(从营到战区陆军梯队)的意图、优先事项及风险指导。该框架描述了陆军能力如何代表联合部队指挥官为师级空域管制机构(ACA)扩展空域管制选项,以及所有陆军梯队如何参与空域管理活动。

野战手册3-52包含四章及九个辅助附录:第1章讨论联合作战环境中的空域、战区空地系统(TAGS)框架以及管制方法。它定义了空域管制与空域管理,以及通过任务指挥和作战流程对空域的使用。第2章描述陆军对空域管制与空域管理的方法。该章论述空域管制的行使、实现有效空域管制的规划原则,并按梯队划定了陆军空地系统(AAGS)的关键角色与职责。第3章讨论作战流程规划与准备期间的空域需求,包括规划与准备活动所需的相关文件。第4章概述执行期间所执行的空域活动。附录A讨论与空域作战相关的风险管理,并包含一种风险评估方法。附录B概述协调措施的制定与使用,以及空域协调措施的类型与用途。附录C讨论空域管制系统(ACS)的连接性以及用于通信系统的设备。附录D讨论空域报文、请求及信息显示,包括空域协调措施的系统特性。附录E总体讨论陆军集体任务,然后识别具体的空域分队集体任务。附录F为作战计划的C附件(作战)的附录10(空域)提供大纲。附录G补充了对陆军如何实施对民事当局的国防支援(DSCA)的全面描述,并提供对民事当局的国防支援概述。然后它讨论对民事当局的国防支援期间的空域协调及联合空域管制机构。最后,它论述无人驾驶飞机系统的使用考虑。附录H描述指挥官与参谋在分队空域计划(UAP)中的角色,以整合每日空域需求的收集,从而支持军事行动。附录I讨论无人驾驶飞机及在美国境外国家空域内及跨越竞争连续体的空域中的作战使用考虑。一些空域术语已发生变化。野战手册3-52的读者应注意,防空空域管理不再使用,因为野战手册3-01中已不再使用该术语。野战手册3-01引入了一个新术语,即防空支援分队,该术语在野战手册3-52中使用。同样,野战手册3-04不再使用旅空域分队;现使用空地一体化分队,野战手册3-52亦采用此用法。此外,野战手册3-52引入了两个定义术语,并修改了一个术语。这些术语列于引言表中。

成为VIP会员查看完整内容
15

无人机系统(UAS)蜂群构成了一种低成本、高机动性的威胁,传统防空系统极不适合应对。与廉价商用无人机相比,制导动能拦截器成本高昂,可能无法可靠交战小型低可观测目标,且在远征环境中不属于机动部队的组成部分。高能激光(HEL)辅以炮塔式动能武器,为地面机动编队提供了一种经济高效、高容量的替代方案。本论文利用海军研究生学院建模虚拟环境与仿真研究所开发的“蜂群指挥官战术”模型,探索针对无人机系统蜂群的高能激光运用权衡空间。数千次模拟交战评估了部队结构、功率、充电速率、射程、传感以及能量弹药库限制如何影响地基防空(GBAD)性能。能量充电速率成为决定防御结果的主导因素。当充电阈值高于每秒0.94单位时,双高能激光的歼灭概率达到0.98,而单高能激光为0.62。低于该阈值时,高能激光与炮塔式动能武器的组合优于两种仅高能激光配置。最具挑战性的场景是宽间距线式队形,其最大化了方位角覆盖需求,并减少了每个目标的有效驻留时间。这些发现为分层地基防空架构确立了上限,并为高能激光运用指南提供了基础。

成为VIP会员查看完整内容
13

随着战斗机日益复杂,并引入自主性等技术,必须预见飞行员使用这些新系统完成任务所需的关键任务和信息。战斗机飞行员在要求极高的情境中操作,失败的后果很严重,要求其系统为任务提供正确的信息。传统上,这些设计通过现有系统的关键任务分析来指导。本研究产生了一种使用基于模型的系统工程对关键任务分析和信息需求进行建模的方法。场景为一架战斗机在视距内一对一交战中进行基础战斗机机动。该分析利用现有任务分析报告中的数据完成。使用层级和关键任务分析方法,以识别和建模任务不同阶段中飞行员任务的序列。本研究提出一种系统建模语言扩展和方法,用于对飞行员任务序列进行建模,并量化每项任务的关键性。为辅助用户界面设计人员,完成每项任务所需的信息也包含在模型中,并附有识别信息优先级的方法。创建了多种工具来展示这些信息,以增强利益相关者的理解。未来研究可基于这些方法的仿真,对飞行员工作量、动态信息需求和其他设计相关信息等若干变量进行基于时间的分析。

成为VIP会员查看完整内容
13

摘要:本篇特别评论认为,军事人工智能集成必须从模型可靠性转向人机团队内的“认知适配”,以确保在不确定性下的决策优势。它通过关注动态作战适应与系统韧性,超越了传统的人工智能指标。本研究采用生态认知框架,将约翰·博伊德的进化理论与现代认知科学及风险管理原则相融合。本分析为政策制定者与军事从业者设计保留人类判断并降低风险的指挥结构提供了关键蓝图。

关键词:人工智能(AI),认知适配,决策优势,分布式认知,人机集成,任务式指挥

军队将人工智能(AI)集成到其规划过程中的工作,例如美军下一代指挥与控制(NGC2),通常——且合理地——旨在获得相对于敌人的决策优势。此类系统通过创建先前各自孤立的系统的生态系统,并利用人工智能快速分析数据,从而提供持续、集成的作战图景,原则上,这应能使参谋流程更高效,进而实现更好的决策制定[1]。随着此类系统的演进,它们可能越来越有能力支持决策制定,通过更好的态势感知并利用该态势感知来制定——或至少提出——决策本身[2]。

当前许多军事人工智能方法都聚焦于人工智能系统是否足够可靠以值得信任。当人工智能对物体进行分类、描述当前状况或总结信息时,这种关注相当有效。当人工智能生成计划、预测敌人行为或在不确定性下推荐行动时,其效果则较差。在这些情况下,关键问题不在于人工智能模型本身是否可靠,而在于更大的人机系统能否有效理解并适应不断变化的环境[3]。这种适应是人际系统如何分配认知以及该分配如何与作战环境相适配以实现通过反馈进行表征、推理和适应的函数。因此,理解和管理认知适配对于实现决策优势至关重要。

在此背景下,决策优势不仅仅是比敌人决策更快的函数,也是决策更优的函数。然而,更快与更优通常是相互竞争的因素,需要平衡机器速度与人类控制[4]。更快易于衡量;然而,更优则不然。目前,信任(此过程中至关重要的因素)在很大程度上是根据计算可靠性来理解的——即系统是否经过验证,并证明能在预期使用条件下产生准确、稳健且可重复的结果[5]。这一信任标准对于设计用于识别敌方车辆等用途的分类器模型而言是可行的。虽然操作员在当下可能无法确定机器的识别是否准确,但他们原则上至少可以验证它,如果发现错误,可以重新训练模型以使其更可靠。

对于从事情报分析和军事行动规划的生成式人工智能和大型语言模型系统,挑战则有所不同。例如,在描述诸如瞄准、维护或后勤等领域当前状况的决策支持系统中,信任可以基于数据来源、质量、整理、模型验证、确认、稳健性、校准、跨情境表现以及专家监督等因素[6]。然而,当人工智能输出面向未来时——当系统生成计划、预测或关于敌人意图的评估,其真实性无法预先知晓,甚至事后仍可能存在争议时——这些指标最无帮助。例如,一个失败的计划在特定情况下仍可能是最佳可用方案,而一个成功的计划可能基于虚假关联或不透明的推理。在此,挑战是认知层面的:指挥官如何知道按照面向未来的人工智能模型输出行动是否审慎?

采用这种可靠主义方法的问题有二。首先,正如约翰·泽里利(John Zerilli)等人所指出的,随着人工智能的改进,控制问题可能会恶化。当人类使用人工智能工具时,人类在能力、注意力、时效性和态度方面的局限性会带来风险。因为人工智能系统过快且过于复杂,人类操作员可能无法有效控制它们[7]。此外,如果人工智能赋能的行动将人类互动简化为监控显示器,注意力可能会减弱,增加错误风险。对人工智能的依赖还可能侵蚀人类技能,尤其是认知技能,这些技能可能随时间衰退,并在需要时难以恢复。最后,大量自动化偏差的例子表明,人类经常信任来自通常可靠模型的人工智能输出,即使已知这些模型偶尔会失败[9]。因此,泽里利等人认为,人工智能在最可靠时往往最危险。反直觉的是,更容易发生故障的系统通常更安全,因为它们能促使人类投入更多注意力和监督[10]。这一点暗示了一个悖论:人工智能(AI)集成通过卸载人类认知负担来创造价值,但在此过程中,它也使人类认知能力下降,可能降低系统的整体效能。

最后一点表明,有效的人工智能集成需要从系统视角理解认知,该系统包括人类、人工智能模型以及其他提供“认知脚手架”的工具,即实现认知卸载和负担共享的外部结构。第二个担忧是,可靠主义方法忽视了更大的分布式认知系统,原始数据通过该系

统转化为信息,信息转化为知识,知识转化为理解。在分布式系统(如作战单位)中,认知并非位于个体头脑中,而是分布在人员、工具以及系统运行的环境中[12]。

认知是系统属性而不仅是个体知识之和,这一事实至关重要。人工智能赋能的任务式指挥系统(如NGC2)不仅加速现有的军事决策过程;它们从根本上重新分配了人机网络中的认知。在人工智能赋能的系统中,机器承担了与排序数据、检测异常、关联信号和生成候选解释相关的更大份额的认知劳动。结果,人类在构建环境图景中的作用减弱,转而专注于解释其意义、评估风险和决定如何行动。这种跨越人员、工具、数据和过程的认知负荷转移意味着,设计挑战不仅在于优化模型性能,更在于优化整个人机系统对作战环境的适配。

从适配的角度思考将迫使士兵重新思考如何作战。传统的军事决策方法强调行动而非适应,因为它们旨在将信息导向决策并协调其执行。在此背景下,理解主要作为行动的前提条件发挥作用,参谋寻求建立稳定的图景,将其转化为计划或命令,同步资源并执行决策[13]。层级角色、顺序参谋流程和规范性规则使系统在产生行动方面高效,但在持续修正其感知和构建变化环境的方式上效率较低。这一点并不意味着当前系统无法适应,而是适应以行动为中心,并可能根据先前尝试的成功或失败改变实现目标的方式。相比之下,以适应为中心的系统将着眼于改变其理解环境的心理模型,并可能质疑其最初是否拥有正确的目标。

这种传统的适应模式适用于存在正确答案的情况。正如约翰·凯(John Kay)和默文·金(Mervyn King)所观察到的,此类“谜题”有正确答案,通常可以通过更多数据和更强的处理能力来改进。他们将谜题与“谜团”进行对比,后者没有客观正确的解决方案。在这些情况下,不确定性永远无法消除,因此需要其他指标来评估任何拟议响应的质量[14]。因此,在机器输出即使原则上也无法针对特定目标进行验证的情况下,核心设计问题从人工智能能否快速产生准确输出,转向整个人机分布式系统(包括人员、工具、数据和流程)能否产生足够可信的知识和理解,以支持特定作战环境中的决策优势。

约翰·博伊德(John Boyd)在其文章《毁灭与创造》中,将军事系统的设计问题视为固有的认知问题,尽管他并未使用该词。相反,他类比认为,军队非常类似于生物体,即渴望在资源稀缺的环境中生存和发展的目标导向有机体。在此类环境中,生存与发展取决于通过不断拆除旧心理模型并创建新模型来适应的能力,心理模型是个体理解环境的方式。成功的适应取决于新心理模型是否比旧模型更契合环境。评估这种适配要求有机体具备足够的认知能力,以产生和掌握关于环境的知识。至少对人类而言,这种能力源于一种进化过程,其中心智通过将其内部框架与外部经验反复匹配来适应现实[15]。诸如提出该概念的洛伦佐·马尼亚尼(Lorenzo Magnani)等学者,可能将博伊德的认知论描述为“生态认知”,即知识源于内部认知过程与外部环境因素,并受到人类用于与世界互动的工具或技术的影响[16]。

有趣的是,博伊德以破坏性和创造性的术语描述建立新心理模型的过程,其中演绎逻辑分解旧系统,而归纳综合先前的概念与关于世界的新信息则产生新模型[17]。然而,演绎和归纳逻辑往往是保真且规范性的。它们是保真的,因为它们确立事项的真实性;是规范性的,因为它们规定保证真理的推理过程[18]。在可能无真理可保、因而无描述对象的情况下,人们需要找到另一条通往知识与理解的路径。

这一关切与人工智能赋能系统尤为相关。人工智能生成的世界表征是统计估计或推断,取决于用于训练人工智能模型的数据的质量、覆盖范围、多样性和代表性[19]。博伊德关于组织适应的生态解释表明,焦点应从可靠性转向适配。该框架不问系统是否可靠准确,而是问系统是否足够契合作战环境,以帮助指挥官生成有用的理解并有效适应。在此观点下,决策优势源于整个系统比敌人更快适应的能力,而不仅仅是更快决策。因为成功依赖于迭代假设,一个系统是否契合作战环境取决于三大广泛功能——表征、推理与适应。

表征适配评估系统是否能以准确、可理解的方式检测、组织和呈现相关信息,且不施加过度的认知或作战成本。推理适配评估人机系统是否能生成合理、连贯、情境敏感且能指导行动的解释,而非依赖静态或虚假的关联。输出与适应适配评估这些解释是否支持适当、及时的决策,以及反馈是否能使系统修正其表征、重新考虑备选方案,并在重复的决策周期中改进。因此,适配是迭代评估的:指挥官和参谋在每次周期中评估这些维度,检查它们如何随时间变化,并利用结果识别分布式认知系统的理解、推理或行为何时开始偏离作战环境。在此过程中,他们经常必须进行溯因推理——即推理至最佳解释——其中成功的假设是最合理的假设。与演绎和归纳逻辑不同,溯因推理不保真,因此适用于如上所述的、无真理可保的问题。在此背景下,不确定性并非系统故障,而是对适应的需求信号。

现在应该清楚,“利用数据作战”与更传统的战争方式有多么不同。士兵将不再“发现、锁定和终结”,而是将更多时间用于解释、质疑和适应机器生成的输出。机器最终将处理大部分(如果不是全部)关于敌人位置和相对作战能力的谜题,士兵则不再解决这些谜题,而是专注于对敌人意图和己方行动方案生成假设,同时进一步评估不断变化的作战环境如何影响这些假设的质量。为优化该过程,指挥官和参谋必须管理人机网络中认知的分布方式,决定委派哪些功能、保留哪些判断,以及如何维持反馈循环,使机器输出与任务意图和多变的战场条件保持一致。在此背景下,信任表现为对感官的信任的涌现——通过与环境的持续互动实现足够成功的、目标导向的行为——而非对模型可靠性的被动信心。捕食者不必抓住所有追逐的猎物,只需抓住足够生存的数量。

尽管存在这一变化,生态认知方法在许多方面更为直观,因为它评估人工智能赋能系统的方式与士兵评估作战组织的方式非常相似——不仅通过评估特定组件的功能,还通过评估作战、作战支援和作战勤务支援系统的整体安排是否在其设计环境中发挥作用。指挥官已经知道,有效表现取决于人员、条令和作战职能的互动。此方法将这种理解扩展到人工智能赋能系统。它不将人工智能模型视为参谋军官(关注其判断是否准确),而是问更大的人机系统是否能感知相关条件、使环境可理解,并生成关于环境的假设,以支持与任务意图一致的及时行动。

此方法也更直观,因为它符合士兵在战场不确定性下的推理方式。当前的人工智能方法暗示,信任应取决于数据卫生、验证分数、过往可靠性或与人类经验的一致性等因素。这些标准对于分类敌方车辆等谜题相当有效,但对于预测敌人意图或未来行动方案等谜团则无效。适配的度量并不消除不确定性,而是通过让指挥官知道特定系统对于特定任务、在特定环境、特定时间是否足够好来管理不确定性。在某种程度上,此模型将不确定性视为资产——当被正确感知时,它激发更有效的适应。

最后,此方法将适应视为常态,而非失败的证据。“计划经不起与敌人接触”这一常用来解释缺陷的表述,反映了士兵已知的事实。即使计划基于完美信息和原则的无瑕应用,与敌人的首次接触也会改变环境,从而改变计划所基于的信息。此方法更好地解释了系统中人类一侧已经在发生的事情——持续的感知、判断、行动、评估和重构——而不是将使用人工智能赋能系统所需的技术知识构建为替代人类参谋的技术复杂方案。

人工智能赋能任务式指挥的成功,与其说取决于计算速度,不如说取决于系统设计能否保留人类判断、使不确定性可见、维持反馈循环,并保持人类用户与机器输出之间的认知共鸣。简而言之,战争的未来在于构建能够利用数据进行学习、适应和有效作战的人机认知生态,而非用机器取代指挥官。

成为VIP会员查看完整内容
15

博士论文 | AI for Science:从科学神经建模到语言模型智能体

导读

这篇 CMU 机器学习系博士论文《AI Methods for Science: Neural Modeling and Language Model Agents》来自 Shanda Li,完成于 2026 年 7 月。论文的核心问题非常清晰:AI for Science 不只是把一个深度模型套到科学数据上,也不只是让大模型写几段代码;真正有价值的科学智能系统,需要同时理解科学对象的结构、数值计算的约束、实验预算的限制,以及科研流程本身的反馈机制。 作者将整篇论文组织为两条互补路线。第一条路线是“科学神经建模”:围绕长上下文 Transformer、相对位置编码、傅里叶神经算子、分子生成流等问题,设计更适合科学数据和科学规律的神经模型。第二条路线是“语言模型智能体”:围绕推理计算分配、偏微分方程求解器生成、扩展律实验设计、科研代码仓库复现审计等任务,研究大语言模型如何进入真实科研工作流。 这篇论文的价值不在于提出单一模型,而在于给出了一条较完整的 AI for Science 技术路径:底层模型需要能表示函数、序列、物理场和分子结构;上层智能体需要能做推理、写程序、调用反馈、规划实验并审计结果。换句话说,AI for Science 的下一阶段,很可能不是“一个更大的模型解决一切”,而是由科学建模模块、推理模块、代码执行模块和实验反馈模块组成的复合系统。

1 Introduction | 引言

论文开篇指出,现代科学研究正在面对一种双重压力:一方面,科学数据的规模和复杂度不断提高,从长序列、生物分子、物理场到科研代码仓库,都包含高维、非欧式、跨模态和强约束结构;另一方面,科研流程本身也越来越依赖计算,包括模拟、推理、实验设计、代码复现和结果审计。 传统机器学习方法通常将科学任务视为普通预测问题:给定输入,输出标签或数值。但在许多科学场景中,真正困难的部分并不是拟合一个函数,而是如何尊重科学对象的结构。例如,长上下文建模需要跨越远距离依赖;偏微分方程求解需要考虑数值稳定性和边界条件;分子设计需要同时满足结构、属性和生成可行性;科研复现则需要理解代码、环境、数据依赖与报错反馈之间的关系。 作者因此把 AI for Science 拆成两个层级。第一个层级是神经建模方法,关注如何让模型更好地编码科学数据中的结构。第二个层级是语言模型智能体,关注如何让模型参与科学工作流,完成推理、编程、实验选择和复现审计等更开放的任务。这两个层级并不是割裂的:前者解决“表示什么、如何表示”,后者解决“如何在动态环境中使用这些表示完成科学问题”。

论文主线

论文的主线可以概括为三个关键词:结构、计算和反馈。 “结构”指科学问题中的先验形式,例如相对位置、频域表示、算子映射、分子流形和代码仓库依赖关系。好的 AI for Science 模型不能只依赖数据量,还需要把这些结构纳入模型设计。 “计算”指训练和推理预算。论文多次强调,科学智能系统往往受到显著的算力、实验成本和数据采样成本约束,因此需要研究长度外推、超参数迁移、推理计算分配和主动实验选择。 “反馈”则是第二部分的关键。语言模型智能体不能停留在一次性生成文本,而要接收数值误差、执行结果、实验观测和 GitHub issue 等外部反馈,在循环中改进解决方案。

Part I Neural Modeling Methods | 第一部分:科学神经建模方法

第一部分聚焦神经网络本身的建模能力。作者选择了四类具有代表性的科学与序列建模问题:长上下文语言模型、线性相对位置编码、傅里叶神经算子和多模态分子生成。这些问题看似分散,但共同指向一个核心目标:让模型在有限训练条件下获得更强的结构泛化能力。 在科学应用中,模型常常需要面对训练分布之外的输入长度、分辨率、物理参数或目标条件。如果模型只能在训练设置附近工作,科学价值会明显受限。因此,这一部分特别强调外推、迁移和免训练适配。

2 Functional Interpolation for Relative Positions Improves Long Context Transformers | 长上下文位置编码

长上下文建模是大模型和科学序列建模中的共同瓶颈。Transformer 的注意力机制虽然可以显式连接任意位置,但位置编码往往决定了模型能否在训练长度之外稳定外推。很多常见相对位置方法在训练窗口内表现良好,一旦上下文变长,就会出现位置分布偏移、注意力退化或困惑度上升。 本章提出 FIRE,即 Functional Interpolation for Relative Positions。其关键思想是把相对位置偏置从离散表格或固定函数,转化为可插值的连续函数表示。这样,模型在训练时学习到的相对位置结构,可以通过函数插值方式推广到更长上下文,而不是简单依赖未见过的位置索引。

方法要点

FIRE 的设计关注两个层面。第一,它让相对位置偏置具备连续可推广性,使模型在更长上下文中仍能获得有意义的位置关系。第二,它避免为每个距离单独学习不可外推的参数,从而提升长度泛化和参数效率。 这种方法对于科学文本、代码、时间序列和长文档建模都有直接意义。很多科学任务的有效证据并不集中在局部窗口内,而是分散在长篇论文、实验记录、日志、轨迹或历史观测中。位置编码如果不能外推,长上下文模型就会在工程上“看得见”,但在表示上“用不好”。

3 Learning a Fourier Transform for Linear Relative Positional Encodings in Transformers | 线性相对位置编码

第三章继续研究位置编码,但重点从长上下文外推转向相对位置编码的频域解释。许多线性相对位置编码在实践中有效,却缺少统一理解:它们为什么能表示相对距离?它们如何影响注意力谱结构?是否可以学习一种更适合任务的变换,而不是固定使用人工设计的形式? 作者提出 FLT,即 Learning a Fourier Transform for Linear Relative Positional Encodings。该方法把相对位置编码与傅里叶变换联系起来,尝试学习一种任务适配的频域映射,使 Transformer 能更灵活地表示相对位置信息。

核心贡献

本章的重要贡献在于把位置编码问题从“选哪种偏置形式”提升到“学习哪种函数空间表示”。傅里叶视角天然适合处理周期性、平滑性和多尺度结构,这些结构在科学数据中非常常见,例如波动、振荡、时间序列、空间场和频域信号。 从系统角度看,FLT 与 FIRE 构成互补:FIRE 强调在长度维度上的函数插值和外推;FLT 强调用可学习频域变换增强线性相对位置编码的表达能力。二者都服务于同一个目标,即让 Transformer 不只是记住训练位置,而是学习可迁移的位置关系。

4 Maximal Update Parametrization and Zero-Shot Hyperparameter Transfer for Fourier Neural Operators | 神经算子的超参迁移

傅里叶神经算子是科学机器学习中的重要模型,常用于学习函数到函数的映射,例如从初始条件到未来物理场,从边界条件到解函数。与普通神经网络不同,神经算子面对的是连续函数空间,因此它们对分辨率、网格大小、频域截断和训练超参数非常敏感。 本章关注一个非常实际的问题:在不同模型规模、不同分辨率或不同任务设置之间,能否实现超参数的零样本迁移?如果每次训练傅里叶神经算子都需要重新搜索学习率、初始化尺度和优化设置,那么科学建模的成本会显著提高。 作者将最大更新参数化思想引入傅里叶神经算子,提出 µTransfer-FNO。其目标是让小规模模型上调好的超参数,可以直接迁移到更大规模或更高分辨率的模型上,而不需要重新进行昂贵搜索。

实验意义

从图示结果可以看到,标准参数化下不同学习率的训练稳定性差异明显,而 µTransfer-FNO 试图让训练动态在尺度变化时保持一致。这对科学计算尤其重要,因为真实模拟任务往往需要在低分辨率上快速试验,再迁移到高分辨率或更复杂条件下运行。 这章的贡献不只是一个训练技巧,更体现出 AI for Science 中“计算预算敏感”的核心逻辑:如果模型方法不能降低调参和重训成本,就很难进入实际科学工作流。

5 TFG-Flow: Training-free Guidance in Multimodal Generative Flow | 多模态生成流的免训练引导

第五章转向分子设计。分子生成是 AI for Science 中最具代表性的应用之一,因为它同时涉及离散结构、连续几何、多目标属性和可合成性约束。很多生成模型可以产生分子样本,但当研究者希望按照特定属性或多模态条件引导生成时,通常需要额外训练、微调或设计复杂奖励函数。 TFG-Flow 的目标是实现免训练引导:在不重新训练生成模型的情况下,通过引导机制把模型推向更符合目标条件的区域。这样可以降低分子设计中的适配成本,并使已有生成流模型更容易被用于不同属性目标。

方法机制

该方法可以理解为在生成流过程中加入外部目标信息,使采样轨迹朝着期望属性移动。与重新训练模型相比,免训练引导更适合快速探索,因为科研人员可以在不同目标之间切换,而不必为每个目标重新构建训练管线。 对于药物发现和材料设计,这种思想尤其有价值。真实应用通常不是追求单一指标,而是同时考虑活性、稳定性、毒性、结构多样性和合成约束。多模态生成流如果能在保持生成质量的同时接受灵活引导,就更接近实用的科学设计工具。

Part II Language Model Agents for Scientific Workflows | 第二部分:科学工作流中的语言模型智能体

第二部分从“模型如何表示科学对象”转向“模型如何参与科学流程”。这也是整篇论文最具时代感的部分:大语言模型已经不只是文本生成器,而是可以读题、写代码、运行程序、解释错误、选择实验、审计仓库的工作流组件。 作者没有把语言模型智能体描述成全自动科学家,而是更谨慎地研究其可测量能力边界:推理时多花多少计算是值得的?模型生成的 PDE 求解器如何用数值误差反馈改进?有限实验预算下如何拟合扩展律?真实 GitHub issue 能否成为可复现性审计的监督信号?这些问题都比“让模型做科研”更具体,也更接近落地。

6 Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for LLM Problem-Solving | 推理扩展律

第六章研究推理阶段的扩展律。传统扩展律多关注训练阶段:模型更大、数据更多、训练计算更多时,性能如何变化。但对语言模型智能体来说,推理阶段同样消耗大量计算。一次任务可以采样多个答案、执行多轮自洽、进行搜索或调用验证器,因此“推理时该花多少计算”成为关键问题。 作者通过经验分析研究计算最优推理策略,考察不同推理预算下问题求解性能的变化。其核心问题是:在给定模型和任务下,继续增加推理样本或推理步骤是否仍然值得?什么时候应当换更强模型,什么时候应当让现有模型多思考?

科学工作流价值

科学任务通常具有高成本验证过程,例如数值模拟、定理检查、实验设计和代码运行。推理扩展律可以帮助系统决定如何分配计算:是生成更多候选方案,还是把预算用于更强的模型、更长的上下文或更精细的执行反馈。 这章为后续章节提供了方法论基础。CodePDE、SL² 和 ReproRepo 都不是单次问答任务,而是需要多步推理、执行和评估的工作流。理解推理计算的边际收益,是构建可靠语言模型智能体的前提。

7 CodePDE: An Inference Framework for LLM-Driven PDE Solver Generation | 偏微分方程求解器生成

第七章提出 CodePDE,用于让语言模型生成偏微分方程求解器。PDE 求解是科学计算的核心任务之一,但它对数学形式、离散化方案、边界条件、稳定性和误差控制都有严格要求。让语言模型直接给出答案并不可靠,更合理的方式是让模型生成可执行求解器,再通过数值反馈不断修正。 CodePDE 将问题形式化为一个推理框架:语言模型读取 PDE 问题描述,生成求解代码,执行后获得误差或失败信息,再基于反馈修改方案。这里的关键不只是代码生成,而是把执行环境和误差信号纳入推理闭环。

反馈闭环

这一章体现了语言模型智能体与普通文本模型的区别。普通模型的输出一旦生成就结束,而智能体可以通过外部工具检验自己的输出。对 PDE 来说,这种检验非常必要,因为看似合理的解析说明或代码片段,可能在网格、边界或时间步长上完全错误。 CodePDE 的意义在于把科学计算问题转化为“可执行、可评估、可迭代”的任务。它也说明,未来科学智能系统的可靠性很大程度上来自外部反馈机制,而不是单纯依赖语言模型的内部知识。

8 Spend Less, Fit Better: Budget-Efficient Scaling Law Fitting via Active Experiment Selection | 预算高效扩展律拟合

第八章研究扩展律拟合中的实验预算问题。扩展律对机器学习系统设计非常重要,可以帮助研究者预测更大模型、更长训练或更多数据下的性能。但拟合扩展律本身需要大量实验点,而每个实验点都可能意味着训练一个模型或运行一组昂贵实验。 作者提出 SL²,通过主动实验选择在有限预算下更高效地拟合扩展律。核心思想是,系统不应平均地、被动地采样实验配置,而应根据已有观测选择最有信息量的下一组实验,从而用更少成本获得更可靠的趋势估计。

主动选择

这章把 AI for Science 中常见的“实验设计”思想带入模型扩展研究。很多研究者关心最终的大规模结果,但真正可用的预算往往只允许做少量小规模实验。主动选择机制可以决定哪些模型规模、数据规模或训练预算最值得尝试。 与第六章的推理扩展律相比,第八章关注训练或实验层面的扩展律拟合;二者共同构成一套预算意识:推理计算要优化,训练实验也要优化。科学智能系统如果能主动规划实验,就能从被动执行工具变成更接近研究助理的系统。

9 ReproRepo: Scaling Reproducibility Audits with GitHub Repository Issues | 可复现性审计

第九章讨论科研复现,这是整篇论文中最贴近现实科研痛点的部分。大量机器学习论文公开了代码仓库,但复现仍然困难:依赖版本不一致、数据下载失效、训练脚本缺少说明、硬件假设不清、报错信息无人处理。传统复现审计依赖人工阅读和运行,规模很难扩大。 ReproRepo 试图利用 GitHub repository issues 扩展可复现性审计。其基本判断是:真实用户在仓库中提交的问题,往往包含了复现失败、环境配置、缺失文件、结果不一致等信号。语言模型可以读取这些 issue,并推断仓库的复现风险和问题类型。

审计框架

该框架把开放源代码生态中的自然反馈转化为可分析数据。相比仅阅读 README 或论文,issue 反映的是代码在真实用户环境中的运行状况,因此更接近可复现性的实际难点。 这一路线也提示我们,科学智能体不一定要从零做实验。它可以先利用已有社区反馈,帮助研究者发现哪些仓库可复现性较弱、哪些错误最常见、哪些项目需要补充依赖说明或脚本修复。对大规模论文与代码审计而言,这是一种很实用的切入点。

模型表现

论文还比较了不同模型在 ReproRepo 任务上的表现。结果表明,复现审计不是简单分类任务,它需要模型理解科研代码语境、错误描述、用户反馈和仓库维护状态。模型越强,通常越能处理跨文件、跨语境和含糊问题,但仍然需要结构化任务定义和可靠评测。 这一章与前面的 CodePDE 形成呼应:CodePDE 关注模型如何写出可运行科学代码,ReproRepo 关注模型如何审计已有科研代码能否复现。一个面向科学的语言模型智能体,最终应当同时具备生成、执行、调试和审计能力。

10 Conclusion | 结论

论文最后总结了 AI for Science 的两条发展线索。第一,科学神经建模需要更深地吸收科学对象的结构,包括位置、频域、算子、分子空间和物理约束。第二,语言模型智能体需要从文本生成走向科研工作流参与者,通过推理计算、代码执行、实验选择和社区反馈来提升可靠性。 从这篇博士论文可以看到,AI for Science 正在从“模型驱动的预测工具”转向“工作流驱动的科学系统”。前者强调单点性能,后者强调模型、工具、反馈和预算之间的协同。未来真正可用的科学智能系统,很可能由多个层次组成:底层模型负责表达科学结构,中层算法负责优化训练和推理计算,上层智能体负责规划、执行、验证和审计。

关键启示

第一,科学任务中的结构先验仍然重要。即使在大模型时代,位置编码、频域表示、算子参数化和生成流引导等设计,依然决定模型能否跨长度、跨尺度、跨条件泛化。 第二,科学智能系统必须考虑预算。无论是长上下文推理、傅里叶神经算子的超参迁移,还是扩展律拟合中的主动实验选择,本质上都在回答同一个问题:如何用有限计算获得最大科学收益。 第三,反馈闭环是语言模型进入科研的关键。PDE 求解、代码复现和实验规划都表明,可靠性不能只靠一次性生成,而要靠执行、观测、纠错和再规划。 第四,AI for Science 的未来不是单一模型范式的胜利,而是神经建模、语言模型智能体、数值计算和科研软件工程之间的系统整合。这也是这篇论文最值得关注的地方:它把底层模型方法和上层科研流程放在同一幅图景中,呈现出一条从表示学习到科学智能体的连续路径。

成为VIP会员查看完整内容
12

当代无人机战争显示了小型平台的战术价值,但数量本身并不能构成蜂群。基于贝茨和奎克的“无人机尚未形成蜂群——但它们可以”,本文测试了自组织——这一在自然界中观察到并在蜂群机器人技术中形式化的原理,其集体行为源于局部感知、通信和分散规则。它探究异构无人机能否在通信中断、损耗、情报不完善和防空压力下,搜索、确认并打击高优先级目标,同时保持对分析人员的可理解性。在三维仿真环境“蜂群指挥官战术”(SCT)中,五个自组织层实现了通信、编队形成、任务分配、信念维护和协调压制与打击。该战役评估了18种条件,每种条件重复5次。所有90次运行均完成了任务,并生成了事件、消息和快照日志。最强主动干扰条件以6.8%的链路传输率完成,表明在没有全球连通性的情况下任务成功。较大的初始情报误差仍得到纠正,但迫使在防空系统附近采取更多路线安全反应。本工作开发的透明度评分标准对247个决策事件的评分为8分中的6.77分。本文贡献了一个可执行的概念证明,表明自组织军事蜂群行为可以在作战使用前实施、压力测试和重建。

本文的其余部分组织如下。第2章考察自组织的理论基础、蜂群工程原理、协调的架构方法,以及部分可观测性、通信拒止、透明度和验证所面临的挑战。本章最后指出了为系统设计提供依据的六个研究空白。第3章介绍了实现分散式协调的五个自组织层(SO-0至SO-4),以及透明度日志架构和实战化评估指标。第4章描述了“蜂群指挥官战术”仿真平台、用于评估的实战化场景要素、一次一因子实验设计,以及混合方法分析方法论。第5章呈现实验结果,通过分析基线行为、单因素压力响应以及针对每个研究问题的最终混合压力条件,并借助支持的量化指标、透明度评分标准打分和选定决策链的重建。第6章综合研究结果,重述贡献,承认局限性,并关联未来研究的思路。

成为VIP会员查看完整内容
11

本文记述无人机系统(UAS)的历史发展,以及其自1910年代萌芽与初期试验、第二次世界大战期间军事应用、冷战时期侦察能力,直至现代亦即“9·11”事件后时代的演进过程[1]。文中进一步深入探讨现代时期大量运用无人驾驶飞机系统的两场主要冲突。将就上述冲突及投入作战的无人驾驶飞机系统平台提供背景说明。首场讨论为“9·11”袭击后随即展开的“反恐战争”,其间使用了携载武器的无人驾驶飞机系统以及先进成像技术[2];该冲突的特征是对非国家行为体实施精确打击[3]。第二场讨论自2022年爆发的俄罗斯—乌克兰战争;与之不同,该战争为主权国家间的全面作战,截至2026年仍在持续[4][5]。受财力限制,该冲突所用无人驾驶飞机系统多为较小型平台。两场冲突均证明,无人驾驶飞机系统可提升战场态势感知与侦察能力,重塑现代战争形态[5]。此外,无人驾驶飞机系统在战争中的广泛使用,亦引发有关目标选择及国际人道法下责任归属的伦理关切[3]。

本文首先考察无人机系统技术之历史发展,继而分析“反恐战争”与俄罗斯—乌克兰战争两场冲突,以阐明其作战与伦理影响。无人驾驶飞机系统之研发与部署,凭借强化战术侦察与载荷投送方式而深刻变革现代战争,同时也因操作者脱离战场而引发重大伦理关切。

成为VIP会员查看完整内容
13

俄罗斯能够定位无人机发射场。乌克兰正试图确保当俄方定位时,操作员已不在该处。

《泰晤士报》近期的一篇报道描述了一架乌克兰远程打击任务,其中一架飞机的操控由三名飞行员共同完成:一人负责初始起飞,另一人管理大部分航渡阶段,第三人——通常经验最为丰富——在末段引导飞机。这一程序听起来像是对飞行操控问题的非常规解决方案,并引发了许多战术层面的疑问,但更准确地说,它应被理解为一种生存性问题解决方案。在一个发射场、通信节点、操作员、指挥所和电子辐射均可成为打击目标的作战空间中,乌克兰正在将曾经集中于单一飞机和机组人员的职能进行分离。飞行员交接之所以重要,是因为它揭示了一种新兴架构——杀伤链本身被有意地分布化了。

对于大型无人系统而言,将训练有素的飞行员、工程师、发射设备、通信系统和飞机部署于同一物理位置的理由正日益减少。工程师和技术人员可以准备飞机、执行系统检查、验证导航、载荷、控制功能并报告战备状态,而无需负责管理任务大部分阶段的飞行员站在他们身边。飞机准备就绪后,发射团队即可启动任务,而主要操作员仍身处他处,远离与发射点相关的各种特征信号。根据系统不同,操作员可全程参与飞行,仅在选定阶段接管控制权,或监督基本按预编程执行的任务。其他系统则更接近“发射后不管”模式,飞机在发射后按照任务计划飞行,几乎或完全不需要持续的人工控制。“蜘蛛网”行动便是此类指挥与控制的一个范例。它展示了可能性;而新兴模式则代表了下一阶段的演进。

其逻辑十分直白。无人机是可消耗的;经验丰富的飞行员则不是。发射活动会产生视觉、热学、声学、电子和行为特征,而与行动相关的通信又会为探测创造额外的机会。《泰晤士报》报道称,乌克兰纵深打击机组在发射后迅速转移,避免重复使用发射地点,并对俄罗斯侦察保持警惕,因为远程无人机小组在位置暴露后曾遭到打击。如果对手能够定位发射点并引导反击火力,那么人员就不应该留在那里。经验丰富的操作员保持着训练水平、判断力、对对手行为的熟悉程度以及积累的教训。因此,将他们与发射团队分离,既是作战效率的考量,也是一种务实的部队保护措施,更是兵力保存的举措。

现代冲突日益青睐能够比威胁演变更快理解、决策和行动的一方,但乌克兰的纵深打击经验增加了一个重要条件:当对手能够攻击决策架构本身时,速度是不够的。一个有韧性的组织必须在单个节点被干扰、定位、切断、摧毁或被迫移动时保持连续性。飞行员交接证明了这一原则,因为对飞机的责任被有意地按地理和时间分离,而非从发射到命中始终由同一机组承担。其目标不仅仅是缩短杀伤链,而是构建一条在对手开始攻击后仍能持续发挥作用的杀伤链。这一概念并非全新——反恐行动曾花费二十年时间开发破坏分布式对手网络的方法。无人机战争现在正将这一逻辑延伸至一个更快、更自主的作战空间。随着无人系统日益互联且自主性不断增强,这一区别至关重要。

无线电和卫星赋能的连接性可以将控制延伸至发射区域之外,但每种通信架构都会引入涉及距离、地形、干扰、网络可用性和敌对电子活动的依赖性。有价值的问题不是无人机是远程驾驶还是自主的,而是在飞行不同阶段,人与飞机之间的责任如何划分。人在发射阶段可能很重要,在长途巡航段则不太必要,而在接近目标时又变得关键。当人的判断被应用于价值最大的地方,而非传统上认为飞行员应坐的位置时,系统就会变得更强大。这是一个真正的人在环架构,随着人工智能赋能自主性的成熟而日益相关。导航遵循同样的逻辑。关于远程无人机的讨论往往聚焦于最大距离,却忽视了航线本身在作战上的重要性。纵深打击任务通常是围绕一条规划好的飞行路径构建的,而非从发射点到目标的直线行程,该路径可以综合考虑地形、防御力量集结、预期电子战活动、飞机续航能力、情报以及以往任务的经验教训。

英国皇家联合军种研究所(RUSI)关于大规模精确打击的研究强调,有效的无人机运用不仅取决于平台本身,还取决于由电磁勘察、气象信息、防空情报以及对作战空间内其他活动的感知所支撑的飞行规划。航程引人注目;而航线则有助于决定生存。因此,飞行路径并非任务前的行政准备工作,它是武器系统的一部分。此外,全球导航卫星系统干扰说明了这一点,因为电子战常被描述得好似干扰机的存在会立即使整个作战空间中依赖卫星的导航变得不可用。现实中,电子战存在于地理和物理条件之中。其影响具有模式、局限性、覆盖区域和作战后果,这些都可以被研究并纳入任务规划。持续或频繁遇到的干扰可成为威胁图景的一部分,其影响方式与地面防空阵地、地形或其他危险影响航线相同。这并不意味着干扰可以简单地被规避,因为电磁条件是动态且不确定的。这意味着有韧性的任务设计应预期导航性能下降,并提供替代方案,而非将单一信号的丢失视为任务失败。因此,韧性取决于冗余。替代方案可包括预编程航线、惯性导航、机载传感、视觉或地形辅助校正,以及不同程度的自主性。重要的发展并非某一项技术,而是将多种不完美的能力层层叠加,使飞机在某一输入不可靠时仍能继续运行。这也是平台中心思维产生误导之处。飞机依赖于工程团队、发射程序、任务规划工具、通信网络、导航系统、情报分析、指挥权限、操作员、维护流程以及打击后评估。

英国皇家联合军种研究所(RUSI)认为,无人机最好被理解为综合体而非孤立平台,因为其效能取决于支撑组织及其在对手适应时更新软件、传感器、无线电、战术和任务逻辑的能力。西方组织可能犯下的最昂贵错误,是只模仿乌克兰的无人机而不模仿使其具备韧性的架构。这类经过深思熟虑的架构与称之为三维物理安全的框架直接关联。作战环境不再局限于围栏、大堂、装卸区或摄像头视野。无人机增加了一个持续的垂直层,而网络系统、通信网络、数据流和电子特征正日益决定什么可以被探测、理解和行动。乌克兰的纵深打击模式展示了该框架的进攻性镜像:物理位置、数字连接和电磁特征并非独立的安全问题,它们是一个统一的作战环境。发射是物理的,指挥与控制是数字的,导航部分是电磁的,而生存则取决于防止任何一个领域成为决定性的失败点。

然而,技术上的复杂程度本身并不能决定谁拥有优势。乌克兰更广泛的经验表明,韧性还取决于一个组织将作战经验转化为适应能力的速度有多快。战场反馈直接从部队流向开发者和制造商,使硬件、软件、通信和战术能够随着俄罗斯反制措施的演变而改变。2026年哥伦比亚大学一份与国防创新部门相关的分析报告描述了一个生态系统,其中作战反馈可直接传递给制造商,更新后的系统可在数日内返回前线。这一学习周期与平台本身同等重要。一支有韧性的部队能够理解其作战环境、分布能力、吸收失败,并以快于对手识别和拆解系统的速度应用所学。

以色列的“雄狮崛起”行动从相反方向印证了同一教训:地理纵深不再保证安全。美国国际战略研究中心(CSIS)报告称,小型爆炸无人机被预先部署在伊朗境内,并在后续常规远程打击中用于攻击防空雷达和通信节点,这展示了威胁如何从被认为受保护的区域内而非从外部渗透产生。这对关键基础设施的意义不容忽视。威胁可以在附近预置、从假定的安全范围内发射,或几乎毫无预警地出现。因此,纵深防御必须超越围绕设施的同心圆层次;它必须包括在威胁起源于组织假定安全的空间内部时,检测异常、分布态势感知、保持通信和做出决策的能力。乌克兰使用伏击或“待机”无人机的做法在战术层面强化了这一点。乌克兰国防部描述了一种光纤FPV无人机,可部署在可能路线附近,着陆并埋伏数小时,直到高优先级目标出现。尽管任务不同,但两者都说明了安全专业人员为何必须从战略规划而非技术采购入手:在组织理解威胁如何在其作战环境中机动、停留或起源之前,无法确定合适的传感器、通信架构、权限或响应机制。

对于关键基础设施的私营部门所有者和运营者而言,这些案例应从根本上改变其对边界的理解。能源设施、交通枢纽、电信站点、水务系统、物流中心、数据中心、体育场馆和大型工业园区日益面临可从传统边界外发起、利用安全团队无法控制的空域,并压缩探测、核实、通信和响应可用时间的威胁。无人机事件可能始于航空问题,升级为网络或信号问题,触发物理安全响应,并在组织尚未确定其实际观测到的情况之前就需要与执法或联邦当局协调。建立在独立部门和供应商系统之上的安全计划,将难以应对在数秒内跨越这些边界的威胁。三维物理安全原则超越了可见边界,延伸至维持任务的依赖性。因此,组织不仅需要识别关键资产,还需要识别这些资产所依赖的运营技术、通信网络、电源、数据系统、供应链、物理基础设施和外部服务。人的架构同样重要:决策者、指挥链、响应人员、供应商、公共安全合作伙伴和政府机构本身就是运营连续性的一部分。当某个组件支持多项关键功能时,该组件的脆弱性会产生更严重的后果,可能造成远超初始影响点的级联效应。

2026年3月影响亚马逊云科技设施在阿拉伯联合酋长国和巴林无人机打击提供了一个具体例证。亚马逊云科技报告称,阿联酋的两个数据中心遭到直接打击,巴林的一个设施在无人机降落在附近后受损。事件造成了结构性损坏、电力输送中断、触发了消防响应,并降低了云服务的可用性。其意义不仅限于物理结构,因为受影响设施支撑着该地区企业、政府组织和其它客户使用的数字服务。亚马逊云科技从两条路径做出响应:修复受损基础设施,同时寻求多条不依赖底层设施完全恢复的基于软件的恢复路径。该响应展示了实践中的运营韧性。连续性来源于提前了解依赖关系、跨可用区和区域分布能力,以及维持可在主要基础设施不可用时吸收中断并转移功能的替代路径。

因此,私营部门的启示并非关键基础设施应模仿军事打击行动,而是组织应借鉴分布化的架构原则,而不引入战场战术。探测不应依赖单一传感器。决策权限不应归属一位无法到位的主管。通信不应在单一网络故障时崩溃。响应程序不应依赖人员在事件期间首次碰面。运营者需要预先演练的升级阈值、明确定义的法律权限、替代通信路径,以及能够在安全运营中心、现场领导层、企业风险团队、公共安全合作伙伴和政府机构之间传递信息的能力,而无需将每个决策都通过单一瓶颈。没有集成的探测只能产生无行动的感知,而没有训练有素的人员、经过测试的程序和授权委托的技术,只能制造准备就绪的表象而非真正的韧性。

这就是分布式杀伤链作为私营部门安全概念的价值所在。关键基础设施防御者也运作一条链:感知、识别、评估、决策、通信、响应、恢复和学习。如果这些功能紧密耦合于一个运营中心、一个网络、一个供应商平台或一位决策者,那么即使技术本身很先进,防御者也制造了一个组织层面的单点故障。更好的设计是一个有韧性的决策网,其中信息能够到达被授权采取行动的人员,责任在事件开始前就已明确,且组织能在传感器、通信路径、设施或个人不可用时继续运作。目标不是为了去中心化而去中心化,而是在压力下保持连续性。这一教训对美国的意义应远超乌克兰纵深打击这一具体问题。

西方组织有一种反复出现的倾向,即遇到新威胁时立即询问应采购哪种平台、传感器、干扰器、拦截器或软件包。技术很重要,但更困难的问题是围绕该技术的组织在其依赖关系被中断时能否继续运作。对于国防组织而言,一架连接到集中式操作员、固定通信基础设施、脆弱发射位置和僵化决策流程的先进无人飞机,可能不如嵌入一个能够分布人员、信息、权限和执行能力的组织中的更廉价系统有用。对于关键基础设施运营者而言,等同的错误是采购复杂的探测技术,却不构建将探测转化为及时、合法、协调行动所需的决策架构。首要的采购问题应该是传感器的数据能否在组织现有技术生态系统中被看到、共享和集成。

因此,分层安全改变了目标。目标不是使每个组件都坚不可摧,而是使整个系统难以被拆解。重叠的保护、多样化的能力、替代的通信和数据路径、分布的权限以及预先演练的恢复选项,降低了单一故障决定整个行动生存的几率。强化争议空域中分层导航架构的同一原则,也强化着地面关键基础设施:没有任何单一传感器、网络、电源、设施、操作员或决策者应能成为连续性终结的点。

因此,传统的杀伤链概念开始类似于杀伤网,防御层面的对应概念同样重要。功能可以跨越不同组织、地点、机器和时间范围执行,而来自一个事件的信息可改善对下一个事件的准备。责任在架构中流转,而不要求每个节点始终保持连接或同地部署。这种运作模式青睐韧性而非优化。分布式团队更难协调,分层系统需要额外的工程设计,委托的权限需要信任和培训,但在对抗条件下,这些代价中的每一个都能换来更有价值的东西:连续性。在常规运作中看似低效的做法,在通信中断、系统受扰、设施被孤立或决策者无法到位时,可能成为生存的基础。

飞行员交接之所以引人注目,是因为它将整个架构论点浓缩为一架飞机和三个人。发射团队准备系统,责任转移至他处,专业知识被应用于最关键之处,任务被设计成无需将每项关键功能集中在暴露程度最高的点上。单独来看,这些选择是战术;合在一起,它们代表了一种不同的作战哲学。乌克兰的教训不仅仅是未来属于自主无人机;更在于优势将属于那些能够分离人员、机器、权限和信息,却不割裂任务本身的组织。对于军队和私营部门的关键基础设施而言,韧性将日益取决于系统在对手、事故或危机移除其一个节点后,能否吸收中断、转移责任、保持决策优势并继续运作。

https://www.hstoday.us/subject-matter-areas/unmanned-vehicles/the-distributed-kill-chain-ukraines-deep-strike-drone-war-and-the-future-of-decision-advantage/

成为VIP会员查看完整内容
18
登陆后查看更多精品内容
VIP会员
最新内容
失去控制的指挥:人工智能时代的任务式指挥
专知会员服务
8+阅读 · 9月11日
美国的新国家安全科技战略思考
专知会员服务
4+阅读 · 9月11日
综述 | 面向大模型智能体的图结构个性化记忆
专知会员服务
6+阅读 · 9月10日
本周荟萃主题
区块链
区块链(Blockchain)是由节点参与的分布式数据库系统,它的特点是不可更改,不可伪造,也可以将其理解为账簿系统(ledger)。它是比特币的一个重要概念,完整比特币区块链的副本,记录了其代币(token)的每一笔交易。通过这些信息,我们可以找到每一个地址,在历史上任何一点所拥有的价值。
深度学习
机器学习的一个分支,它基于试图使用包含复杂结构或由多重非线性变换构成的多个处理层对数据进行高层抽象的一系列算法。
机器学习
“机器学习是近20多年兴起的一门多领域交叉学科,涉及概率论、统计学、逼近论、凸分析、算法复杂度理论等多门学科。机器学习理论主要是设计和分析一些让 可以自动“ 学习”的算法。机器学习算法是一类从数据中自动分析获得规律,并利用规律对未知数据进行预测的算法。因为学习算法中涉及了大量的统计学理论,机器学习与统计推断学联系尤为密切,也被称为统计学习理论。算法设计方面,机器学习理论关注可以实现的,行之有效的学习算法。很多 推论问题属于 无程序可循难度,所以部分的机器学习研究是开发容易处理的近似算法。”

——中文维基百科
强化学习
强化学习(RL)是机器学习的一个领域,与软件代理应如何在环境中采取行动以最大化累积奖励的概念有关。除了监督学习和非监督学习外,强化学习是三种基本的机器学习范式之一。 强化学习与监督学习的不同之处在于,不需要呈现带标签的输入/输出对,也不需要显式纠正次优动作。相反,重点是在探索(未知领域)和利用(当前知识)之间找到平衡。 该环境通常以马尔可夫决策过程(MDP)的形式陈述,因为针对这种情况的许多强化学习算法都使用动态编程技术。经典动态规划方法和强化学习算法之间的主要区别在于,后者不假设MDP的确切数学模型,并且针对无法采用精确方法的大型MDP。
推荐系统
推荐系统,是指根据用户的习惯、偏好或兴趣,从不断到来的大规模信息中识别满足用户兴趣的信息的过程。推荐推荐任务中的信息往往称为物品(Item)。根据具体应用背景的不同,这些物品可以是新闻、电影、音乐、广告、商品等各种对象。推荐系统利用电子商务网站向客户提供商品信息和建议,帮助用户决定应该购买什么产品,模拟销售人员帮助客户完成购买过程。个性化推荐是根据用户的兴趣特点和购买行为,向用户推荐用户感兴趣的信息和商品。随着电子商务规模的不断扩大,商品个数和种类快速增长,顾客需要花费大量的时间才能找到自己想买的商品。这种浏览大量无关的信息和产品过程无疑会使淹没在信息过载问题中的消费者不断流失。为了解决这些问题,个性化推荐系统应运而生。个性化推荐系统是建立在海量数据挖掘基础上的一种高级商务智能平台,以帮助电子商务网站为其顾客购物提供完全个性化的决策支持和信息服务。
卷积神经网络
在深度学习中,卷积神经网络(CNN或ConvNet)是一类深度神经网络,最常用于分析视觉图像。基于它们的共享权重架构和平移不变性特征,它们也被称为位移不变或空间不变的人工神经网络(SIANN)。它们在图像和视频识别,推荐系统,图像分类,医学图像分析,自然语言处理,和财务时间序列中都有应用。
计算机网络
计算机网络( Computer Networks )指将地理位置不同的多台计算机及其外部设备,通过通信线路连接起来,在网络操作系统及网络通信协议的管理和协调下,实现资源共享和信息传递的计算机系统。
命名实体识别
命名实体识别(NER)(也称为实体标识,实体组块和实体提取)是信息抽取的子任务,旨在将非结构化文本中提到的命名实体定位和分类为预定义类别,例如人员姓名、地名、机构名、专有名词等。
机器翻译
机器翻译,又称为自动翻译,是利用计算机将一种自然语言(源语言)转换为另一种自然语言(目标语言)的过程。它是计算语言学的一个分支,是人工智能的终极目标之一,具有重要的科学研究价值。
计算机视觉
计算机视觉是一门研究如何使机器“看”的科学,更进一步的说,就是是指用摄影机和电脑代替人眼对目标进行识别、跟踪和测量等机器视觉,并进一步做图形处理,使电脑处理成为更适合人眼观察或传送给仪器检测的图像。作为一个科学学科,计算机视觉研究相关的理论和技术,试图建立能够从图像或者多维数据中获取‘信息’的人工智能系统。
微信扫码咨询专知VIP会员