基于学习的匹配博弈在意图驱动的任务导向型网络中的任务调度与资源协同

黄姣蕊 ,  曹敏 ,  杨春刚 ,  韩竹 ,  李彤

工程(英文) ›› 2025, Vol. 54 ›› Issue (11) : 155 -166.

PDF (3293KB)
工程(英文) ›› 2025, Vol. 54 ›› Issue (11) : 155 -166. DOI: 10.1016/j.eng.2025.07.033

基于学习的匹配博弈在意图驱动的任务导向型网络中的任务调度与资源协同

作者信息 +

Engineering

Author information +
文章历史 +
PDF (3371K)

摘要

随着卫星通信技术的快速发展,空间信息网络(SINs)已成为支持复杂业务交付和跨域任务协同的重要基础设施,并推动着空间段、地面段、用户段多层协同向意图驱动的任务导向型协作范式转变。本文提出了一种新型意图驱动的任务导向型网络(IDTN)框架,以解决SIN中的任务调度与资源分配难题。该调度问题被建模为一种三方匹配博弈,综合考虑了各网络层实体的偏好属性。为了应对随机任务到达和资源动态变化带来的不确定性,框架引入了上下文感知的线性置信上界(LinUCB)在线学习机制,以降低决策不确定性。仿真结果表明,所提出的IDTN框架在性能上优于传统基准方法,实现了平均系统奖励提升4.4%~28.9%,平均资源利用率提升6.2%~34.5%,平均用户满意度提升5.6%~35.7%。所提框架有望推动空间平台的深度集成与统一编排。

Abstract

With the rapid advancement of satellite communication technologies, space information networks (SINs) have become essential infrastructure for complex service delivery and cross-domain task coordination, facilitating the transition toward an intent-driven task-oriented coordination paradigm across the space, ground, and user segments. This study presents a novel intent-driven task-oriented network (IDTN) framework to address task scheduling and resource allocation challenges in SINs. The scheduling problem is formulated as a three-sided matching game that incorporates the preference attributes of entities across all network segments. To manage the variability of random task arrivals and dynamic resources, a context–aware linear upper-confidence-bound online learning mechanism is integrated to reduce decision-making uncertainty. Simulation results demonstrate the effectiveness of the proposed IDTN framework. Compared with conventional baseline methods, the framework achieves significant performance improvements, including a 4.4%–28.9% increase in average system reward, a 6.2%–34.5% improvement in resource utilization, and a 5.6%–35.7% enhancement in user satisfaction. The proposed framework is expected to facilitate the integration and orchestration of space-based platforms.

Graphical abstract

关键词

意图驱动网络 / 匹配博弈 / 资源分配 / 空间信息网络 / 任务调度

Key words

Intent-driven network / Matching game / Resource allocation / Space information network / Task scheduling

引用本文

引用格式 ▾
黄姣蕊,曹敏,杨春刚,韩竹,李彤. 基于学习的匹配博弈在意图驱动的任务导向型网络中的任务调度与资源协同[J]. 工程(英文), 2025, 54(11): 155-166 DOI:10.1016/j.eng.2025.07.033

登录浏览全文

4963

注册一个新账户 忘记密码

Contents lists available at ScienceDirect
journal homepage: www. elsevier.com/locate/eng
ELSEVIER

1 引言

近年来,卫星通信技术的快速发展显著加速了空间信息网络(SINs)的演进。通过将卫星等空间平台与地面通信基础设施相结合,SINs实现了全球范围的感知、数据传输与信息处理,支撑了包括地球观测、全球通信和导航服务等关键应用[12]。随着应用需求日益多样化以及数据量的持续增长,卫星与边缘节点的工作负载预计将大幅增加[35]。低轨卫星星座的大规模部署极大提升了网络的覆盖范围和动态响应能力。网络节点正日益具备数据计算与转发的能力,从而能够高效并行处理异构任务。在此背景下,SINs被广泛应用于满足多样化需求的任务,包括对时延敏感的操作、计算密集型任务以及常规服务请求。因此,基于任务特征实现高效的任务调度与资源分配,已成为保障SINs稳定性与服务可靠性的关键挑战。

已有多项研究针对SINs中的任务调度与资源分配展开探讨[610]。例如,Wang等[6]提出了一种面向低轨卫星物联网系统的节能型任务划分与卸载框架,重点优化了通信与计算过程中的能耗。Dai等[7]强调了在多层网络架构中开展资源编排的潜力。文献[810]则研究了协同资源分配机制,重点关注网络缓存、时延降低以及能效优化。此外,针对异构系统与边缘计算场景的研究也为SIN资源调度提供了有价值的参考。例如,Chen等[11]和Chen等[12]提出了兼顾收益与移动性的卸载策略,以应对无人机辅助与移动边缘计算环境下的动态业务需求。同样地,Chen等[13]和Chen等[14]提出了协同缓存与资源预测框架,通过多方协作在系统效率与隐私保护之间实现平衡。然而,大多数研究依赖于具有线性资源消耗特征的静态任务模型,往往忽略了节点在任务执行过程中资源的动态恢复特性。因此,这些方法难以适应SINs所固有的异构性与高动态性。

已有多位学者引入博弈论方法,对SINs中异构实体之间的策略性交互关系(如资源竞争与任务偏好)进行建模[1519]。例如,Jin等[15]提出了一种基于双向拍卖机制的动态计算资源分配模型;Gao等[16]构建了多层博弈模型,以联合优化时延与能耗;Fan等[17]应用合作博弈理论提升了卫星系统在资源重构方面的适应性;Jia等[18]和Qin等[19]提出了基于三方匹配博弈的任务调度框架,并在高度动态且充满不确定性的网络环境中展示了出色的可扩展性与稳定性。尽管这些方法具有潜力,但许多博弈论模型在适应网络状态的实时变化方面仍存在不足,从而限制了基于反馈的自适应优化效果。

近年来,人工智能技术在通信网络中得到了广泛应用。人工智能方法被引入SINs的资源调度过程中,以提升决策智能化水平并增强网络感知能力[2028]。Hu等[20]提出了一种将图神经网络与深度强化学习相结合的任务卸载策略,但忽略了节点资源的时变恢复特性。Meng等[21]采用异步Actor-Critic强化学习模型优化SINs的资源调度,但未能充分考虑任务属性与资源状态之间的关系。Liu等[22]和Wang等[23]将遗传算法与多智能体强化学习结合,用于解决联合资源分配问题,然而这些方法在刻画复杂任务之间的耦合与动态交互方面仍显不足。近期的研究开始探索跨域框架,将工作负载预测、在线学习与自适应资源管理相结合,以提升智能调度性能。Chen等[24]通过高维工作负载预测增强了资源前瞻性。Chen等[25]提出了一种个性化联邦强化学习框架,以优化任务成功率并平衡时延与能耗的权衡。进一步,预测建模与强化学习的结合也受到关注。Chen等[26]采用Actor-Critic架构,在动态负载下实现了节能型资源供给。Chen等[27]提出了一种基于联邦深度强化学习的卸载方案,在实现低时延任务调度的同时保护数据隐私。Chen等[28]开发了一种适用于空天地一体化网络的轻量化框架,该框架融合了流量预测、注意力机制与知识蒸馏技术,能够在受限且动态的条件下支持自适应卸载与资源切片。

近年来,研究越来越多地关注将在线学习方法,尤其是线性置信上界(LinUCB)算法[29]应用于提升调度机制的适应性与反馈响应能力[3033]。Yang等[30]将LinUCB引入资源受限的推荐系统,实现了在线决策场景下的高效资源分配。Baheri [31]将LinUCB扩展为分层变体,以刻画复杂的分层资源约束,并验证了其在云平台资源调度中的有效性。Hanna等[32]探讨了在分布式系统中无需共享上下文信息而应用LinUCB的可行性,为自主环境下的协同调度提供了理论基础。Li等[33]将LinUCB应用于组合多臂赌博机问题,提出了动态协商与策略分配框架。总体而言,这些研究表明,LinUCB在处理不确定的任务反馈与复杂上下文条件方面具有显著优势,并为在资源调度中实现基于反馈的推理与自适应决策提供了有价值的思路。

除了采用LinUCB等算法解决方案外,网络架构与通信模型的进步更新对于提升SINs的任务调度性能同样至关重要。边缘智能通过分布式学习与决策提升了异构与动态环境下的适应性;语义通信则通过传输关键信息而非原始数据,提高了通信效率与能量利用率。例如,Feng等[34]将语义通信与边缘智能结合应用于车联网环境,设计了一种多用户语义传输框架,在保障任务精度的同时减少了数据传输量。同样地,Liu等[35]提出了一种集成感知、通信与计算的框架,在不同推理模式下对这些组件进行联合优化,从而在资源受限条件下提高了精度并降低了能耗。这些研究表明,面向语义与智能驱动的调度方法在实现节能、低时延及任务感知优化方面具有重要价值,并为进一步完善本文所提出的模型提供了重要参考。此外,Yang等[36]与Xu等[37]展示了系统设计者如何利用速率分裂技术、联邦学习与上下文感知协同,实现SINs中低时延、节能型的任务调度。这些研究趋势表明,基于语义通信与边缘智能的资源分配策略正成为SINs演进的重要方向,为扩展与优化本文提出的任务-资源优化模型提供了重要参考。

将SIN中任务调度与资源分配的主要挑战总结如下。

(1)异构任务-资源匹配:SIN由卫星、地面节点和终端等多种实体构成,不同实体在资源能力与服务角色上各不相同。现有模型往往难以全面刻画多维度的资源约束与任务偏好,这一局限导致在动态环境中任务与资源匹配效率低下。

(2)缺乏实时资源感知:SIN中的节点资源会因任务执行、资源恢复以及链路波动而动态变化。然而,许多策略依赖于静态或周期性更新机制,难以及时响应实时变化,从而降低了调度精度与系统整体效率。

为应对上述挑战,本文设计了一个包含三类实体的调度场景,即终端用户、卫星节点与地面核心网络节点,并根据任务特性制定差异化的调度策略。对于时延敏感型任务,优先在邻近的地面节点上执行以最小化时延;对于计算需求较高的任务,则将其卸载至计算资源充足的卫星或地面节点;而常规任务则依据当前系统负载进行动态分配。鉴于任务需求与节点能力的异构性,实现精确的任务-节点分配对于高效调度至关重要。为此,本文将上下文感知的LinUCB算法与三方匹配博弈框架相结合。该混合方法不仅克服了传统匹配方法在应对动态资源波动方面的局限性,还弥补了在线学习算法在刻画多方偏好特征及实现全局稳定匹配方面的不足。由此,所提方案显著提升了资源调度的适应性,并增强了SIN的整体运行稳定性。本文的主要贡献如下。

• 架构层面:本文提出了一种意图驱动的任务导向型网络(IDTN)框架,将用户意图生成、任务分解与资源调度有机结合。所提方法通过将决策过程与任务目标及服务意图相匹配,改进了传统以网络为中心的静态分配方式。IDTN能够在异构SIN资源间实现自适应、高效的协同,支持动态环境下的全局优化。

• 任务调度与资源分配层面:将空间、地面与用户三个网络分段建模为三方匹配博弈中的三类实体,并在匹配过程中引入各实体的偏好信息。模型融合了资源约束,并将任务时延与支付成本设定为联合优化目标。与传统调度方法相比,这一博弈论方法更适用于SIN的高动态性及复杂多方交互环境。

• 算法层面:现有基于强化学习与多臂赌博机的方法虽提升了调度性能,但往往忽略了跨实体的偏好建模。为此,本文提出了一种结合三方匹配博弈与LinUCB的任务-资源分配算法,在同时考虑任务需求与节点能力的基础上,实现了SIN中稳定且自适应的匹配。

本文其余部分的组织结构如下:第2节介绍网络场景及整体IDTN框架;第3节描述问题建模与系统模型;第4节阐述所提出的基于学习的匹配博弈算法;第5节展示仿真结果并进行性能分析;最后,第6节对全文进行总结并展望未来的研究方向。

2 意图驱动的任务导向型网络

2.1 网络场景

我们可以预见,随着网络规模和用户需求的持续增长,传统节点与链路将逐步向更高智能化演进。这一趋势将使网络架构能够构建稳健的、面向任务的资源协同网络,以满足多样化的服务需求。正如图1所示,SIN由地面、空间和终端用户三个主要部分组成。用户终端在其架构内产生了多种多样的任务需求。为满足这些需求,系统架构增强了网络节点的计算与存储能力,其中包括升级处理单元[如中央处理器(CPU)与图形处理器(GPU)]以及优化数据存储基础设施。此外,通过降低时延与提升带宽,网络整体的任务执行与资源分配效率得到显著提升。在靠近用户侧的地面段边缘节点以及空间段的卫星节点方面,同样进行了升级。这些节点具备更低的传输时延、更高的计算效率以及更广的服务覆盖范围,从而能够执行超越基础数据中继与转发的任务。与此同时,地面段的核心节点也得到了升级,具备更强的决策能力,并在链路与资源管理机制方面实现了优化。

2.2 网络架构

图2展示了所提出的IDTN框架,所提框架由用户段、空间段和地面段三大部分组成。详细工作流程为:首先,对复杂的用户意图进行分解,将抽象的服务需求转化为明确且可执行的任务;随后,通过任务调度将任务最优地分配至合适的网络节点。

该决策过程综合考虑了各节点的资源容量、当前负载以及任务的具体需求。上述交互过程构成了意图感知服务交付的基础,使系统能够在动态且异构的网络环境中实现自适应与高效的任务执行。本文根据任务属性将其划分为三类:时延敏感型、计算密集型和常规型。时延敏感型任务具有严格的时延约束,最适合由靠近用户的节点处理,以实现快速响应;计算密集型任务虽然对时延不敏感,但需要大量计算资源,因此优先分配给地面段的高性能节点;常规型任务具有适中的时延容忍度和较低的资源需求,通常由边缘节点优先处理,若边缘资源耗尽,则将任务重新分配至地面核心节点,以保障执行连续性与系统可靠性。

例如,对于以下意图:“确保执行大规模巡检或巡逻任务的自主空中飞行器集群具备持续通信与动态协同能力”,所提出的IDTN框架会将该意图分解为多个相互关联的任务,包括来自自主空中飞行器终端的实时状态报告与感知数据上传。卫星节点负责中继通信与初步轨迹预测,地面控制器则执行集群路径优化与任务重构。不同任务对计算、存储与通信资源的需求各不相同,系统会根据当前网络状况、任务特性及可用资源,在用户段、空间段和地面段的节点之间动态分配任务。Wang等[38]曾研究过意图分解方法。然而,本研究聚焦于基于资源的任务分配,并未深入探讨意图分解的技术细节。

3 问题建模

IDTN框架的问题建模如图2所示。本研究构建了一个由核心节点、边缘节点和终端节点组成的SIN,其中,核心节点集合记为C = {c1, c2, , cm, , cM},边缘节点集合记为E = {e1, e2, , en, , eN},终端节点集合记为D = {d1, d2, , dp, , dP},其中,mnp分别表示核心节点、边缘节点和终端节点的索引;MNP分别表示核心节点、边缘节点和终端节点的总数量。具体而言,cm 表示第m个核心节点,en 表示第n个边缘节点,dp 表示第p个终端节点。每个边缘节点均具备数据处理能力,以减轻核心计算中心的负载,并处理对时延要求较高的任务。任务集合记为K={k1, k2, , ki, },每个任务包含五个属性,表示为ki = {ski, qki, τki, costki, intentki}。其中,ki 表示任务集合K中的第i个任务;ski表示任务ki 的数据量;qki表示完成任务ki 所需的CPU周期数;τki表示用户设备可容忍的最大服务时延,用于反映任务的服务质量需求;costki表示用户完成第i个任务所需的成本;intentki为任务类型标识,用于反映用户意图,intentki = 1, 2, 3分别表示时延敏感型任务、计算密集型任务和常规型任务。在此基础上,构建了完整的问题数学模型,以最大化任务完成率、资源利用率以及系统奖励。

(1)任务完成率。系统通过尽量减少在规定时间内完成任务所需的时延来提升任务完成率。该时延由多个部分构成,包括用户终端与边缘节点之间以及边缘节点与核心计算中心之间的传输和传播时延。其中,传播时延是由节点间的物理距离引起的时间延迟。此外,终端、边缘和核心节点的处理时延也会对任务完成造成影响;同时,各节点处的排队时延也会进一步影响任务是否能够满足时延约束。如果任务的累计时延超过其可容忍的阈值,则该任务被视为执行失败,从而降低整体任务完成率。

任务ki 在核心节点cm 、边缘节点en 和终端节点dp 上的计算处理时延分别记为tcmki,mtenki,ntdpki,p,其表达式如下:

tcmki,m=qkifcm,tenki,n=qkifen,tdpki,p=qkifdp

式中,fcmfenfdp分别表示核心节点cm 、边缘节点en 与终端节点dp 的计算速率,所有速率均以CPU时钟频率进行衡量。

传输时延是指用户终端与边缘节点之间以及边缘节点与核心节点之间进行数据传输所需的时间;传播时延则反映了节点间物理距离所引起的延迟。本文将边缘节点与终端节点之间的传输与传播时延总和定义为ttrans+prope,dki,将核心节点与边缘节点之间的传输与传播时延总和定义为ttrans+propc,eki,其计算公式如下:

ttrans+prope,dki=skire,d+dise,dlc,ttrans+propc,eki=s'kirc,e+disc,elc

式中,si表示必须传输至核心节点进行处理的任务数据量,特别适用于时延容忍度低且计算需求高的任务;rc,ere,d分别表示核心节点与边缘节点之间以及边缘节点与终端节点之间的数据传输速率;disc,e和dise,d分别表示核心节点到边缘节点、边缘节点到终端节点的物理距离;lc表示光的传播速度。

排队时延是指任务在被处理前等待在队列中的时间。假设每个任务ki 均服从到达率为λki的泊松到达过程。基于M/G/1排队模型,单位传输数据的平均响应时间可表示为1/(μ-(λkiqki)),其中,µ为节点的服务速率。因此,任务ki 在核心节点cm 、边缘节点en 和终端节点dp 的排队时延分别记为quecmkiqueenkiquedpki,其计算公式如下:

quecmki=λkifcm-λkiqki,queenki=λkifen-λkiqki,quedpki=λkifdp-λkiqki

因此,任务ki 的总时延Tc,e,dki可表示为

Tc,e,dki=tcmki,m+tenki,n+tdpki,p+ttrans+prope,dki+ttrans+propc,eki+  quecmki+queenki+quedpki

(2)资源利用率。资源利用率基于各节点的资源使用情况进行评估,定义为已消耗资源与总可用资源的比值。本文考虑了两类资源消耗:计算资源与转发资源。具体而言,边缘节点en 的计算资源利用率可表示为

uenki,compute=qkifenNen,CPU

式中,uenki,compute表示任务ki 在边缘节点en 上的计算资源利用率;Nen,CPU表示当前节点的CPU核心数量。边缘节点en 的转发资源利用率可表示为

uenki,forward=skiτkiBen

式中,uenki,forward表示任务ki 在边缘节点en 上的转发资源利用率;Ben表示当前节点所连接链路的带宽。任务ki 在边缘节点en 的总资源利用率可表示为

Uenki=uenki,compute+uenki,forward

式中,Uenki表示任务ki 在边缘节点en 的总资源利用率。

同理,核心节点cm 和终端节点dp 的计算与转发资源总利用率分别记为UcmkiUdpki。在空间-地面-用户协同网络中,任务ki 的总体资源利用率Uc, e, dki可表示为

Uc,e,dki=Ucmki+Uenki+Udpki

在所提出的IDTN框架中,终端节点生成的任务在计算复杂度、时延敏感性及执行成本等方面均具有显著的异构性。为了优化系统性能,系统需要决定每个任务的执行位置。选择在边缘节点执行任务,还是将其卸载至核心节点,取决于任务类型及当前资源可用性。为实现这一目标,本文构建了一个联合任务调度与资源分配模型,旨在满足时延与资源约束的前提下,最大化任务完成率、提升资源利用率并增加系统整体奖励。最终,该问题可表述为

max φ=kiKxc,e,d,ki(α1Tc,e,dki+βUc,e,dki+costki)
s.t.     cmCenEdpDxc,e,d,ki=1,kiK
cmCxc,e,d,ki(qki+ski)Nccompute+Ncforward
enExc,e,d,ki(qki+ski)Necompute+Neforward
dpDxc,e,d,ki(qki+ski)Ndcompute+Ndforward
xc,e,d,kiTc,e,dkiTmax, cmC, enE, dpD

在上述公式中,φ为目标函数。αβ为平衡系数,其值均设为0.5,分别用于平衡时延降低与资源利用率提升。xc,e,d,ki为二进制任务指示变量{0,1},用于表示任务的执行位置。核心节点、边缘节点与终端节点的计算资源总量分别为NccomputeNecomputeNdcompute,转发资源总量分别为NcforwardNeforwardNdforwardTmax表示每个任务可容忍的最大时延。式(10)规定每个任务只能在一个节点上执行,而式(11)~(14)确保当前任务集的资源需求不超过各节点的总可用资源。

4 三方匹配博弈与上下文感知增强算法

4.1 三方匹配博弈建模

三方关系在经济与政治领域广泛存在,三方匹配(three-sided matching)可视为经典稳定婚姻问题的多维扩展[1819]。本文首先研究具有规模与循环偏好的三方匹配问题(TMSC),其涉及三类实体:核心节点、边缘节点与终端节点。每类实体对其他类型的实体都有偏好列表:核心节点优先考虑终端任务,终端生成的任务优先考虑边缘节点,边缘节点则优先考虑核心节点。该设计刻画了核心-边缘-终端节点之间的关系,使得优化问题可以转化为三方匹配问题,其主要目标是在时刻t找到稳定匹配ϕt。设所有三元组的集合为At = Ct × Et × Dt,则ϕt At,其中,CtEtDt 分别表示时刻t的核心节点、边缘节点与终端节点集合。为定义TMSC的稳定性,本文引入定义1,阐述了阻塞三元组(blocking triple)的概念[39]。

定义1:阻塞三元组是指一个属于集合At 但不属于当前匹配ϕt 的三元组(cm, en, dp ),且其中cmendp 各自都更偏好该三元组,而不是它们当前的匹配对象。

ϕt 中不存在阻塞三元组时,该匹配被认为是稳定的。据此,本文所研究的问题可重新表述为

max ϕt
s.t. N(ϕt,dp)1,dpDt
N(ϕt,cm)NC,cmCt
N(ϕt,en)NE,enEt
Bl(dp,en,cm)=0

式中,Bl表示阻塞对函数;|ϕt |表示稳定匹配的基数;N(ϕt,dp)N(ϕt,cm)N(ϕt,en)分别表示在匹配ϕt中包含终端节点dp 、核心节点cm 和边缘节点en 的三元组个数。式(16)规定终端节点dp 最多只能连接一个边缘节点,式(17)限制核心节点的容量上限为NC式(18)限制边缘节点的容量上限为NE式(19)确保匹配ϕt 中不存在阻塞三元组。根据文献[19,39],TMSC中的最大基数问题可以被转化为具有规模约束与循环偏好列表的受限三边匹配问题(restricted TMSC, R-TMSC),更多细节可参见相关参考文献。

从TMSC转换为R-TMSC的过程涉及两个约束条件:①使用主列表(master list)作为核心节点偏好列表的基础,并按用户支付价格降序排列;②每个边缘节点生成的偏好列表中存在并列情况。

4.2 基于LinUCB的改进型R-TMSC算法

在网络运行过程中,资源状态高度动态且信息存在显著不确定性。为应对这一问题,本文引入了LinUCB算法[18],利用上下文信息动态调整偏好列表,从而降低高度动态条件下的决策不确定性。该方法被称为R-TMSC-LinUCB。图3展示了R-TMSC与R-TMSC-LinUCB算法的流程图。偏好列表设计如下:需要更高数据传输速率的用户应支付更高的费用,从而更有可能获得核心节点的优先选择。在本节的偏好列表表示方法中,当索引关系可由上下文明确判断时,我们将ki 简化为k。因此,每个核心节点都会建立相同的偏好列表,PLm,k,tC表示核心节点cm 在第t个时隙对任务k的偏好排名,这两个符号在文中可互换使用,以平衡表达的清晰性与简洁性。

用户终端会基于时刻t的上下文信息对可接受的边缘节点进行排序。偏好列表PLk,n,tD表示任务k在第t个时隙中对边缘节点en 的偏好排名,其计算公式为

PLk,n,tD=yk,nTθk+ξyk,nTHk-1yk,n

式中, θk 表示与任务k相关的已学习权重向量; yk,n 表示任务k与边缘节点en 之间的上下文信息;ξ为调节参数。所提出的算法考虑了多个关键特征,包括任务数据量、所需CPU周期数、用户任务的最大可容忍时延,以及核心与边缘节点的可用CPU、带宽和时延特性。协方差矩阵 Hk 用于在当前特征空间中估计最优参数,并平衡探索(exploration)与利用(exploitation)之间的权衡。 Hk 通常初始化为单位矩阵,更新公式为: Hk = Hk+yk,nyk,nT。此外, bk = bk +φt yk,n 表示基于历史数据累积的奖励值,通常初始化为零向量,其中,φt 表示时刻t系统的目标函数。置信区间ξyk,nTHk-1yk,n控制探索程度,而 θk = Hk-1bk 则反映了各特征对奖励的贡献,从而能够预测不同特征组合下的潜在奖励。

根据R-TMSC的第二个约束条件,边缘节点与核心节点相互独立。偏好列表PLn,m,tE表示在第t个时隙中,边缘节点en 对核心节点cm 的偏好排名。可接入核心节点的边缘节点列表为PLn,m,tE=1

算法1给出了基于LinUCB在线学习的改进型R-TMSC调度策略。第1~2行定义输入元素,包括任务集、节点集、LinUCB参数以及输出性能指标;第3~10行为每个节点的初始化参数,包括协方差矩阵、奖励向量、权重向量、计算与带宽容量以及累积奖励变量;第11~15行提取任务的上下文特征向量,并初始化最优节点选择变量;第16~25行评估所有具备足够资源的候选节点。

在第19行计算预测参数,第20行结合估计奖励与不确定性项计算LinUCB分值,然后选择得分最高的节点;第26~32行将任务分配给所选节点,并更新其可用计算与带宽资源;第33~37行根据时延、资源利用率与成本计算奖励,并更新对应的奖励累计值;第38~42行利用观察到的奖励与任务特征向量更新LinUCB模型参数;第43~44行记录在没有节点满足约束条件时未分配的任务;第47行返回最终的任务分配结果及聚合性能指标。

4.3 性能分析

根据算法1,可得出以下定理。

定理1:在单个时隙内,边缘节点只能沿一个方向进行移动。

证明:算法1所示,在任务选择边缘节点的时隙内,任务会从其排序列表中最优先的节点中进行选择。如果任务ki 从边缘节点en 中舍弃了某些节点,则当前被ki 接受的节点必然是更优选择。在后续轮次中,如果有新任务到达且任务ki 希望更换当前接受的边缘节点,则其只能选择排名高于当前已接受节点的候选节点。因此,先前被任务ki 拒绝的边缘节点en 在之后的轮次中将无法被同一任务重新接受。这一推理可推广至多时隙的情形。

定理2:根据算法1,终端-边缘-核心的匹配问题能够收敛并实现稳定匹配结果。

证明:由定理1可知,边缘节点的选择过程是单向的。当边缘节点的指针到达其偏好列表末尾时,其匹配已达到最优,无法单方面提升匹配效果。同理,当核心节点的指针到达其偏好列表末尾时,也无法再提升匹配质量。根据文献[40],当偏好列表可替代时,成对稳定匹配是存在的。基于此,R-TMSC-LinUCB算法能够在单个时隙内收敛并实现稳定匹配结果。

本节对R-TMSC-LinUCB算法进行了理论分析,重点关注其最优性与计算复杂度。

(1)复杂度分析:R-TMSC-LinUCB算法的计算复杂度主要包括三个部分。第一部分为初始化阶段。在该阶段,系统中每个节点初始化其协方差矩阵、奖励向量和权重向量,该操作的复杂度为O((N+M)·h2),其中,h表示上下文特征空间的维度。由于此步骤在任务调度开始前仅执行一次,因此对总计算开销的影响有限。第二部分为任务匹配与评分过程。算法会为每个任务评估所有候选节点,包括边缘节点与核心节点。每个任务的评估次数为(N+M)。每次评分通过将奖励估计与不确定性计算相结合得到,其单节点复杂度为O(h2)。因此该阶段的总复杂度为O(|K|·(N+M)·h2),其中,|K|表示待调度任务集的数量。第三部分为模型更新阶段。在每个任务被分配后,算法会基于观测到的反馈更新所选节点的协方差矩阵与奖励向量,该操作对每个任务的复杂度为O(h2),总复杂度为O(|K|·h2)。综上,R-TMSC-LinUCB算法的总体计算复杂度为O(|K|·(N+M)·h2)。

(2)最优性分析:由于用户数量有限且每个用户在选择边缘节点时维护的偏好列表长度是有界的,因此R-TMSC-LinUCB算法在每个时隙内能够在有限轮次内收敛。为了进一步验证算法的收敛性与输出一致性,本文采用反证法证明了R-TMSC-LinUCB算法能够产生稳定匹配结果,如定理2所述。为了评估R-TMSC-LinUCB算法的有效性,本文引入学习遗憾值δ,用于衡量在完全全局信息下系统最优奖励与在不确定条件下估计奖励之间的期望差距。学习遗憾值δ的上界在附录A中给出了详细推导过程。

5 仿真结果

本节对所提出的R-TMSC-LinUCB算法进行了评估,并与五种基准方法进行了对比分析。

R-TMSC算法:这是一种受限匹配模型,将用户生成的任务分配给核心节点、边缘节点和终端等异构实体。该算法结合了多维度资源约束以及三类节点之间的循环偏好关系,以在有限网络条件下寻求稳定且高效的任务分配方案[18]。

R-TMSC-UCB算法:该混合算法将R-TMSC与UCB多臂赌博机方法结合,用于应对SINs中信息不确定性与节点可用性动态变化的挑战。该方法可实现低成本且自适应的决策,将终端生成的任务分配至边缘或核心节点[19]。

随机分配算法:随机将终端用户的任务分配给核心或边缘节点。该方法可能导致资源碎片化,并限制可用节点资源的有效利用。

ε-贪婪(epsilon-greedy)算法:一种策略选择机制,通过设置探索概率参数ε来平衡探索新动作与利用已有经验,从而防止贪婪算法陷入局部最优解[19]。

Gale-Shapley(GS)算法:将三类实体拆分为两部分,即边缘-核心节点对与终端设备集,从而将原三方匹配问题转化为两个稳定的双边匹配问题,并使用GS算法求解[18]。

5.1 仿真环境与参数设置

本文所提出的系统在一台基于Windows的桌面计算机上实现,硬件配置为Intel® Core™ i7-9700 CPU @ 3.00 GHz与16 GB内存(RAM),采用Python 3.9.7在Anaconda环境下的Spyder IDE中运行。仿真环境包括5个核心网络节点与10个边缘节点。实验设置中,终端用户数设为50个和80个两种情况。终端侧任务到达服从泊松分布,平均到达率按参考文献[41]设置为每秒0.05个任务,其中,终端用户数量与任务生成源数量一致。每个时隙的资源恢复率为0.1%。卫星节点位于1200 km高度,支持上行速率10 Mbps和下行速率100 Mbps(参考文献[41])。终端设备与核心网络节点均匀分布在直径为10 km的圆形区域内,相邻时隙间隔固定为60 s。每个任务具有以下属性[42]:数据量服从[100, 200] Mb范围内的均匀分布;CPU周期需求为1×108~1×109周期;最大可容忍时延介于4~6 s。任务的支付成本由三项属性加权计算而得,权重分别为数据量的0.5倍、CPU周期需求的0.3倍、时延的0.2倍。根据任务意图,任务被划分为三类:类型1为时延敏感型任务,需在边缘节点执行;类型2为计算密集型任务,优先分配至核心节点;类型3为通用任务,无严格执行约束。依据文献[43],网络节点的计算与通信资源配置如下:核心节点计算能力为10 GHz,可用带宽为99.7 Mbps,允许时延范围为10~50 s;每个边缘节点的计算能力随机取自区间[5, 10] GHz,带宽范围为9.97~99.7 Mbps,允许时延范围为1~10 s。LinUCB参数设为ξ = 1.5、α = 0.5、β = 0.5。该仿真框架为评估所提出的资源分配与任务调度策略提供了动态环境,支持多任务类型与多资源配置的测试。

5.2 性能评估

通过仿真评估了R-TMSC-LinUCB的性能,重点分析了不同时隙任务量变化对资源利用率与系统奖励的影响。实验在80个终端用户的条件下进行。仿真过程中,每个时隙分配的节点资源在后续时隙中会部分释放,并在每轮中生成一定数量的新任务。图4(a)展示了三种类型的任务与意图:当意图为1时,任务在边缘节点执行;当意图为2时,任务在核心节点执行,因此核心节点在初期阶段会被部分消耗。对于优先在边缘节点执行的常规任务,可观察到边缘节点的资源利用率最先饱和。图4(b)显示,当边缘节点资源利用率达到饱和后,其系统奖励保持稳定。由于任务到达具有动态性且节点资源可恢复,因此系统总奖励仍会逐步增长。

图5展示了R-TMSC-LinUCB在不同核心节点配置(5个、10个、15个)下累计成功处理的用户任务数量,边缘节点数固定为10个,终端用户数为80个。核心节点数量增加显著提升了可处理的任务总数:5个核心节点约可处理8000个任务,10个与15个核心节点的处理量分别约为15 800个与22 000个任务。所有曲线在初期均呈线性增长,随后增速下降,反映了核心资源饱和的出现。即使在饱和后,任务累计完成量仍缓慢增长,这是由于每个时隙中计算与带宽资源会部分恢复。

5.3 对比分析

在终端用户数为50个的条件下,对比了R-TMSC-LinUCB、R-TMSC-UCB、R-TMSC与随机分配算法在不同时隙下的资源利用率与系统总奖励(图6、图7)。图6展示了不同任务调度策略下资源利用率的变化趋势。随着时隙的推进,所有算法的资源利用率均呈现稳步上升趋势,表明网络负载在持续增长。其中,R-TMSC-LinUCB算法始终保持最高的资源利用率,其次依次为R-TMSC-UCB与R-TMSC算法。具体而言,R-TMSC-LinUCB的平均资源利用率较R-TMSC-UCB提高6.22%,较R-TMSC提高7.39%,较epsilon-greedy提高23.36%,较GS提高11.35%,较随机分配提高34.46%。这些结果表明,基于LinUCB的策略能够显著提升资源利用效率,尤其适用于高负载和动态变化的网络环境。图7展示了不同策略在前100个时隙内累计的系统总奖励。结果显示,R-TMSC-LinUCB在系统总奖励方面始终优于其他基线算法,验证了其在最大化任务分配效用方面的有效性。相较于R-TMSC-UCB、R-TMSC、epsilon-greedy、GS和随机分配策略,R-TMSC-LinUCB 在系统总奖励上的平均提升分别为4.44%、11.11%、27.13%、18.67%和28.90%。

图8展示了在终端用户数固定为80个的条件下,不同算法在整个仿真时隙中的执行时间变化情况。从图中可以观察到,R-TMSC-LinUCB算法在初始阶段的执行时间相对较长,这主要是由于在节点资源充足、可支持大量任务分配时,算法需要进行频繁的基于上下文的计算与矩阵更新。随着仿真过程的推进,网络资源逐渐趋于饱和,可执行任务数量减少,从而降低了计算开销。虽然每个时隙中都引入了少量的资源恢复机制,但仅能支撑有限的任务执行,使得算法在后期阶段的执行时间趋于稳定并保持较低水平。平均而言,R-TMSC-LinUCB的执行时间略高于其他算法:每个时隙比R-TMSC-UCB多约6.8 ms,比R-TMSC多10.8 ms,比epsilon-greedy多9.5 ms,比GS多8.4 ms,比随机分配多11.8 ms。尽管该算法带来了额外的计算开销,但总体负担仍在可接受范围内。而且,其在资源利用率与调度精度方面取得的显著提升,完全证明了这一计算代价的合理性。

为评估用户满意度,图9展示了在终端用户数固定为80个的情况下,六种算法在不同时隙内的平均满意度变化。随着时间的推移,任务量不断增加,网络资源竞争愈发激烈,导致所有策略下的用户满意度均出现不同程度的下降。

尽管如此,R-TMSC-LinUCB算法在整个仿真过程中始终表现优异,保持了更高的用户满意度。在第25至第150个时隙的统计区间内,R-TMSC-LinUCB的平均用户满意度较R-TMSC-UCB提高5.65%,较R-TMSC提高7.30%,较epsilon-greedy提高12.80%,较GS提高12.77%,较随机分配提升35.68%。这些结果充分说明了所提方法在动态资源受限环境下,能够有效平衡任务分配与在线学习,显著提升系统整体服务质量与用户体验。

5.4 学习能力对比

图10展示了三种任务分配算法在200个时隙内的累计遗憾值变化曲线,包括R-TMSC-LinUCB、R-TMSC-UCB和epsilon-greedy。累计遗憾值用于衡量各算法在每个时隙中所作决策与理论最优分配之间的偏差,其增长速度越慢,表明算法的学习精度和效率越高。从图中可以看出,R-TMSC-LinUCB始终保持最低的累计遗憾值,说明其上下文学习机制能够有效捕捉任务、特征与节点之间的潜在关联,从而支持更优的分配决策。相比之下,R-TMSC-UCB的累计遗憾增长更快,因为其仅依赖历史奖励统计,未能利用上下文特征信息;而epsilon-greedy算法由于采用固定的探索策略,表现最差,累计遗憾值上升陡峭且持续增长。这些结果凸显了上下文信息在提升长期决策质量方面的关键作用。尽管UCB与epsilon-greedy能够提供稳健的基线性能,但其无法适应特征分布的动态变化,导致较高的累计遗憾值。相比之下,R-TMSC-LinUCB具备更强的自适应性与学习效率,在动态与异构的SIN环境中展现出更优的应用潜力。

6 结论

本研究构建了一种新型IDTN框架,以解决空间-地面-用户协作网络中复杂的任务分配挑战。针对资源分配问题,本研究引入了一种三方匹配博弈算法,使任务能够根据自身偏好选择最稳定的匹配节点。与此同时,节点根据支付奖励对任务进行评估与接收,从而产生相互稳定的匹配结果。为应对网络资源信息高度动态带来的不确定性,系统进一步引入了上下文感知LinUCB在线学习机制,通过利用上下文信息实现最优资源分配并提升系统稳定性。为了验证所提框架的有效性,开展了广泛的仿真实验。结果表明,融合LinUCB的匹配方法在资源利用率、系统奖励和用户满意度方面均显著优于具有代表性的基准算法。具体来说,所提出的方法在平均资源利用率方面提高了6.2%~34.5%,在平均系统奖励方面提高了4.4%~28.9%,在平均用户满意度方面提高了5.6%~35.7%。虽然与其他算法相比,所提算法在每个时隙增加了约6.8~11.8 ms的执行时间,但其性能提升非常可观。总体而言,所提方法显著提升了系统整体效率,展现出其在未来SIN环境中的实际应用价值。未来的研究将进一步聚焦于提升SIN智能调度的鲁棒性与自适应性。

参考文献

[1]

Du Y, Wang T, Xin B, Wang L, Chen Y, Xing L. A data-driven parallel scheduling approach for multiple agile Earth observation satellites. IEEE Trans Evol Comput 2020;24(4):679‒93. . 10.1109/tevc.2019.2934148

[2]

Li F, Yu H, Ding R, Wang N, Wang Y, Zhou Z. Development strategy of space internet constellation system in China. Strateg Stud Chin Acad Eng 2021;23(4):137‒44. Chinese. . 10.15302/j-sscae-2021.04.016

[3]

Sun Y, Peng M, Zhang S, Lin G, Zhang P. Integrated satellite‒terrestrial networks: architectures, key techniques, and experimental progress. IEEE Netw 2022;36(6):191‒8. . 10.1109/mnet.106.2100622

[4]

Ding F, Bao C, Zhou D, Sheng M, Shi Y, Li J. Toward autonomous resource management architecture for 6G satellite‒terrestrial integrated networks. IEEE Netw 2024;38(2):113‒21. . 10.1109/mnet.2024.3354308

[5]

Kuang L, Sun J, Zhang J, Cui H, Liu K. Towards space-based computing infrastructure network: development trends, network architecture, challenges analysis, and key technologies. 2025. arXiv:

[6]

Wang Q, Chen S, Yang C, Qi W, Zong J, Xia X, et al. Energy-efficient task split and resource allocation in LEO-satellite-assisted IoT network. IEEE Internet Things J 2024;11(21):34519‒27. . 10.1109/jiot.2024.3441718

[7]

Dai X, Chen X, Jiao L, Wang Y, Du S, Min G. Priority-aware task offloading and resource allocation in satellite and HAP assisted edge‒cloud collaborative networks. In: Proceedings of the 15th International Conference on Communication Software and Networks; 2023 Jul 21‒23; Shenyang, China. New York City: IEEE; 2023. p. 166‒71. . 10.1109/iccsn57992.2023.10297374

[8]

Hao Y, Song Z, Zheng Z, Zhang Q, Miao Z. Joint communication, computing, and caching resource allocation in LEO satellite MEC networks. IEEE Access 2023;11:6708‒16. . 10.1109/access.2023.3237701

[9]

Liu J, Zhao X, Qin P, Geng S, Meng S. Joint dynamic task offloading and resource scheduling for WPT enabled space‒air‒ground power Internet of Things. IEEE Trans Netw Sci Eng 2022;9(2):660‒77. . 10.1109/tnse.2021.3130251

[10]

Qin P, Zhao H, Fu Y, Geng S, Chen Z, Zhou H. Energy-efficient resource Al location for space‒air‒ground integrated industrial power Internet of Things network. IEEE Trans Industr Inform 2024;20(4):5274‒84. . 10.1109/tii.2023.3331127

[11]

Chen Z, Zhang J, Zheng X, Min G, Li J, Rong C. Profit-aware cooperative offloading in UAV-enabled MEC systems using lightweight deep reinforcement learning. IEEE Internet Things J 2024;11(12):21325‒36. . 10.1109/jiot.2023.3331722

[12]

Chen Z, Huang S, Min G, Ning Z, Li J, Zhang Y. Mobility-aware seamless service migration and resource allocation in multi-edge IoV systems. IEEE Trans Mob Comput 2025;24:6315‒32. . 10.1109/tmc.2025.3540407

[13]

Chen Z, Jiang Q, Chen L, Chen X, Li J, Min G. MC-2PF: a multi-edge cooperative universal framework for load prediction with personalized federated deep learning. IEEE Trans Mob Comput 2025;24(6):5138‒54. . 10.1109/tmc.2025.3528404

[14]

Chen Z, Liang J, Yu Z, Cheng H, Min G, Li J. Resilient collaborative caching for multi-edge systems with robust federated deep learning. IEEE Trans Net 2025;33(2):654‒69. . 10.1109/tnet.2024.3497958

[15]

Jin Y, Yao H, Mai T. Double auction game-based computing resource allocation in LEO satellite system. In: Proceedings of the 2020 International Wireless Communications and Mobile Computing; 2020 Jun 15‒19; Limassol, Cyprus. New York City: IEEE; 2020. p. 274‒9. . 10.1109/iwcmc48107.2020.9148261

[16]

Gao Y, Liu J, Geng S, Zhao X, Chen Z, Zhou H. Edge computing task offloading based on game theory for space‒air‒ground integrated network. In: Proceedings of the 6th International Conference on Communications, Information System and Computer Engineering; 2024 May 10‒12; Guangzhou, China. New York City: IEEE; 2024. p. 627‒31. . 10.1109/cisce62493.2024.10653097

[17]

Fan H, Sun C, Long J, Li L, Huo Y, Wang S. Graph-driven resource allocation strategies in satellite IoT: a cooperative game theoretic approach. IEEE Internet Things J 2025;12(4):3463‒81. . 10.1109/jiot.2024.3407123

[18]

Jia Z, Sheng M, Li J, Zhou D, Han Z. Joint HAP access and LEO satellite backhaul in 6G: matching game-based approaches. IEEE J Sel Areas Commun 2021;39(4):1147‒59. . 10.1109/jsac.2020.3018824

[19]

Qin P, Wang M, Cai Z, Ding R, Zhao X, Yang F, et al. Optimal resource allocation for AGIN 6G: a learning-based three-sided matching approach. IEEE Trans Netw Sci Eng 2024;11(2):1553‒65. . 10.1109/tnse.2023.3325356

[20]

Hu Z, Han C, Gerstacker W, Akyildiz IF. Tera-SpaceCom: GNN-based deep reinforcement learning for joint resource allocation and task offloading in terahertz band space networks. 2024. arXiv:

[21]

Meng X, Wu L, Yu S. Research on resource allocation method of space information networks based on deep reinforcement learning. Remote Sens 2019;11(4):448. . 10.3390/rs11040448

[22]

Liu J, Wang Y, Dai F, Wang C. Resource allocation strategy of space cloud network based on resource clustering. Int J Commun Syst 2024;37(14):e5862. . 10.1002/dac.5862

[23]

Wang Y, Liu J, Yin Y, Tong Y, Liu J. Space information network resource scheduling for cloud computing: a deep reinforcement learning approach. Wirel Commun Mob Comput 2022 Jan:1927937.

[24]

Chen Z, Hu J, Min G, Zomaya AY, El-Ghazawi T. Towards accurate prediction for high-dimensional and highly-variable cloud workloads with deep learning. IEEE Trans Parallel Distrib Syst 2020;31(4):923‒34. . 10.1109/tpds.2019.2953745

[25]

Chen Z, Xiong B, Chen X, Min G, Li J. Joint computation offloading and resource allocation in multi-edge smart communities with personalized federated deep reinforcement learning. IEEE Trans Mobile Comput 2024;23(12):11604‒19. . 10.1109/tmc.2024.3396511

[26]

Chen Z, Hu J, Min G, Luo C, El-Ghazawi T. Adaptive and efficient resource allocation in cloud datacenters using actor‒critic deep reinforcement learning. IEEE Trans Parallel Distrib Syst 2022;33(8):1911‒23. . 10.1109/tpds.2021.3132422

[27]

Chen Z, Huang Z, Zhang J, Cheng H, Li J. Resource allocation and collaborative offloading in multi-UAV-assisted IoV with federated deep reinforcement learning. IEEE Internet Things J 2025;12(5):4629‒40. . 10.1109/jiot.2024.3516838

[28]

Chen Z, Zhang J, Min G, Ning Z, Li J. Traffic-aware lightweight hierarchical offloading toward adaptive slicing-enabled SAGIN. IEEE J Sel Areas Commun 2024;42(12):3536‒50. . 10.1109/jsac.2024.3459020

[29]

Li L, Chu W, Langford JJ, Schapire RE. A contextual-bandit approach to personalized news article recommendation In: Proceedings of the 19th International Conference on World Wide Web; 2010 Apr 26‒30; NorthRaleigh, CA, USA. New York City: Association for Computing Machinery (ACM); 2010. p. 661‒670. . 10.1145/1772690.1772758

[30]

Yang M, Li Q, Qin Z, Ye J. Hierarchical adaptive contextual bandits for resource constraint based recommendation. In: Proceedings of the Web Conference 2020; 2020 Apr 20‒24; Taipei, China. New York City: Association for Computing Machinery (ACM); 2020. p. 292‒302. . 10.1145/3366423.3380115

[31]

Baheri A. Multilevel constrained bandits: a hierarchical upper confidence bound approach with safety guarantees. Mathematics 2025;13:149. . 10.3390/math13010149

[32]

Hanna OA, Yang LF, Fragouli C. Learning in distributed contextual linear bandits without sharing the context. 2022. arXiv:10.52202/068431-0803

[33]

Li Y, Mu Z, Qi S. A contextual combinatorial bandit approach to negotiation. 2024. arXiv:

[34]

Feng Y, Shen H, Shan Z, Yang Q, Shi X. Semantic communication for edge intelligence enabled autonomous driving system. 2024. arXiv: 10.1109/mnet.2024.3468328

[35]

Liu S, Wen D, Li D, Chen Q, Zhu G, Shi Y. Energy-efficient optimal mode selection for edge AI inference via integrated sensing-communication-computation. IEEE Trans Mobile Comput 2024;23(12):14248‒62. . 10.1109/tmc.2024.3440581

[36]

Yang Z, Chen M, Zhang Z, Huang C. Energy efficient semantic communication over wireless networks with rate splitting. IEEE J Sel Areas Commun 2023;41(5):1484‒95. . 10.1109/jsac.2023.3240713

[37]

Xu W, Yang Z, Ng DWK, Levorato M, Eldar YC, Debbah M. Edgelearning for B5G networks with distributed signal processing: semantic communication, edge computing, and wireless sensing. IEEE J Sel Top Signal Process 2023;17(1):9‒39. . 10.1109/jstsp.2023.3239189

[38]

Wang Y, Yang C, Yu Y, Li Y, Li D, Zhao X, et al. A brief survey and implementation on network-level intent decomposition for telecommunication networks. IEEE Commun Mag 2025;63(7):178‒86. . 10.1109/mcom.001.2400472

[39]

Cui L, Jia W. Cyclic stable matching for three-sided networking services. Comput Netw 2013;57:351‒63. . 10.1016/j.comnet.2012.09.021

[40]

Roth AE. The evolution of the labor market for medical interns and residents: a case study in game theory. J Polit Econ 1984;92(6):991‒1016. . 10.1086/261272

[41]

Leng T, Li X, Hu D, Cui G, Wang W. Collaborative computing and resource allocation for LEO satellite-assisted Internet of Things. Wirel Commun Mob Comput 2021 Sep:4212548.

[42]

Lyu T, Xu H, Liu F, Li M, Li L, Han Z. Two layer stackelberg game-based resource allocation in cloud‒network convergence service computing. IEEE Trans Cogn Commun Netw 2024;10(6):2412‒26. . 10.1109/tccn.2024.3392809

[43]

Ding Y, Li K, Liu C, Li K. A potential game theoretic approach to computation offloading strategy optimization in end‒edge‒cloud computing. IEEE Trans Parallel Distrib Syst 2022;33(6):1503‒19. . 10.1109/tpds.2021.3112604

AI Summary AI Mindmap
PDF (3293KB)

Supplementary files

supplementary data

11639

访问

0

被引

详细

导航
相关文章

AI思维导图

/