本发明属于无线通信领域,涉及一种基于深度强化学习的irs-swipt系统资源分配方法。
背景技术:
1、为满足低功耗和能源受限的物联网设备提供连续信息传输和能量传输的要求,无线携能通信(simultaneous wireless information and power transfer,swipt)技术作为一种新兴技术引起了很大的关注,通过应用swipt,物联网设备可以同时获取信息和能量,便于能量受限的物联网设备的部署。
2、智能反射面(intelligent reflecting surface,irs)是由多个重构无源反射元件构成的平面阵列,以一个软件控制器协调其工作模式,其中每个元件均可以控制入射电磁波的反射角和反射强度,从而实现对反射信号的相位和幅度进行控制,使反射电磁波独立产生相移,形成满足差异化通信需求的三维无源波束。其中,irs各元素单元接入到一个控制器,由控制器统一控制,使智能反射面可以重新配置无线传播环境,从而提高无线通信网络性能的自由度。irs通过控制器实时调节各元件相移来反射信号,该发射信号可以增强接收端的接收功率同时削弱窃听者的接收功率,从而提高系统的安全性。例如,在无线通信网络中,通过部署irs来智能协调其反射来解决无线信道的衰落和干扰问题。对于联合上行链路和下行链路通信,无源irs往往比有源irs实现更高的加权和速率,分别优化irs放置,因为最优有源irs放置需要平衡上行链路的速率性能和下行链路,而在发射器或接收器附近部署无源irs对上行链路和下行链路都是最佳的。因此,基于其无源器件功耗低的显著特点,irs在提高无线通信系统的频谱和能量效率方面受到越来越多的关注。
3、目前,虽然对于ps架构的irs-swipt系统有一定的研究结果,但在多参数联合优化方面求解困难且具有很高的复杂度,一定程度上限制了系统频谱资源及设备能量的提升。传统采用ps架构的irs-swipt系统主要是交替优化方法。然而,由于系统信道的多样性,传统方法只能适用于单一的模型环境,难以处理复杂场景下的资源分配。得益于深度强化学习(deep reinforcement learning,drl)的快速发展和设备处理能力的提升,深度学习在无线通信中的应用成为了一大热点,并已成功解决了许多非凸优化问题。相对于传统的迭代算法,深度学习算法通过神经网络等技术,可以有效地处理复杂的数学转换,降低计算复杂度,成为解决通信中优化问题的一种有力工具。
技术实现思路
1、有鉴于此,本发明的目的在于提供一种基于深度强化学习的irs-swipt系统资源分配方法,通过深度学习算法处理复杂的数学转换问题,降低分配策略的计算复杂度,提高处理效率。
2、为达到上述目的,本发明提供如下技术方案:
3、一种基于深度强化学习的irs-swipt系统资源分配方法,其特征在于:该方法包括以下步骤:
4、s1、建立irs辅助的swipt系统传输模型,具体地,在该模型中,基站的发射天线数量为m,irs反射元件数量为n,能量受限设备数量为k;基站能够同时将信号和能量信号传输至所述能量受限设备;所述irs部署在能量受限设备附近;
5、s2、以能量受限设备最大化和速率为目标函数,考虑基站的最大发射功率约束、功率分割系数、最小能量收集约束以及智能反射面相移约束,建立一个联合优化基站发射波束设计、能量受限设备功率分割比系数和智能反射面相移设计的资源分配模型;
6、s3、将能量受限设备和速率最大化问题划分为发射波束成形和智能反射面相移设计联合优化以及功率分割比决策两个子问题;
7、s4、利用深度确定性策略梯度算法(deep deterministic policy gradient,ddpg)解决发射波束成形和智能反射面相移设计子问题;
8、s5、利用粒子群优化算法(particle swarm optimization,pso)来求解功率分割比决策子问题。
9、进一步的,步骤s2中,能量受限设备和速率最大化问题表示为:
10、
11、s.t.c1:
12、c2:
13、c3:
14、c4:|θn|=1
15、式中,wk表示第k个能量受限设备的波束矢量;ρk表示能量受限设备功率分割比系数;θ表示irs相移矩阵,θ=diag(θ1,θ2,...,θn),为第n个元素的相移;rk表示第k个能量受限设备的数据速率;pmax表示基站的最大发射功率;ηk表示第k个能量受限设备的能量转换效率;hk表示从基站到k个能量受限设备的等效信道增益,hbr表示基站到irs的信道增益,hb,k、hr,k分别表示基站和irs到第k个能量受限设备的信道增益;μk表示最小存储能量门限;约束c1为限制基站的最大传输功率,约束c2为保证设备最小存储能量,约束c3为每个终端设备的功率分割比界限,约束c4为智能反射面的相移约束。
16、进一步的,步骤s4中,以基站的中央控制器为智能体,以irs-swipt系统为环境信息,利用深度确定性策略梯度算法求解子问题;在该算法中,定义动作空间为:
17、a(t)={w(t),θ(t)}
18、式中,w表示发射波束成形矩阵;
19、定义状态空间为:
20、s(t)={h,a(t-1),sinrk(t)}
21、式中,h表示环境中的信道状态信息,h={hbr,hbu,hru},hbr表示基站与irs间的信道信息矩阵,hbu表示基站与用户间的信道信息矩阵,hru表示irs与用户间的信道信息矩阵;sinrk(t)表示k个能量受限设备的信干噪比;
22、定义奖励为:
23、
24、
25、式中,表示系统可实现和速率,表示能量存储约束,λ表示惩罚系数,用于判断能量受限设备是否存储到最小运行能量。
26、进一步的,步骤s5中,通过深度确定性策略梯度算法求解得到发射波束成形矩阵w和irs相移矩阵θ后,将能量受限设备的和速率最大化问题转化为:
27、
28、s.t.c2:
29、c3:
30、σk表示加性高斯白噪声的方差;δk表示信息解码产生的噪声的方差;再采用粒子群优化算法求解上述问题,得到每个能量受限设备的最优功率分割比系数。
31、进一步的,综上所述,本发明采用深度确定性策略梯度算法和粒子群优化算法求解的过程包括:
32、1)输入信道信息hbr、hb,k、hr,k;
33、2)初始化经验回放池大小为dm,初始化critic网络参数θq、actor网络参数θa、target-critic网络参数和target-actor网络参数w、θ初始化为单位矩阵;
34、3)for episode=1,2,…,ndo,ndo表示最大迭代次数;
35、4)hbr,hb,k,hr,k,sinrk组成首状态s(0);
36、5)for step=1,2,…,tdo,tdo表示最大迭代次数;
37、6)由actor网络获得动作a(t)={w(t),θ(t)};
38、7)由动作a(t)获得状态s(t+1);
39、8)将a(t)输入粒子群优化算法中得到ρ(t);
40、9)由a(t)与ρ(t)计算出r(t);
41、10)将s(t),a(t),r(t),s(t+1)存储在经验回放池
42、11)更新critic网络参数θq;
43、12)更新actor网络参数θa;
44、13)更新target-critic网络参数
45、14)更新target-actor网络参数
46、15)更新状态s(t)=s(t+1);
47、16)直到收敛。
48、本发明的有益效果在于:本发明相对于传统的迭代算法,采用深度学习算法、神经网络等技术,可以有效地处理复杂的数学转换,且适用于其他相似模型,具有广泛应用前景,其能够降低计算复杂度,加快问题求解速度。
49、本发明的其他优点、目标和特征在某种程度上将在随后的说明书中进行阐述,并且在某种程度上,基于对下文的考察研究对本领域技术人员而言将是显而易见的,或者可以从本发明的实践中得到教导。本发明的目标和其他优点可以通过下面的说明书来实现和获得。
1.一种基于深度强化学习的irs-swipt系统资源分配方法,其特征在于:该方法包括以下步骤:
2.根据权利要求1所述的irs-swipt系统资源分配方法,其特征在于:步骤s2中,能量受限设备和速率最大化问题表示为:
3.根据权利要求1所述的irs-swipt系统资源分配方法,其特征在于:步骤s4中,以基站的中央控制器为智能体,以irs-swipt系统为环境信息,利用深度确定性策略梯度算法求解子问题;在该算法中,定义动作空间为:
4.根据权利要求1所述的irs-swipt系统资源分配方法,其特征在于:步骤s5中,通过深度确定性策略梯度算法求解得到发射波束成形矩阵w和irs相移矩阵θ后,将能量受限设备的和速率最大化问题转化为:
5.根据权利要求1~4中任一项所述的irs-swipt系统资源分配方法,其特征在于:采用深度确定性策略梯度算法和粒子群优化算法求解的过程包括:
