本发明涉及物流领域,更具体地说,它涉及一种货运车辆位置预测方法、系统及存储介质。
背景技术:
1、托运,是物流的一种形式,指托运人委托具有承运资质的公司将货物运输到指定地点,交给指定收货人的服务。根据托运方式不同,可分为海运托运、陆路托运、空运托运。
2、在处理大件货物陆路托运时,在到达固定的大型中转场后,需要通过工作人员利用货运车辆再进行货物配送,现有均是通过人工自行判断配送优先级进行配送,会造成很多配送的时效无法达标,故需要进行路线优化以确保货物安全、快速到达目的地并减少运输成本。
技术实现思路
1、本发明提供一种货运车辆位置预测方法、系统及存储介质,解决相关技术中现有均是通过人工自行判断配送优先级进行配送,会造成很多配送的时效无法达标,故需要进行路线优化以确保货物安全、快速到达目的地并减少运输成本的技术问题。
2、本发明提供了一种货运车辆位置预测方法,包括以下步骤:
3、步骤101,收集车辆的当前的位置信息以及车辆装载的货物的信息,货物的信息包括货物在所在车辆的车厢中的位置;
4、步骤102,生成智能体,每个智能体绑定一个车辆;
5、步骤103,生成环境,环境包括所有的车站、车辆、货物和车厢,其中车厢被划分为多个装载区域;
6、步骤104,根据车辆的当前的位置信息以及车辆装载的货物的信息生成初始状态;
7、步骤105,输入初始状态,每个智能体根据其对应的策略网络选择行为;执行所有智能体的行为,获得下一个状态;
8、步骤106,初始化时间步为2;
9、步骤107,输入前一个时间步获得的下一个状态,然后每个智能体根据其对应的策略网络选择行为;即对于每个时间步t和每个智能体i,根据策略网络和ε-greedy策略选择行为,执行所有智能体的行为,获得下一个状态;
10、策略网络:智能体的决策核心,接收状态输入,输出行为决策;
11、ε-greedy策略:在训练时探索与利用的权衡策略,ε概率选择随机行为以探索,1-ε概率选择当前最优行为利用已学习的经验;
12、步骤108,如果所有货物均到达目的地则进入下一步骤,否则将时间步累加1,然后返回步骤107;
13、步骤109,根据每个智能体的行为来预测规划每个车辆的移动路径和装卸信息,移动路径包含用于转移货物的车站,装卸信息包括车辆在车站需要执行的货物的装载或卸载操作,装载操作包括货物需要装载到车辆的车厢的具体位置。
14、进一步地,在步骤104中,对于每个货物,记录其当前所在车站、目的地车站、所在车辆和在车厢内的位置;
15、对于每辆车,记录其当前所在车站、下一个目标车站、剩余容量和每个位置的占用情况;
16、对于每个车站,记录其当前等待装载和卸载的货物列表。
17、进一步地,在步骤102中,每辆车都是一个智能体,它们通过观察环境状态和执行行为来优化整个调度过程。
18、进一步地,在步骤103中,包括所有的车站、车辆、货物和车厢,环境接收智能体的行为,更新状态,并给出奖励反馈。
19、进一步地,其中在步骤105中,还包括以下步骤:
20、s201:初始化每个智能体的策略网络和q网络,以及对应的目标网络;
21、s202:初始化经验回放缓冲区d;
22、s203:对于每个训练轮数:
23、首先重置环境,获得初始状态s;
24、接着对于每个时间步t,每个智能体i,根据策略网络和ε-greedy策略选择行为,其中;
25、行为可以是一个复合行为,包括移动方向、移动距离、装载/卸载决策和装载/卸载数量;
26、再执行所有智能体的行为,获得下一个状态,奖励和终止标志done;
27、将转移存入经验回放缓冲区d,其中,如果done,则重置环境,否则;
28、对于每个训练步:
29、从d中随机采样一批转移数据:
30、,对于每个智能体i,计算目标q值:
31、如果done,则,否则:
32、;
33、其中,即根据目标策略网络计算下一个状态的行为,其中;
34、更新q网络,最小化损失:
35、;
36、更新策略网络,最大化目标:
37、,其中;
38、软更新所有智能体的目标网络:
39、
40、
41、其中和分别是q网络和策略网络的参数,是一个小的软更新系数。
42、s204:在测试时,对于每个智能体i,直接使用策略网络来选择行为,不使用ε-greedy策略。
43、其中:
44、:智能体(车辆)的数量;
45、:状态空间,包括所有车辆、货物和车站的状态;
46、:第i个智能体的行为空间;
47、:第i个智能体的观察空间,通常是状态空间的一个子集;
48、:第i个智能体的策略网络,输入观察,输出行为;
49、:第i个智能体的q网络,输入状态和所有智能体的行为,输出q值;
50、d:经验回放池,用于存储智能体与环境的交互数据;
51、:第1个智能体在当前状态下选择的行为;
52、:第i个智能体在当前状态下选择的行为;
53、:第n个智能体在当前状态下选择的行为;
54、:折扣因子,权衡当前奖励和未来奖励的权重;
55、:对应的目标网络,用于计算样本目标值;
56、:第1个智能体在下一个状态下选择的行为;
57、:第j个智能体在下一个状态下选择的行为;
58、:第n个智能体在下一个状态下选择的行为;
59、:第j个智能体的目标策略网络的下一个状态的行为;
60、:第j个智能体的行为空间;
61、:更新q网络的最小化目标值;
62、:更新策略网络的最大化目标。
63、进一步地,使用图神经网络(graph neural network,gnn)优化策略网络,将每个车厢看作一个图,图中的节点表示车厢内的位置,边表示位置之间的连接关系,每个货物也可以表示为一个节点,它与其所在的位置节点相连,整个调度环境可以看作是这些车厢图的集合。
64、进一步地,图神经网络的第一隐藏层的计算公式如下:
65、;
66、;
67、;
68、;
69、表示第i个节点的第二节点矢量,第二节点矢量为更新之后的节点矢量,和分别表示第i和j个节点的第一节点矢量,和分别表示第一和第二权重参数(可训练的参数),表示第一隐藏层的权重矢量的转置(可训练的参数),表示与第i个节点直接连接的节点的集合;
70、表示节点与邻居节点之间的注意力权重,表示第i个节点的第一节点矢量在当前图注意力网络层的节点表示向量,表示第j个节点的第一节点矢量在当前图注意力网络层的节点表示向量。
71、进一步地,图结构数据还包括每个节点对应的第一节点矢量;
72、表示车辆的节点的第一节点矢量根据车辆的车厢的每个存储位置的容量信息编码获得;
73、表示货物的节点的第一节点矢量根据货物所在的车厢的存储位置信息和货物的体积信息编码获得;
74、将图结构数据输入图神经网络,图神经网络包括第一隐藏层和全连接层,第一隐藏层输出每个节点的第二节点矢量,全连接层输入第二节点矢量,输出位置id。
75、一种货运车辆位置预测系统,用于通过货运车辆位置预测方法进行调度策略的生成,包括:
76、数据采集与预处理模块:收集车辆gps位置数据、货物装载和卸载记录、路径规划信息,将采集的数据转换为适合模型训练的图结构;
77、模型训练模块:将预处理后的数据划分为训练集、验证集和测试集,使用训练数据对gnn模型进行训练,并使用验证数据进行超参数调优;
78、在线预测模块:将训练好的模型部署到环境中,该环境是通过实时接收车辆的当前环境信息;
79、调度优化模块:使用策略网络为智能体选择行为进行预测,结合车辆行驶距离、货物搬运工作量和客户满意度信息,生成最优的调度策略。
80、一种存储介质,存储有非暂时性计算机可读指令,用于执行货运车辆位置预测方法中的一个或多个步骤。
81、本发明的有益效果在于:
82、本货运车辆位置可合理选择中转站的位置,使得货物可以在最短的时间内完成中转,减少路程和运输时间,可以有效解决大件货物托运时存在的路线优化问题,提高运输效率,确保货物安全送达目的地。
1.一种货运车辆位置预测方法,其特征在于,包括以下步骤:
2.根据权利要求1所述的一种货运车辆位置预测方法,其特征在于,在步骤104中,对于每个货物,记录其当前所在车站、目的地车站、所在车辆和在车厢内的位置;
3.根据权利要求2所述的一种货运车辆位置预测方法,其特征在于,在步骤102中,每辆车都是一个智能体,它们通过观察环境状态和执行行为来优化整个调度过程。
4.根据权利要求3所述的一种货运车辆位置预测方法,其特征在于,在步骤103中,包括所有的车站、车辆、货物和车厢,环境接收智能体的行为,更新状态,并给出奖励反馈。
5.根据权利要求4所述的一种货运车辆位置预测方法,其特征在于,其中在步骤105中,还包括以下步骤:
6.根据权利要求5所述的一种货运车辆位置预测方法,其特征在于,使用图神经网络优化策略网络,将每个车厢看作一个图,图中的节点表示车厢内的位置,边表示位置之间的连接关系,每个货物也可以表示为一个节点,它与其所在的位置节点相连,整个调度环境可以看作是这些车厢图的集合。
7.根据权利要求6所述的一种货运车辆位置预测方法,其特征在于,图神经网络的第一隐藏层的计算公式如下:
8.根据权利要求7所述的一种货运车辆位置预测方法,其特征在于,图结构数据还包括每个节点对应的第一节点矢量;
9.一种货运车辆位置预测系统,用于通过权利要求1-8任一所述的货运车辆位置预测方法进行调度策略的生成,包括:
10.一种存储介质,存储有非暂时性计算机可读指令,用于执行如权利要求1-8任一所述的货运车辆位置预测方法中的一个或多个步骤。
