来源:市场资讯

(来源:智慧农业期刊)

引用格式:李萌浩, 王小荣, 刘子贺, 段孟渝, 金正阳. DEMA-3D TSP: 一种应用在红花采摘机器人序列规划的融合DEMA注意力机制强化学习算法[J]. 智慧农业(中英文), 2026, 8(2): 200-219.

DOI: 10.12133/j.smartag.SA202506004

Citation: LI Menghao, WANG Xiaorong, LIU Zihe, DUAN Mengyu, JIN Zhengyang. DEMA-3D TSP: An Enhanced Reinforcement Learning with DEMA Attention in Sequence Optimization for Safflower Picking Robot[J]. Smart Agriculture, 2026, 8(2): 200-219.

DOI: 10.12133/j.smartag.SA202506004

DEMA-3D TSP: 一种应用在红花采摘机器人序列规划的融合DEMA注意力机制强化学习算法

李萌浩1, 王小荣1,2,3*, 刘子贺1, 段孟渝1, 金正阳1

(1.新疆大学机械工程学院,新疆乌鲁木齐 830017,中国; 2.新疆维吾尔自治区农牧机器人及智能装备工程研究中心,新疆乌鲁木齐 830017,中国;3.新疆大学工程训练中心,新疆乌鲁木齐 830017,中国)

摘要:

[目的/意义]红花自动化采摘中存在多个关键难题,尤其是路径规划效率低、路线质量欠佳,以及在动态复杂环境下决策能力受限等问题。为应对上述挑战,将采摘路径规划任务建模为三维旅行商问题,并提出了一种改进的强化学习框架演员-评论家强化学习指针网络(Actor-Critic Reinforcement Learning Pointer Network AC-RL-PtrNet)。该模型专为农业环境下的智能红花采摘机器人设计,可实现高效的路径优化与决策控制。

[方法]首先,为克服传统注意力机制在复杂空间结构和动态环境中的固有局限性,提出了一种基于动态指数移动平均框架的增强型注意力模块。该模块融合了多头注意力、空间距离编码和自适应指数平滑机制,使模型能够更充分地捕捉红花目标间的长程依赖关系与空间上下文特征。同时,为在保持推理精度的条件下降低计算开销,采用了结构化剪枝方法,对长短期记忆网络的门控单元及全连接层中的冗余连接进行选择性移除。在此基础上,对评论家网络进行了重新设计,引入了批归一化、残差特征聚合,以及多层价值估计头,从而提升学习稳定性与预测精度,并增强了策略训练过程中演员-评论家(Actor-Critic)之间的协同效果。

[结果和讨论]为定量评估各模块的性能影响,设计并开展了多组消融实验。结果表明,各功能模块均能带来独立的性能提升,而其组合使用则在路径规划精度与推理效率方面取得了最优表现。该协调的Actor-Critic设计有效提升了轨迹质量与决策稳定性,这对于序列式机器人采摘任务尤为关键。与传统群体智能算法相比,所提出的AC-RL-PtrNet模型在25个目标采摘任务中实现了-2.63%~61.87%的规划时间提升,在31个目标任务中提升幅度为22.93%~59.10%。同时,不同规划实例下的路径长度均显著缩短,表明该模型在不同问题规模下具备良好的泛化与稳定性能。田间实测结果进一步验证了其实际应用效果:在真实红花采摘环境中,AC-RL-PtrNet在25个目标任务中实现路径长度减少9.56%、时间缩短5.43%;在31个目标任务中路径减少20.17%、时间节省29.70%。

[结论]本研究提出的基于强化学习的结构化路径规划方法在路径规划效率提升与路线质量优化方面均展现出显著优势,为红花采摘机器人在复杂动态环境下实现高效与稳健的自主采摘提供了切实可行的技术方案,同时为解决三维组合优化类问题提供了新的研究思路与方法论支持。

关键词:动态指数移动平均机制;结构化剪枝;强化学习;三维旅行商问题;红花采摘;机器人

打开网易新闻 查看精彩图片

Fig. 1 Flowchart of safflower picking by parallel robot

打开网易新闻 查看精彩图片

Fig. 2 Workflow of vision-based safflower recognition and localization system

打开网易新闻 查看精彩图片

Fig. 3 The process of modelling input to output of AC-RL-PrtNet

打开网易新闻 查看精彩图片

Fig. 4 An interactive actor-critic decision framework for 3D safflower picking tasks

打开网易新闻 查看精彩图片

Fig. 5 Computational flow of the DEMA attention mechanism

打开网易新闻 查看精彩图片

Fig. 6 Iterative convergence comparison of various attention mechanisms against the

baseline

打开网易新闻 查看精彩图片

Fig. 7 Path length gap of different models at different test points

打开网易新闻 查看精彩图片

Fig. 8 Field experiment setup and example planning results for 25 and 31 safflower blossoms

打开网易新闻 查看精彩图片

Fig. 9 Comparison of safflower picking sequence planning on 25 and 31 flowers

作者介绍

打开网易新闻 查看精彩图片

王小荣 高级工程师

王小荣,新疆大学硕士研究生导师,工学博士,高级工程师,新疆维吾尔自治区农牧机器人及智能装备工程研究中心成员,自治区创新方法宣讲团讲师,校级教学能手。研究方向农业机器人技术,环境感知与识别技术以及任务规划与协同控制。近五年主持自治区自然科学基金青年基金1项、教育部产学合作协同育人项目1项,参与自治区纵向项目6项、横向项目4项,发表论文20余篇,授权实用新型专利 12项,软件著作权8项。

转载请联系编辑部授权

本期支持单位

特别支持单位

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

支持单位

打开网易新闻 查看精彩图片