Please wait a minute...

当期目录

    2026年 第44卷 第4期    刊出日期:2026-07-31
    上一期   
    目录
    中文目录
    2026, 44(4):  0-0. 
    摘要 ( 8 )   PDF (80KB) ( 18 )  
    相关文章 | 多维度评价
    英文目录
    2026, 44(4):  1-1. 
    摘要 ( 4 )   PDF (49KB) ( 2 )  
    相关文章 | 多维度评价
    智能视觉感知
    激光雷达同步定位与建图研究综述
    段旭哲, 钟若飞, 李健, 付晶, 赵鹏程, 李加元, 艾明耀, 胡庆武
    2026, 44(4):  515-536.  doi:10.3969/j.issn.0255-8297.2026.04.001
    摘要 ( 18 )   PDF (1771KB) ( 5 )  
    参考文献 | 相关文章 | 多维度评价
    本文系统梳理了近十年来激光雷达同步定位与建图(simultaneous localization and mapping,SLAM)技术的发展脉络。首先对SLAM问题给出通用的数学定义,以此建立统一的分析框架。随后按照平台数量将相关研究归纳为单平台激光雷达SLAM与多平台协同激光雷达SLAM两大类别。在单平台部分,重点总结了以激光雷达为核心的多传感器融合方法;在多平台部分,概述了当前较为成熟的协同SLAM系统及其关键特征。同时讨论了激光雷达SLAM在复杂场景、退化环境、多模态数据源及多平台协同下所面临的挑战与发展机遇。最后结合当前研究热点,对激光雷达SLAM未来的技术演进趋势进行了展望,分析了深度学习在激光雷达SLAM中的主要应用形式,并概述了神经辐射场和三维高斯泼溅等新型地图表达在建图质量与表示能力方面的潜在价值。
    激光SLAM多传感器仿真系统构建
    李凯心, 许志宏, 孙振兴, 钟若飞
    2026, 44(4):  537-552.  doi:10.3969/j.issn.0255-8297.2026.04.002
    摘要 ( 18 )   PDF (3699KB) ( 5 )  
    参考文献 | 相关文章 | 多维度评价
    激光同步定位与地图构建(simultaneous localization and mapping,SLAM)数字仿真为移动测量系统的研发提供了高效、可控且可复现的虚拟测试环境,可大幅减少对复杂外业测试的依赖。然而,现有方法多依赖三维建模,面临建模成本高、几何失真及难以同步生成多传感器数据等问题。为此,本文提出了一种基于真实点云直接驱动的激光SLAM的移动测量数字仿真系统构建方法。直接将原始激光点云数据转化为具有真实场景特征的虚拟环境,通过对激光雷达与惯性测量单元核心传感器进行逆向数字建模,并采用稀疏体素网格索引与光线投射算法,来模拟传感器在采集轨迹上的行为与状态变化。系统支持B样条曲线轨迹自主规划及扫描分辨率、视场角等参数的灵活配置,能够同步生成具有时空一致性的激光雷达原始数据与惯性测量单元数据。实验结果表明:相较于传统建模的仿真方法,本文方法显著降低了场景搭建的成本与技术门槛,同时,在相同场景与采集轨迹条件下,点云几何误差即均方根误差和平均绝对误差较对比方法分别下降约18%~33%、40%~48%,表明该方法能有效解决传统建模的高门槛问题,为SLAM算法评估及设备研发提供高几何保真度的虚拟测试手段。
    基于LiDAR数据的山地遗址公园景点可视性评价——以褒斜栈道遗址公园为例
    李亦凡, Anna Mária Csergő, 陈智鹏, 梁安邦, 李永荣, 张栩婕
    2026, 44(4):  553-570.  doi:10.3969/j.issn.0255-8297.2026.04.003
    摘要 ( 11 )   PDF (10144KB) ( 35 )  
    参考文献 | 相关文章 | 多维度评价
    遗址公园可视性设计是落实“体验为重”规划要求的关键,直接影响文化遗产价值传播。针对传统方法难以精准捕捉山地遗址三维空间特征的问题,以褒斜栈道遗址公园为例,建立基于LiDAR数据的可视性分析与评价体系。采用“数据采集—预处理—模型构建—通视分析—量化评价—优化建议”技术流程,通过背包式LiDAR系统采集数据,构建精度≤5 cm的三维体素模型,在此基础上,选取三维可视性、视野舒展度、视野内地物类型占比3项核心指标开展量化分析。结果表明:3个核心景点的可视性差异显著,其中栈道横梁景点H1的可视性最优(最佳视点的三维可视性为1.000);栈孔景点Z1受植被与地形的重度遮挡,三维可视性均值仅为0.044;Z2景点的可视性呈显著空间分化,其近景点均值达到0.708,远景点均值仅为0.056,整体均值为0.251。此外,地形、植被(含高大乔木、低矮灌木)、遗址位置、观景设施是影响可视性的四大关键因素。研究提出的优化建议可为遗址公园规划及同类研究提供技术支撑。
    上下文感知与模态对齐增强的语音翻译方法
    杨松涛, 高盛祥, 欧阳飞, 余正涛
    2026, 44(4):  571-584.  doi:10.3969/j.issn.0255-8297.2026.04.004
    摘要 ( 39 )   PDF (815KB) ( 19 )  
    参考文献 | 相关文章 | 多维度评价
    针对语音翻译任务中模态对齐模块对语音表征上下文信息感知不足的问题,提出了一种上下文语义增强型语音转文本的翻译方法。在语音表征基础上,引入基于局部窗口方差感知与相似度度量的上下文语义重组机制,对帧级语音表征进行语义感知的表征压缩,以获得上下文语义增强的语音最终表示。同时引入全局知识模态适配器,进一步实现语音上下文表征与文本的模态对齐。最终,将融合后的多模态表征输入至语音大模型解码器,由其解码生成目标语言的翻译文本。实验结果表明,该方法可有效提取包含上下文语义信息的语音表征,并在下游翻译任务中取得更优的性能。
    一种基于GMM的石质文物点云病害检测方法
    张嘉敏, 崔昊, 吕红医, 焦建辉
    2026, 44(4):  585-597.  doi:10.3969/j.issn.0255-8297.2026.04.005
    摘要 ( 19 )   PDF (2453KB) ( 6 )  
    参考文献 | 相关文章 | 多维度评价
    石质文物作为文明的重要物质载体,其表面病害检测是文化遗产预防性保护的核心任务之一。然而,面对表面纹理复杂、风化程度不一的点云数据,现有检测分割算法存在两方面不足:1)传统硬阈值方法依赖人工调参、适应性差;2)人工纹理与自然病害在几何特征上高度相似,导致分割过程中两者易粘连混淆。为此,本文提出一种融合统计模型与几何拓扑分析的自动化检测方法。该方法首先选取几何粗糙度与颜色一致性构建二维特征向量,通过高斯混合模型实现无监督自适应异常提取,替代传统依赖人工调参的硬阈值方法;随后提出多约束的局部凸包连接片(locally convex connected patches,LCCP)分割算法,通过引入正交距离约束与法向夹角约束,从几何拓扑层面解决纹理与病害的分割粘连问题,并进行后处理优化分割结果。在3处典型病害与纹理粘连测试区上验证可知,本文方法相较于传统LCCP算法与区域生长算法,精确率、F1值和交并比等指标均全面提升,3个测试区F1值分别达到0.915 8、0.906 3和0.926 0,有效解决纹理与病害的粘连难题,为石刻文物病害数字化检测提供了可靠方案。
    遥感影像小目标检测方法与应用
    王宇帆, 邵子龙, 蒲媛雪, 章昊文, 张静怡, 秦昆
    2026, 44(4):  598-614.  doi:10.3969/j.issn.0255-8297.2026.04.006
    摘要 ( 16 )   PDF (5886KB) ( 12 )  
    参考文献 | 相关文章 | 多维度评价
    遥感影像小目标检测是遥感与计算机视觉领域的核心问题之一,对遥感场景智能理解、遥感影像智能解译等具有关键作用。受目标像素占比低、场景复杂多变等因素影响,遥感影像小目标检测面临目标特征提取困难、易受噪声与遮挡干扰、边界框回归精度要求严苛、专用数据集稀缺、模型设计适配性不足等多重挑战。本文系统梳理了遥感影像小目标检测的技术难点及瓶颈,分析了传统遥感图像处理检测方法、基于数据集增强的检测方法、基于分辨率增强的检测方法、基于特征融合与注意力机制的检测方法、基于Transformer的检测方法、基于无锚框技术的检测方法等6类主流检测方法,详细分析了各类方法的技术原理、核心创新点与适用场景,总结了遥感小目标数据集的特性、标注规格与应用价值,分析了遥感小目标检测技术在舰船及航标检测、车辆检测、军事目标检测等领域的应用。最后展望了遥感小目标检测的多模态融合、轻量化架构、小样本学习等未来发展方向。
    融合视觉场景理解与常识推理的零样本目标导航
    周飞宇, 张星
    2026, 44(4):  615-625.  doi:10.3969/j.issn.0255-8297.2026.04.007
    摘要 ( 7 )   PDF (4162KB) ( 5 )  
    参考文献 | 相关文章 | 多维度评价
    针对现有零样本导航方法难以同时满足复杂指令理解与高效视觉搜索的问题,提出一种融合大语言模型双层级常识推理与视觉语言模型环境感知协同的零样本目标导航框架。通过模块化设计,将大语言模型定位为常识推理机,从自然语言指令中解析目标并生成“房间-物体”双层级空间搜索先验。将视觉语言模型作为实时场景解释器,依据该先验进行语义匹配并输出局部语义价值。二者协同构建语义价值地图,实现常识引导的全局搜索与视觉驱动的局部定位的有机统一。实验结果表明,所提方法在导航成功率与路径效率上有所提升。在导航效率指标上表现突出,验证了大语言模型空间先验推理对提升搜索效率的有效性。该框架在零样本设定下实现了感知的实时性与常识泛化性的深度结合,为开放场景下的智能导航提供了兼具高效性、准确性与实用性的解决方案。
    视觉感知的投影式三维语义分割后处理方法
    邹国镜, 丛铭, 崔建军, 韩玲
    2026, 44(4):  626-643.  doi:10.3969/j.issn.0255-8297.2026.04.008
    摘要 ( 10 )   PDF (9141KB) ( 5 )  
    参考文献 | 相关文章 | 多维度评价
    投影式三维语义分割方法能够有效降低三维数据处理复杂度与计算开销,但现有方法大多依赖RGB颜色空间进行特征提取,易受光照变化、阴影干扰以及类别颜色相似性的影响,导致分割精度受限。针对上述问题,本文受人类视觉系统颜色感知机制启发,提出一种基于多颜色空间后处理的投影式三维语义分割方法。首先,通过二维投影与栅格化处理将三维场景转换为二维规则影像,并利用深度学习模型获得初始分割结果;其次,在低置信度区域引入更符合人类视觉感知特性的Lab与HSV颜色空间特征进行聚类优化,以提升类别可分性与区域一致性;再次,结合二维–三维映射关系,将优化后的语义标签恢复至三维场景,实现高精度语义标注。实验结果表明,本文方法在4组复杂城市场景数据上均取得较好的分割效果。相较传统聚类方法,总体分类精度(overall accuracy,OA)平均提升约21%,Kappa系数平均提升约0.28;相较单纯深度学习方法,OA平均提升约5%,Kappa系数平均提升约0.07。结果表明,该方法能够有效提升复杂场景下三维语义分割的精度与稳定性。
    森林点云的三维场景图表达与LLM应用
    彭锦鸿, 陈茂霖, 薛梅, 李汝峰
    2026, 44(4):  644-656.  doi:10.3969/j.issn.0255-8297.2026.04.009
    摘要 ( 8 )   PDF (2843KB) ( 4 )  
    参考文献 | 相关文章 | 多维度评价
    三维激光扫描技术已成为林业调查中获取高精度林分参数的重要手段,但基于海量激光点云的森林三维场景表达依赖专业软件处理,且主要关注对象级语义理解,缺少要素关系信息的显示表达。针对于此,提出了一种面向森林场景的三维场景图概念模型,系统介绍了森林场景的要素分层分类、几何描述、语义表达及关系描述方法。在此基础上,将三维场景图与语义关联分析相结合,引入大语言模型作为查询与分析工具,设计了三级通用评估框架,对比评估了ChatGPT-4o、DeepSeek-R1和Grok4的运行速度、输入限制和可视化效果等方面,探讨了该模型的效能、潜力和局限性。基于公开点云数据集ForestSemantic的实验结果表明:三维场景图在森林场景具有良好的数据承载能力,能够有效组织和联系森林关系;Grok4的准确率在90%以上,优于其余两种大语言模型。本研究可为林业资源的空间表达与分析、经营管理与决策制定提供辅助。
    文本视觉融合的全参考屏幕内容图像质量评价
    张尹, 杨超, 安平, 黄新彭
    2026, 44(4):  657-668.  doi:10.3969/j.issn.0255-8297.2026.04.010
    摘要 ( 11 )   PDF (714KB) ( 3 )  
    参考文献 | 相关文章 | 多维度评价
    随着互联网技术的快速发展,屏幕内容图像(screen content image,SCI)在网络中的应用日益广泛,其客观质量评价问题已成为研究热点。本文提出一种融合文本完整性与图像感知特征的全参考SCI质量评价方法。针对SCI丰富的文本特性,本文利用光学字符识别(optical character recognition,OCR)技术提取文本内容,并计算字符错误率(character error rate,CER)作为文本完整性特征,同时结合空间、结构以及信息论等多种质量感知特征,采用随机森林学习特征的自适应权重,并通过支持向量回归(support vector regression,SVR)建立融合特征与主观质量分数的映射关系。在两个广泛使用的SCID与SIQAD数据集上的实验结果表明,本文所提方法取得了优异的性能。相较于现有优秀方法,本文方法在SCID数据集上的预测精度提升超2%,更准确地反映了人类视觉系统对屏幕内容的感知特性。
    基于Mamba模式感知的步态检测算法及其在PDR中的应用
    周子毅, 刘德儿, 钟崇林, 王源, 张涛, 邱永康
    2026, 44(4):  669-684.  doi:10.3969/j.issn.0255-8297.2026.04.011
    摘要 ( 15 )   PDF (3890KB) ( 3 )  
    参考文献 | 相关文章 | 多维度评价
    针对步态检测算法在复杂运动模式与多变设备携带姿态条件下易产生漏检与误检的问题,本文提出一种融合Mamba神经网络与有限状态机(finite state machine,FSM)的自适应步态检测算法。通过Mamba网络构建分类模型实现对行人运动模式及手机携带姿态的联合判别,并融合自适应阈值FSM、角速度回溯机制以及基于重力投影的非刚性耦合去噪策略,实现复杂携带条件下步态事件的稳定触发,进一步提升行人航位推算(pedestrian dead reckoning,PDR)在复杂场景下的定位精度与鲁棒性。实验结果表明,所提算法在多种运动模式与手机携带姿态条件下均表现出较高的步态检测准确性,有效抑制了误检与漏检现象,降低了由步态检测环节引入的PDR定位误差。
    基于空频感知与差分互补的语义驱动实时红外可见光融合
    张组军, 甘睿, 李威, 陈九九, 谢宇, 熊邦书
    2026, 44(4):  685-700.  doi:10.3969/j.issn.0255-8297.2026.04.012
    摘要 ( 17 )   PDF (27713KB) ( 10 )  
    参考文献 | 相关文章 | 多维度评价
    针对现有方法全局特征提取受限、跨模态互补特征融合不充分,以及忽视下游视觉任务需求等问题,提出一种基于空频感知与差分互补的语义驱动实时红外可见光融合方法。首先,设计空频双分支感知模块,有效捕捉图像的局部空间细节与全局依赖关系;其次,设计跨模态差分特征互补模块,充分融合不同模态的优势特征;再次,构建语义驱动的联合训练框架,利用语义分割损失引导融合网络保留更多语义信息,从而提高下游高级视觉任务的性能。在RoadScene、MSRS及M3FD公开数据集上的实验结果表明,所提方法与主流方法相比,融合图像的互信息和视觉保真度分别平均提升了3.20%和3.79%;在语义分割任务中,平均交并比提升了2.98%;在目标检测任务中,平均精度均值提升了5.64%。在运行效率方面,处理帧率达到38.99 FPS,满足工程应用的实时性要求。