学会动态
Member Registration 邮件系统
当前位置:
首页>学会动态
中国图学学会 “奋发图强”博士生Workshop2024年度第四期(总第11期)在华中科技大学顺利举办
文章来源: 发布时间: 2024-12-09 浏览量: 0

       2024年12月1日,由中国图学学会主办,中国图学学会青年工作委员会、动漫图学工程专业委员会、华中科技大学承办的中国图学学会“奋发图强”博士生Workshop2024年度第四期——“以视觉为中心的三维感知与多模态融合”论坛交流会在华中科技大学顺利举办。

参会人合影


       随着人工智能与计算机图学技术的飞速发展,三维感知与多模态融合技术正成为现代智能系统的核心组成部分。以视觉为中心的三维感知不仅能够提供丰富的空间信息,还能够为智能体与环境的互动、物体识别、导航等任务提供强有力的支持。而多模态融合则通过结合视觉、语音、触觉等不同感知通道的优势,进一步提升了智能系统的感知能力与决策效率。本次 “奋发图强”博士生Workshop以“以视觉为中心的三维感知与多模态融合”为主题,旨在为研究人员和学生提供一个交流平台,探讨视觉中心三维感知与多模态融合的前沿技术、挑战与应用。本次邀请了浙江大学博士生闵致远、中国科学院大学博士生罗润、华中科技大学博士生李汶冰、浙江大学博士后邵飞飞进行专题探讨。论坛涉及从三维视觉重建、点云场景理解、多模态数据融合等多个方向,旨在促进学术界与工业界的互动合作,推动这一领域的创新与发展。

       论坛由中国图学学会动漫图学工程专业委员会委员宋子恺主持。浙江大学“百人计划”研究员、中国图学学会动漫图学工程专业委员会秘书长罗亚威致辞,他对专业委员会各位专家的到来表示热烈欢迎,并介绍了中国图学学会、中国图学学会动漫图学工程专业委员会以及本次Workshop的基本情况。

  中国图学学会动漫图学工程专业委员会委员宋子恺主持会议


  浙江大学“百人计划”研究员、中国图学学会动漫图学工程专业委员会秘书长罗亚威致辞


      浙江大学软件学院博士生闵致远作了题为《极几何约束下的泛化性新视角渲染研究》的报告。他的报告介绍了基于泛化性NeRF和3DGS模型的技术路线,并探讨如何通过多模态融合增强三维重建的表现力。特别是报告分析在面临视觉信息稀缺和模态缺失的情境下,如何利用极几何约束提供视角和极线的多模态特征,提升三维重建模型的鲁棒性与泛化性。另外,还探索了极几何在特定场景下的局限性,并提出一种全新的epipolar-free三维感知模块,旨在通过数据驱动的方式摆脱传统极几何约束的依赖。


       中国科学院深圳先进技术研究院博士生罗润作了题为《如何将扩散模型用于增强多模态大型语言模型的视觉感知》的报告。他的报告介绍了以视觉为中心的多模态大型语言模型领域的最新进展,以及在ICLR 2024上投稿的题为《DEEM: Diffusion models serve as the eyes of large language models for image perception》的高分研究工作。该工作提出的DEEM开创性地将扩散模型用于多模态大型语言模型的视觉感知增强,将扩散模型的细粒度视觉信息和视觉编码器的粗粒度的视觉信息互补,进而增强模型的抗视觉幻觉,空间感知和外分布泛化能力。与传统方法使用多个视觉编码器路由系统不同,DEEM通过复用多模态大型语言模型的扩散模型,在使用更少的额外计算开销的情况下,提升了模型的基础视觉感知能力,同时具有更好的泛化性能。我们在多个评估基准上对 DEEM进行了全面的评测,证明了其优越性和架构无关性。


       华中科技大学网络空间安全学院博士生李汶冰作了题为《基于耦合状态空间模型的多模态融合方法研究》的报告。他的报告介绍了多模态融合领域的最新进展,以及在NIPS 2024上发表的题为《Coupled Mamba: Enhanced Multi-modal Fusion with Coupled State Space Model》的研究工作。该工作提出的Coupled Mamba展现了一种全新的多模态融合方法,利用耦合状态空间模型中的状态链动态对多模态数据建模。与传统的基于Transformer的多模态融合方法不同,Coupled Mamba首先将State Space Model(SSM)应用在多模态融合任务中,并设计对应的状态转移策略,同时为了适配硬件感知算法以及并行计算,推导出对应的全局卷积核。通过这种方法能够解决Transformer的二次计算复杂度的问题,同时更好的利用不同模态所固有的互补信息,从而更加有效的利用多模态信息。Coupled Mamba的有效性和健壮性通过在多个多模态基准上的表现得到了证明,为状态空间模型在多模态领域的应用提供了新的思路和方法。


       浙江大学-伊利诺伊大学厄巴纳香槟校区联合学院博士后邵飞飞作了题为《3D视觉内容语义与场景理解方法研究》的报告。他的报告介绍了3D点云场景中的语义内容理解和场景理解的研究方法,主要包括在ACM MM 2022上发表的题《Active Learning for Point Cloud Semantic Segmentation via Spatial-Structural Diversity Reasoning》和最近的工作《MICAS: Multi-grained In-Context Adaptive Sampling for 3D Point Cloud Processing》 。指出了3D物体采样对三维物体感知和理解尤为重要,并主动学习和上下文学习两个框架下分别提出了基于空间结构多样性采样方法和多粒度自适应采样方法来提升3D视觉内容语义和场景理解的能力。



      最后,由中国图学学会动漫图学工程专业委员会委员杨卫副教授作论坛点评和总结。本次学术报告会受到了华中科技大学师生的广泛关注和积极参与,线下与会师生人数60人左右,师生反响热烈,论坛举办的圆满成功。

      中国图学学会长期以来一直把青年人才的培养作为重中之重!2017年开始,承办了“中国科协第339次青年科学家论坛”;2018年开始,为了深入贯彻落实中国科协对青年人才培养的新要求,创办学会自己的青年人才学术交流活动品牌——“奋发图强”。“奋发图强”意在“图学研究当自强,奋发有为靠青年!”希望能通过学会的努力,为图学界的青年人才们营造出一方施展才华、交流学习、快速成长的沃土!