2025年1月2日上午,中国图学学会“奋发图强”博士生Workshop2024年度第六期通过腾讯会议在线召开,并通过中国图学学会微信视频号及哔哩哔哩“图学大讲堂”同步直播,吸引了超过1000人在线参与。

本期活动由中国图学学会主办,中国图学学会青年工作委员会、可视化与认知计算专业委员会联合承办。活动围绕“多模态内容生成与编辑”,邀请了浙江大学博士后路雨、中国科学院自动化研究所博士生张宇欣、南京邮电大学博士生陶明、北京交通大学博士生李子翔分享了最新的研究成果和技术进展,为博士生提供了宝贵的学习和交流机会。活动由第八届中国科协青年人才托举工程入选者、浙江工商大学研究员、中国图学学会可视化与认知计算专业委员会秘书长董建锋主持。

首先,路雨博士后围绕“无需训练的长视频生成”展开讨论,他深入探讨了短视频扩散模型在长视频生成中的挑战与解决方案。他指出,训练长视频生成模型需要大量资源,而直接使用短视频模型会因高频成分失真导致质量下降,表现为空间高频减少和时间高频增加。为此,他提出了FreeLong方法,通过平衡全局低频和局部高频特征,有效改善长视频的频率分布,显著提升生成的一致性和保真度。该方法还支持多提示生成,确保了视觉连贯性和自然过渡。

其次,张宇欣博士围绕“可视媒体属性表示与可控生成”进行了详细阐述,探讨了可视媒体生成在文化产业中的关键作用。她指出,可视媒体生成的核心在于属性的准确表示与灵活控制,并分享了多项研究进展,包括基于自适应对比学习的图像风格迁移、多模态信息引导的图像属性编辑,以及视频与动画视频的动作迁移等。这些工作为可控生成技术的发展提供了新的视角和技术路径。

第三,陶明博士就“高效跨模态图像生成”进行了深入探讨。他指出,尽管现有跨模态图像生成方法在质量上取得进展,但生成速度较慢且硬件需求较高,主要由于预训练生成模型的庞大参数和复杂的生成过程。他介绍了如何提高预训练GAN模型的生成质量并提升生成速度,分享了课题组在文本生成图像任务中的研究思路,并探讨了如何利用大规模预训练多模态模型进一步优化文本到图像生成任务,为高效跨模态图像生成提供了新的实践路径。

最后,李子翔博士围绕“区域精细化的扩散模型无监督图像编辑”分享了他在图像编辑领域的创新研究。他提出了一种无需额外训练的方法,能够发现预训练扩散模型隐空间中的语义属性,并通过构造低维子空间实现精确的局部区域编辑。他还提出了区域基编辑(Region-Based Editing, RBE)算法,能够在保持全局图像一致性的同时,进行精细的局部编辑。该方法为无监督图像编辑提供了新的思路,显著提高了编辑的精确性与灵活性。
在活动的互动环节,参会观众积极提问,围绕报告中的理论方法、技术细节以及应用前景展开了热烈讨论。本次活动通过多平台同步直播,面向公众免费开放,吸引了学术界和工业界的广泛关注,取得了圆满成功。活动不仅为国内博士生提供了高水平的学术交流平台,也促进了学术思想的碰撞与融合,进一步推动了相关领域的研究发展。未来,“奋发图强”博士生Workshop将继续秉承促进学术交流、推动技术创新的宗旨,为更多青年学者搭建高水平的学术发展平台,助力我国图学领域的持续进步。