arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

ACM International Conference on Multimedia · 会议 · Multimedia

至 收录 1940
2608.12911 2026-08-14 cs.CV cs.CR cs.MM 新提交

Beyond Visual Evidence: Revealing and Mitigating Relational Privacy Leakage in Document MLLMs

超越视觉证据:揭示并缓解文档多模态大语言模型中的关系隐私泄露

Beining Xu, Hairui Wang, Jiaxin Wang, Changsheng Chen, Anirban Chakraborty

机构 * Faculty of Engineering, Shenzhen MSU-BIT University(深圳北理莫斯科大学工程学院) Faculty of CMC, Shenzhen MSU-BIT University(深圳北理莫斯科大学计算机、数学与力学学院) Department of CDS, Indian Institute of Science(印度科学学院计算机与数据科学系)

AI总结 本文针对文档理解MLLMs的KIE任务,揭示其在视觉证据不足时会通过记忆的字段关系泄露隐私,提出DRUF框架与DocPrivacyBench基准,实验显示DRUF可提升泄露抑制效果并维持KIE性能。

Comments ACM mm 2026

URL PDF HTML 收藏
2608.12835 2026-08-14 cs.RO 新提交

AirForesight: Current-to-Future Spatial Map Imagination with Cross-Space Planning Consistency for UAV-VLN

AirForesight:面向无人机视觉语言导航(UAV-VLN)的跨空间规划一致性当前-未来空间地图想象

Yutong Liu, Xiaojie Li, Mingzhu Xu, Jianlong Wu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shandong University(山东大学)

AI总结 针对现有UAV-VLN方法空间推理不足的问题,提出AirForesight框架,通过联合监督学习当前地图表示并引入跨空间规划一致性损失,在公开数据集上取得良好性能。

Comments Accepted by ACM Multimedia 2026

URL PDF HTML 收藏
2608.12829 2026-08-14 cs.CV 新提交

Semantic Steering for Controllable Generation: Tuning-Free Concept Erasure in Multimodal Diffusion Transformers

语义引导用于可控生成:多模态扩散Transformer中的无调优概念擦除

Qiao Li, Xiaomeng Fu, Yuanshu Zhao, Qipeng Wang, Jiao Dai, Jizhong Han

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)

AI总结 该研究针对MM-DiTs的安全风险,提出一种无调优的概念擦除方法,通过在MM-DiT中间模块构建引导向量注入模型,实现高效鲁棒的概念擦除,性能优于现有方法。

Comments Accepted to ACM MM 2026

URL PDF HTML 收藏
2608.12806 2026-08-14 cs.CV cs.AI 新提交

Erase but Preserve: Controllable Removal of Copyrighted Animation Characters via Optimized Semantic Anchors

擦除但保留:通过优化语义锚点实现版权动画角色的可控移除

Qiao Li, Xiaomeng Fu, Wangjia Yu, Runze He, Baisen Wang, Jiao Dai, Jizhong Han

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)

AI总结 针对文本到图像扩散模型的动画角色版权问题,本文提出基于优化语义锚点的可控擦除方法,实现了更优的擦除效果与图像保真度,支持多目标移除与模型迁移。

Comments Accepted to ACM MM 2026

URL PDF HTML 收藏
2608.12532 2026-08-14 cs.MM cs.CV cs.IR 新提交

MASCOT: Model-Aware Submodular Coverage for Composite-Attribute Text-to-Image Retrieval

MASCOT:面向复合属性文本到图像检索的模型感知子模覆盖

Aaryan Sharma, Vishak Prasad C, Virendra Singh, Ganesh Ramakrishnan

AI总结 针对现有流形重排序方法在复合属性文本到图像检索的多样性降低任务中早期排名召回率大幅下降的问题,提出MASCOT方法,在PixelProse数据集复合约束任务中表现优于MS-DPP,尤其在排名1后召回率上优势显著。

Comments 21 pages, 4 figures. Accepted at ACM Multimedia 2026 (MM '26), Rio de Janeiro, Brazil. Extended version with full appendices

URL PDF HTML 收藏
2603.21783 2026-08-14 cs.CV 版本更新

SHARP: Spectrum-aware Highly-dynamic Adaptation for Resolution Promotion in Remote Sensing Synthesis

SHARP: 为遥感合成促进分辨率提升的频谱感知高动态适应

Bingxuan Zhao, Qing Zhou, Chuang Yang, Junyu Gao, Qi Wang

机构 * School of Computer Science, Northwestern Polytechnical University, Xi'an, China(计算机科学学院,西北工业大学,西安,中国) School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University, Xi'an, China(人工智能学院,光学与电子学(iOPEN),西北工业大学,西安,中国)

AI总结 本文提出SHARP方法,通过频谱感知的高动态适应策略,在无需训练的情况下提升遥感图像分辨率,优于现有无训练基线,在CLIP分数、审美分数和HPSv2上表现更优。

Comments Accepted by the 34th ACM International Conference on Multimedia (ACM MM 2026)

Journal ref Proceedings of the 34th ACM International Conference on Multimedia (ACM MM 2026)

URL PDF HTML 收藏
2601.21628 2026-08-14 cs.CR cs.LG 版本更新

Noise as a Probe: Membership Inference Attacks on Diffusion Models Leveraging Initial Noise

噪声作为探针:利用初始噪声的扩散模型成员推断攻击

Puwei Lian, Yujun Cai, Songze Li, Bingkun Bao

机构 * Southeast University(东南大学) The University of Queensland(昆士兰大学) Nanjing University of Posts and Telecommunications(南京邮电大学)

AI总结 本文提出利用扩散模型初始噪声中的残余语义信息进行成员推断攻击,揭示了微调模型在隐私保护方面的脆弱性。

Comments Accepted to 34th ACM International Conference on Multimedia (MM 2026)

URL PDF HTML 收藏
2510.22282 2026-08-14 cs.CV cs.AI cs.CL 版本更新

CityRiSE: Reasoning Urban Socio-Economic Status in Large Vision-Language Models via Reinforcement Learning

CityRiSE:基于强化学习的大视觉语言模型城市社会经济地位推理框架

Tianhui Liu, Hetian Pang, Xin Zhang, Jie Feng, Pan Hui, Yong Li

机构 * Information Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心) Department of Electronic Engineering, BNRist, Tsinghua University(清华大学电子工程系)

AI总结 本研究提出CityRiSE框架,结合强化学习与大视觉语言模型,提升城市社会经济感知的预测准确性与泛化能力,尤其在未见城市和指标上表现优异。

Comments Accepted by ACM MM 2026, https://github.com/tsinghua-fib-lab/CityRiSE

URL PDF HTML 收藏
2508.08199 2026-08-14 cs.CV 版本更新

Generalizable Operating Room Expert with Multimodal Enhancement

具备多模态增强能力的可泛化手术室专家

Peiqi He, Zhenhao Zhang, Yixiang Zhang, Jiaxin Liu, Xiongjun Zhao, Shaoliang Peng

AI总结 针对手术室空间建模的局限,提出仅用RGB图像推理的多模态大语言模型OR-Expert,通过内部推导空间线索实现三维推理,在手术室基准上达SOTA且泛化性良好。

Comments Accepted by ACM Multimedia 2026

URL PDF HTML 收藏
2608.11741 2026-08-13 cs.CV cs.AI 新提交

JieZi: A Large-Scale Expert-Audited Dataset and Benchmark for Ancient Chinese Character Exegesis

JieZi:用于古文字训诂的大规模专家审核数据集与基准

Ran Li, Huiguo He, Jiahuan Cao, Junle Liu, Hiuyi Cheng, Lianwen Jin

机构 * South China University of Technology(华南理工大学)

AI总结 本文针对古文字训诂研究缺乏结构化数据与基准的问题,提出ACCE任务,构建JieZi-Dataset与JieZi-Bench,实验发现多模态大模型在古文字训诂的高阶任务上表现不佳,微调后性能显著提升。

Comments 19 pages, 13 figures. Accepted to the Dataset Track of ACM Multimedia 2026 for oral presentation

URL PDF HTML 收藏
2608.11595 2026-08-13 cs.CV 新提交

ProtoHGF-Net: Prototype HyperGraph Fusion with Intra-modal Calibration for RGBT Object Detection

ProtoHGF-Net:用于RGBT目标检测的模态内校准原型超图融合网络

Xiangqi Chen, Xiuling Zhang, Chengzhuan Yang, Li Zhao, Dawei Zhang, Yanchao Wang, Liyuan Chen, Hua Wang, Hao Peng, Zhonglong Zheng

机构 * Zhejiang Normal University(浙江师范大学) National University of Defense Technology(国防科技大学)

AI总结 针对现有RGBT目标检测方法密集跨模态交互易引入背景干扰的问题,提出ProtoHGF-Net框架,通过原型级语义交互与教师掩码校准蒸馏技术,在三个公开数据集上取得最优性能。

Comments Accepted to ACM MM 2026

URL PDF HTML 收藏
2608.11150 2026-08-13 cs.CV 版本更新

CausalSplat: Towards Comprehensive Hierarchical Reasoning in 3D Gaussian Splatting

CausalSplat:面向3D高斯溅射的综合层级推理

Jiayu Ding, Meilu Song, Yun Chen, Wei Gao, Ge Li

机构 * Peking University(北京大学) North China Electric Power University(华北电力大学) Hunan University(湖南大学)

AI总结 针对3D高斯溅射推理局限,本文提出CausalSplat框架,结合视觉语言模型与3D场景图,构建两个推理基准,在相关任务上实现最优性能与强泛化性。

Comments Accepted to ACM MM 2026

URL PDF HTML 收藏
2608.02474 2026-08-13 cs.CV 版本更新

EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation

EchoCache:面向高效音频驱动视频生成的能量引导跨模态缓存

Jiayu Chen, Xiaoyu Wu, Rongshan Gao, Maoliang Li, Zihao Zheng, Xinhao Sun, Hailong Zou, Guojie Luo, Xiang Chen

机构 * Peking University(北京大学) Taiyuan University of Technology(太原理工大学)

AI总结 EchoCache是一种能量引导跨模态缓存框架,通过利用音频时频能量锚点与动态缓存机制,在保持音频驱动视频生成质量的同时,实现了2.46倍的推理加速,优化了延迟-质量权衡。

Comments EchoCache is honored to be accepted by ACM MM 2026

URL PDF HTML 收藏
2604.12908 2026-08-13 cs.RO 版本更新

Robotic Manipulation is Vision-to-Geometry Mapping: Vision-Geometry Backbones over Language and Video Models

机器人操作是视觉到几何映射(f(v)→G):超越语言和视频模型的视觉-几何骨干

Zijian Song, Qichang Li, Jiawei Zhou, Zhenlong Yuan, Tianshui Chen, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis(大数据分析与处理广东省重点实验室) X-Era AI Lab(X-Era人工智能实验室) AMAP, Alibaba(阿里妈妈实验室) Guangdong University of Technology(广东工业大学)

AI总结 本文提出基于视觉-几何骨干的机器人操作方法,通过直接利用预训练的3D表示生成动作,优于传统语言或视频模型,在精确操作和零样本泛化中表现更优。

Comments Accepted at ACM Multimedia 2026

URL PDF HTML 收藏
2608.10020 2026-08-12 eess.IV cs.MM 新提交

MD2G-Cast: Relay-Coordinated Multicast for Scalable Volumetric Streaming over MoQ

MD2G-Cast:基于MoQ的可扩展体积流传输的中继协调组播

Ruonan Chai, Yisu Wang, Zili Meng, Dirk Kutscher

AI总结 该研究提出基于MoQ的MD2G-Cast中继协调组播框架,通过PPO算法实现分组与增强准入控制,可提升体积流传输的可扩展性,降低链路负载,优于Rolling和Clustering等方法。

Comments 9 pages, 8 figures, 4 tables. Accepted to the 34th ACM International Conference on Multimedia (ACM Multimedia 2026)

URL PDF HTML 收藏
2608.11096 2026-08-12 cs.CV 新提交

Every Packet Counts: Dispersing Information for Loss-Resilient Learned Image Compression

每个数据包都重要:面向抗丢包的学习型图像压缩的信息分散方法

Yuhang Wei, Chuqin Zhou, Yibo Shi, Jing Wang, Guo Lu

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Technologies Ltd.(华为技术有限公司) Central Media Technology Institute(中央媒体技术研究院)

AI总结 本文针对学习型图像压缩的抗丢包问题,提出ICR、ICG机制及双层双分支自回归结构,实验显示其在丢包场景下的重建质量和稳定性均优于现有方法,且可泛化到突发丢包场景。

Comments 16 pages, 12 figures, 8 tables. Joint first authors: Yuhang Wei and Chuqin Zhou. Corresponding author: Guo Lu. To appear in Proceedings of the 34th ACM International Conference on Multimedia (MM '26), November 10-14, 2026, Rio de Janeiro, Brazil

URL PDF HTML 收藏
2608.11017 2026-08-12 cs.CV cs.AI cs.HC cs.MM 新提交

R4DSG: Relative 4D Scene Graph Memory for Object-Centric Question Answering in Long Egocentric Video

R4DSG:面向长时序自我中心视频中以对象为中心的问答的相对4D场景图记忆

Ke Ma, Yamin Mao, Weiming Li, Shuai Tan, Yijie Zhong, Hao Chen, Haofen Wang, Meng Wang

机构 * Samsung R&D Institute China - Beijing(三星中国研发研究院(北京)) Shanghai Jiao Tong University(上海交通大学)

AI总结 该研究提出R4DSG,一种面向长时序自我中心视频的相对4D场景图记忆,在EgoLifeQA数据集的对象相关问答任务中,较EgoRAG-Text取得显著性能提升,可作为可穿戴助手等的实用记忆载体。

Comments 10 pages, 3 figures, ACM Multimedia 2026, egocentric video; 3D scene graph; temporal memory; graph retrieval; object-state reasoning; multimodal question answering

URL PDF HTML 收藏
2608.11002 2026-08-12 cs.CL cs.AI 新提交

On the Limitations of Cross-Lingual Consistency in Multilingual Text-to-image Generation

多语言文本到图像生成中跨语言一致性的局限性研究

Sicheng Zhang, Zhonghao Yan, Binzhu Xie, Shi Qiu, Muzammal Naseer, Naveed Akhtar, Mubarak Shah

机构 * Khalifa University(哈利法大学) Queen Mary University of London(伦敦玛丽女王大学) The Chinese University of Hong Kong(香港中文大学) The University of Western Australia(西澳大学) The University of Melbourne(墨尔本大学) University of Central Florida(中佛罗里达大学)

AI总结 本文针对多语言文本到图像生成的跨语言一致性局限,构建含10种语言、3.3万条提示词的LingT2I基准,经分析揭示语言相关生成规律,为开发更鲁棒的多语言T2I模型奠定基础。

Comments Accepted to ACM MM 2026

URL PDF HTML 收藏
2608.10756 2026-08-12 cs.RO cs.CV 新提交

Embodied Multimodal Grounding for Open-Vocabulary Mobile Manipulation via Semantic 3D Gaussian Splatting

基于语义三维高斯溅射的开放词汇移动操作具身多模态定位

Huosen Ou, Dongni Song, Yuncong Wang, Tao Zhou, Yiding Ji

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Midea Group(美的集团) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文针对家庭场景开放词汇移动操作的目标定位问题,提出整合Semantic-3DGS的具身多模态框架,经50次真实机器人试验,在长 horizon、杂乱场景等任务中优于PointVLA等基线方法,提升了操作鲁棒性。

Comments 9 pages, 11 figures. Accepted to ACM Multimedia 2026 (MM '26)

URL PDF HTML 收藏
2608.10316 2026-08-12 cs.CV cs.LG cs.MM 新提交

UniMod: Enhancing Multi-Modal Medical Diagnosis through Cross-Modality and Within-Modality Alignment

UniMod:通过跨模态与模态内对齐增强多模态医学诊断

Zijian Gu, Weikai Lin, Shuang Zhou, Zihan Chen, Song Wang

机构 * University of Central Florida(中佛罗里达大学) University of Rochester(罗切斯特大学) Harvard Medical School(哈佛医学院) University of Virginia(弗吉尼亚大学)

AI总结 UniMod框架通过要求各模态独立预测诊断缓解多模态医学诊断的捷径学习,添加跨模态与模态内对齐,在两个数据集上优于基线方法,还可扩展至多标签5分类诊断。

Comments Accepted to ACM Multimedia 2026 (MM '26). 10 pages, 7 figures, 5 tables. Code: https://github.com/futurespyhi/UniMod

URL PDF HTML 收藏
2604.24602 2026-08-12 cs.CV 版本更新

Majorization-Guided Test-Time Adaptation for Vision-Language Models under Modality-Specific Shift

基于主导性的测试时适应以应对视觉-语言模型在模态特定偏移下的表现

Lixian Chen, Mingxuan Huang, Yanhui Chen, Junyi Lin, Yang Shi

机构 * Guangdong University of Technology(广东工业大学)

AI总结 本文研究了视觉-语言模型在部署时视觉与文本分支不对称偏移的问题,提出MG-MTTA方法通过控制模态可靠性而非仅预测熵来提升性能。

Comments Accepted by ACM MM 2026

URL PDF HTML 收藏
2602.06075 2026-08-12 cs.DC 版本更新

MemGUI-Bench: Benchmarking Memory of Mobile GUI Agents in Dynamic Environments

MemGUI-Bench: 动态环境中移动GUI代理内存能力的基准测试

Guangyi Liu, Pengxiang Zhao, Yaozhen Liang, Qinyi Luo, Shunye Tang, Yuxiang Chai, Weifeng Lin, Han Xiao, WenHao Wang, Siheng Chen, Zhengxi Lu, Gao Wu, Hao Wang, Liang Liu, Yong Liu

AI总结 MemGUI-Bench提出一个综合的内存导向基准测试,通过128个任务评估移动GUI代理的内存能力,揭示了各系统中的显著内存缺陷并提出5种设计改进措施。

Comments Accepted to ACM MM 2026. Project page: https://memgui-bench.github.io/

URL PDF HTML 收藏
2608.09564 2026-08-11 cs.CV cs.AI 新提交

From Semantic Grounding to Decision Optimization: A Unified Framework for Long-Horizon UAV Vision-Language Navigation

从语义接地到决策优化:面向长 horizon 无人机视觉语言导航的统一框架

Zeyuan Ma, Jiaxin Chen, Di Huang

机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)

AI总结 本文针对无人机视觉语言导航的现有问题,提出统一语义到决策框架,经实验在AerialVLN和OpenFly基准上达到SOTA性能。

Comments 10 pages, 5 figures. Accepted at ACM Multimedia 2026 (MM '26)

URL PDF HTML 收藏
2608.09373 2026-08-11 cs.CV 新提交

Preserve More Details: Mitigating Content Drift in Real-World Image Super-Resolution

保留更多细节:缓解真实世界图像超分辨率中的内容漂移

Chunxiao Liu, Wei Liu, Anbin Xiong, Erli Meng

机构 * Xiaomi Corporation(小米公司)

AI总结 针对真实世界图像超分辨率中因低质量输入导致的内容漂移问题,提出双路径架构的新型单步扩散模型FSP-Diff,在标准基准上优于现有单步扩散方法。

Comments Accepted to ACM MM 2026. This is the author's accepted version. The definitive version is published in the Proceedings of ACM MM 2026

URL PDF HTML 收藏
2608.09322 2026-08-11 cs.CV 新提交

Diffusion Image Editing via Asynchronous Token Decoding

基于异步令牌解码的扩散图像编辑

Yang Shi, Liangsi Lu, Minzhe Guo, Yifeng Xie, Yanhui Chen, Jingchao Wang, Xuhang Chen

机构 * Guangdong University of Technology(广东工业大学) Hong Kong Baptist University(香港浸会大学) Peking University(北京大学) Huizhou University(惠州学院)

AI总结 针对文本引导扩散图像编辑的全局漂移问题,提出推理时框架ATDEdit,通过逐令牌条件意外度估计可编辑位置,在PIE-Bench上实现最优保留指标且语义对齐性具竞争力。

Comments Accepted by ACMMM 2026

URL PDF HTML 收藏
2608.09270 2026-08-11 cs.CV cs.AI cs.IR cs.MM 新提交

GRASP: Granularity-Aware Region Alignment and Semantic Prototype Learning for Fine-Grained Cross-Modal Understanding in Drone Views

GRASP:面向无人机视角细粒度跨模态理解的粒度感知区域对齐与语义原型学习

Jiahui Cui, Yan Zhao, Kan Wei, Enze Zhu, Peirong Zhang, Lei Wang, Yiru Wang

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) University of Chinese Academy of Sciences(中国科学院大学) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院)

AI总结 针对无人机视角细粒度跨模态理解的背景杂波干扰与视觉同构歧义问题,提出GRASP框架,通过RFA和SPEM策略提升性能,在相关基准数据集上验证了有效性。

Comments Accepted at the 34th ACM International Conference on Multimedia (ACM Multimedia 2026, MM '26). 10 pages, 6 figures

URL PDF HTML 收藏
2608.09189 2026-08-11 cs.CL 新提交

EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models

EmoS:用于评估和对齐口语语言模型中情商的基于理论的框架

Junyu Wang, Siyuan Zhang, Peiyuan Jiang, Jian Zong, Jingyu Zhang, Tianrui Wang, Yuqin Lin, Zhenghui Chen, Shuqing Xie, Ziyang Ma, Meng Ge, Xiaobao Wang, Longbiao Wang, Jianwu Dang

AI总结 本研究针对口语语言模型情商评估缺乏理论框架的问题,构建了EmoSBench基准,开发了基于SFT和GRPO优化的EmoS评估模型,其在EmoSBench上准确率达83.8%,接近人类水平。

Comments Accepted at ACM Multimedia 2026 (MM '26)

URL PDF HTML 收藏
2608.09152 2026-08-11 cs.CV 新提交

LightAIR: Lightweight Action Inversion and Riemannian Rectification for Text-based Person Anomaly Search

LightAIR:用于基于文本的行人异常搜索的轻量型动作逆转换与黎曼校正

Yulun Zhang, Zixu Li, Zhiwei Chen, Zhiheng Fu, Wenbo Wang, Zihang Qiu, Zhilin Wang, Ruxin Wang, Yupeng Hu

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Shandong University(山东大学)

AI总结 针对现有基于文本的行人异常搜索方法的缺陷,提出LightAIR网络,通过动作逆转换、正交零空间投影与黎曼梯度校正实现外观与动作特征解耦,在TPAS和TIPR数据集上性能优于现有SOTA方法

Comments Accepted by ACM MM 2026

URL PDF HTML 收藏
2608.09098 2026-08-11 cs.RO 新提交

UnsDrive: Towards Robust End-to-End Autonomous Driving in Unstructured Scenes

UnsDrive:面向非结构化场景的鲁棒端到端自动驾驶

Nanxin Zeng, Ruiqi Song, Xiangyu Guo, Baiyong Ding, Yunfeng Ai

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Waytous Inc.(文远知行公司)

AI总结 针对非结构化采矿环境自动驾驶泛化差的问题,提出UnsDrive规划器,结合未知感知占用表示与流匹配规划器,引入专用损失和评分器,辅以MineLoop模拟器验证,性能优于基线。

Comments 9 pages, 4 figures, conference

Journal ref the 34th ACM International Conference on Multimedia, 2026

URL PDF HTML 收藏
2608.09097 2026-08-11 cs.CV 新提交

SI-Edit: Toward Sketch-Instruction Guided Local Image Editing with Pixel-Level Precision

SI-Edit:面向草图-指令引导的像素级精度局部图像编辑

Weixin Ye, Wei Wang, Hongguang Zhu, Xuecheng Nie

机构 * Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学研究所) City University of Macau(澳门城市大学) Meitu Inc(美图公司)

AI总结 针对基于草图的图像编辑缺乏像素级精度及对应数据集、评估指标的问题,提出SI-Edit框架,构建SI-Data数据集并建立评估指标,实现更可靠的结构控制与像素级局部编辑效果。

Comments accepted by ACM MM 2026

URL PDF HTML 收藏