arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Chinese Academy of Sciences(中国科学院大学)

2026-09-01 至 2026-09-01 共收录 30
2608.30910 2026-09-01 cs.LG cs.CL 新提交

S3C-LLM: Skill-Code Guided Agentic Language Models for Spectrum-to-Structure Elucidation

S3C-LLM:用于谱图到结构解析的技能-代码引导型智能体语言模型

Xuanle Zhao, Xinyuan Cai, Xiang Cheng, Bo Xu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 S3C-LLM是一种技能-代码引导型智能体LLM,通过检索光谱学技能、执行分析代码整合证据与约束来解析分子结构,性能优于同类模型且训练语料更少。

Comments Accepted by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30760 2026-09-01 cs.LG 新提交

PRACTICE: From Experience to Expertise in Self-Evolving Embodied Agents

PRACTICE:从经验到自进化具身智能体的专业能力

Ziyi Bai, Siqi Li, Tinglei Huang, Börje F. Karlsson

机构 * Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院(BAAI)) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 PRACTICE通过训练技能学习者维护技能库,结合两阶段课程训练与在线编辑蒸馏,在EB-ALFRED等任务上实现优于基线的自进化具身智能体性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30709 2026-09-01 cs.CV cs.AI 新提交

RailSyn: Diagnosis-Guided Image Generation for Traceable Data Completion in Railway Foreign Object Detection

RailSyn:面向铁路异物检测中可追溯数据补全的诊断引导图像生成方法

Quan Hao, Chenxi Zhang, Ziyang Tao, Yuyuan Zhou, Yudong Wang, Rui Shi, Lechuan Xu, Changhao Liu, Liguo Zhang

机构 * School of Information Science and Technology, Beijing University of Technology(北京工业大学信息科学与技术学院) Pratt School of Engineering, Duke University(杜克大学普拉特工程学院) Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) School of Mathematical Sciences, University of Chinese Academy of Sciences(中国科学院大学数学科学学院) Industrial Systems Engineering and Management, National University of Singapore(新加坡国立大学工业系统工程与管理系) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 RailSyn是诊断引导的图像生成框架,通过检查器定位补全区域并明确需求,生成器满足需求,可提升RFOD检测性能,在9种主流检测器上AP50--95最高增益4.9点,具跨架构实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30661 2026-09-01 cs.CL 新提交

SwarmBench: Can Large Language Models Act as Agent Swarm Orchestrators?

SwarmBench:大语言模型能否充当智能体群的编排者?

Jinshan Gao, Zhuoran Jin, Tianyi Men, Kang Liu, Jun Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 该研究针对大语言模型作为智能体群编排者的评估需求,提出多维度基准SwarmBench,发现模型编排能力存在显著差异,并通过SwarmExp方法有效提升了编排性能。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30643 2026-09-01 cs.RO 新提交

Temporal Forcing: 4D Representation Alignment for Vision-Language-Action Models

时序强制:面向视觉-语言-动作模型的四维表示对齐

Xingyu Ding, Yuzhong Zhao, Chunhai Zhao, Yinghuan Shi, Chaoyang Zhao, Yifan Zhang

机构 * Nanjing University(南京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 该研究针对视觉-语言-动作模型缺乏时序信息的问题,提出 Temporal Forcing 方法,通过历史通路与时序一致的四维几何特征对齐,在 LIBERO 等任务上取得性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30532 2026-09-01 cs.AI 新提交

DiffPDE: Masked Diffusion Language Models as PDE Solver

DiffPDE:作为偏微分方程求解器的掩码扩散语言模型

Wenxuan Guo, Yuyang Hong, Lubin Fan, Zhaojin Fu, Lin Chen, Kun Ding, Shiming Xiang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 本研究针对现有PDE求解器合成方法中自回归模型解码冗余的问题,提出基于离散扩散语言模型的DiffPDE框架,结合局部重掩码填充策略与ID-GRPO强化学习方案,在PDEBench上实现了更优准确率与更快修复速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30398 2026-09-01 cs.CL cs.IR 新提交

Beyond Polarization: The Generative Constraint of Chain-of-Thought in Pointwise Reranking

超越极化:点式重排序中思维链的生成约束

Xiaoyang Chen, Jie Liu, Haijin Liang, Haibo Shi, Jin Ma, Ben He, Yingfei Sun, Dezhi Ye

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tencent(腾讯)

AI总结 本研究针对点式重排序中思维链模型性能弱于直接评分模型的问题,通过实证研究及多种干预措施,发现排序差距源于离散文本传递连续相关性语义的瓶颈,而非易解决的训练偏差。

Comments Accepted at EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30371 2026-09-01 cs.CV 新提交

MCSeg: Pre-training and Fine-tuning Volumetric Pyramid Transformer for Multi-modal Cardiac Image Segmentation

MCSeg:用于多模态心脏图像分割的体积金字塔Transformer的预训练与微调

Zhiyu Ye, Hairong Zheng, Tong Zhang

机构 * Shenzhen Institute of Advanced Technology(深圳先进技术研究院) Pengcheng Laboratory(鹏城实验室) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本研究提出MCSeg网络,通过新型SFP连接ViT编码器与CNN解码器,结合自监督预训练与RMI损失,在多模态心脏图像分割任务中优于11种SOTA方法,小样本场景也表现出色

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30325 2026-09-01 cs.CL cs.SD 新提交

Sequential Trajectories and Simultaneous Blending: Multi-Emotion Modeling for Instruction-Following TTS

序列轨迹与同时融合:用于指令跟随式语音合成的多情感建模

Yan Zhou, Yun Hong, Yang Feng

机构 * Key Laboratory of Intelligent Information Processing, Institute of Computing Technology, Chinese Academy of Sciences (ICT/CAS)(中国科学院计算技术研究所智能信息处理重点实验室) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所人工智能安全国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文针对指令跟随式TTS的多情感控制问题,提出HybridEmo后训练框架,结合分组相对策略优化与混合奖励,在MultiEmo-Test上提升了轨迹正确性与融合强度,表现优于多数对比模型。

Comments Code is available at https://github.com/ictnlp/HybridEmo. Demo page: https://zhouyan19.github.io/HybridEmo-demo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30316 2026-09-01 cs.CV 新提交

Knowing Beyond the Known: Reinforced Knowledge Specification for Multi-Label Class-Incremental Learning

超越已知的认知:面向多标签类增量学习的强化知识规范

Aoting Zhang, Dongbao Yang, Chang Liu, Xiaopeng Hong, Can Ma, Yu Zhou

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Nankai University(南开大学) Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 针对多标签类增量学习中已知与未知知识边界模糊的问题,提出KBK框架,通过分层特征纯化等模块缓解遗忘,在MS-COCO基准上超越最优方法2.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30277 2026-09-01 cs.AI cs.MA 新提交

SimCRAFT: Distilling Remote Sensing Agents via Synthetic Trajectories and Contextual Retrieval-Augmented Fine-Tuning

SimCRAFT:通过合成轨迹和上下文检索增强微调蒸馏遥感智能体

Haoran Wang, Jing Yao, Xu Yang, Zeqing Wang, Yang Zhang, Pedram Ghamisi, Zhengchao Chen

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) University of Chinese Academy of Sciences(中国科学院大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Helmholtz-Zentrum Dresden-Rossendorf(德累斯顿-罗森多夫亥姆霍兹中心)

AI总结 本研究提出SimCRAFT框架,通过合成轨迹与上下文检索增强微调,将复杂遥感编排能力蒸馏到7B模型,性能优于开源LLM,为轻量遥感智能提供开源基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30209 2026-09-01 cs.CV 新提交

DICS: Exploring Data Intrinsic Consistency for Visual Instruction Selection

DICS:探索数据内在一致性用于视觉指令选择

Yuyang Hong, Jinhui Guo, Jiaqi Gu, Lubin Fan, Ruixiang Wang, Kun Ding, Yue Wu, Shiming Xiang, Jieping Ye

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Alibaba Token Hub, Alibaba Group(阿里巴巴集团)

AI总结 提出基于数据内在一致性(DIC)的自适应视觉指令选择方法DICS,仅用25%数据就超越现有最优方法,还构建600万样本语料库,用不足25%训练数据达到InternVL3-8B-Instruct的94.52%性能

Comments Accepted by EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29997 2026-09-01 cs.CV 新提交

Discrete Diffusion Bridges for Spatiotemporally Aligned Image Translation and Generation

用于时空对齐图像翻译与生成的离散扩散桥

Xing Xie, Jiawei Liu, Shijun Zhou, Huijie Fan, Zhi Han, Yandong Tang, Liangqiong Qu

机构 * Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) The University of Hong Kong(香港大学) School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院)

AI总结 该研究提出离散扩散桥(DDB)框架,解决离散扩散在图像翻译与生成中的时空错位问题,通过混合吸收机制和信息引导噪声调度实现平衡,在多生成任务中表现优异且适配低采样步数场景。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29765 2026-09-01 cs.LG cs.NE 新提交

PruneShift: A Framework for Evaluating Decision Reliability in Structured Pruning

PruneShift:结构化剪枝中决策可靠性的评估框架

Hao Ye, Gaopeng Zhang

机构 * University of Chinese Academy of Sciences(中国科学院大学)

AI总结 该研究提出PruneShift框架,将结构化剪枝的预测保真度、局部保真度与决策质量分离,经多数据集实验验证,证明需分别评估剪枝的预测拟合、决策可靠性及方法质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29605 2026-09-01 cs.CL 新提交

Hindsight Memory-PRM: Supervising Memory Management with Auditable Hindsight Credit

事后记忆-PRM:通过可审计的事后信用监督记忆管理

Haoxuan Jia, Yang Liu, Yingguang Yang, Yancheng Chen, Chongyang Zhang, Hao Zheng, Qian Li, Yulin Huang, Jianshen Zhang, Yongzhi Qi, Shang Luo, Kefu Xu, Hao Peng, Junyu Lu, Du Cheng, Philip S. Yu, Bin Chong

机构 * Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Fullive-AI Nanyang Technological University(南洋理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Beihang University(北京航空航天大学) Beijing Institute of Technology, Zhuhai(北京理工大学珠海学院) Northeastern University(东北大学) University of Illinois Chicago(芝加哥大学伊利诺伊分校)

AI总结 该研究提出Hindsight Memory-PRM,利用轨迹审计轨迹训练记忆效用评判器并确定代理奖励,在LoCoMo、LongMemEval数据集上的性能优于基线系统,实现高效的长视野LLM智能体记忆管理监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29144 2026-09-01 cs.CL 新提交

Quantifying Error Tolerance in Synthetic Data: An Atomic-level Operand vs. Operator Perturbation Study

量化合成数据的误差容忍度:原子级操作数与算子扰动研究

Jiaxiang Liu, Chenhao Yuan, Shuwen Xu, Boxuan Xing, Xiusheng Huang, Yinhao Xu, Hao Liu, Wenhao Teng, Xiangwen Liao, Pengfei Cao, Jun Zhao, Kang Liu

机构 * CDL, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所CDL) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Fujian Provincial Cancer Hospital(福建省肿瘤医院) College of Computer and Data Science, Fuzhou University(福州大学计算机与数据科学学院)

AI总结 针对合成数据误差容忍度定量分析缺失的问题,提出ATOM框架区分操作数与算子扰动,发现模型对操作数扰动鲁棒但受算子扰动影响,合成数据较LIMA提升3.1%,凸显算子多样性的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29126 2026-09-01 cs.CV 新提交

Efficient Language-to-Vision Feature Injection for Referring Single-Object Tracking

用于指称单目标跟踪的高效语言到视觉特征注入

Han Wang, Yuxuan Liu, Yuhan Sun, Jian Yang, Xiaotong Xu, Yixuan Lv, Zhuang Zhou, Shengyang Li

机构 * Technology and Engineering Center for Space Utilization, Chinese Academy of Sciences(中国科学院空间应用工程与技术中心) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出LVTrack纯Transformer框架,通过模式条件门控特征注入器等设计缓解语义漂移,利用冻结的视觉-语言预训练模型降低训练成本,在指称单目标跟踪任务的标准基准上取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27580 2026-09-01 cs.AI 版本更新

LongGuard: Mechanistic Analysis and Training-Free Mitigation of Long-Context Failure in Safety Guardrails

LongGuard:针对安全护栏长上下文失效的机制分析与无训练缓解方案

Ziyang Chen, Xing Wu, Songlin Hu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)

AI总结 本研究针对LLM安全护栏在长上下文下的失效问题,提出LongGuard框架,经机制分析后开发无训练缓解方案,在多基准测试中实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26849 2026-09-01 cs.AI cs.CY cs.MA 版本更新

LiveSim: Simulating Environment-Shaped Users in Multi-Agent Live-Stream Ecosystems

LiveSim:在多智能体直播生态系统中模拟环境塑造的用户

Jiaqi Xu, Yiran Qiao, Jing Chen, Qiwei Zhong, Xiang Ao, Xueqi Cheng

机构 * University of Chinese Academy of Sciences(中国科学院大学) ByteDance China(字节跳动中国)

AI总结 该研究提出基于LLM的LiveSim框架,通过环境塑造的动态用户行为模拟,在真实直播风控数据实验中验证其可提升用户级行为保真度并支持生态系统级分析。

Comments 20 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01651 2026-09-01 cs.RO 版本更新

One Demonstration Is Enough for Real-World Robotic Reinforcement Learning

一个演示足以实现真实世界机器人强化学习

Yuwan Liu, Hongze Yu, Song Liu, Yuhan Wang, Junge Zhang, Yaodong Yang, Yuanpei Chen, Ceyao Zhang

机构 * National Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institution of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能国家重点实验室) Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) PKU-PsiBot Joint Lab(北大-鹏城实验室联合实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)

AI总结 提出AutoSERL框架,仅需一个演示即可自动化真实世界机器人强化学习,通过滑动窗口干预、安全恢复和自动终止机制,在六个接触密集型任务上超越基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28696 2026-09-01 cs.AI 版本更新

COMPASS: Grounding Composition-Intent Guidance in Unified Multimodal Models

COMPASS:在统一多模态模型中锚定构图意图引导

Ziqi Zhou, Weize Quan, Mining Tan, Zhihan Chen, Dandan Zheng, Jingdong Chen, Jun Zhou, Weiming Dong, Dong-Ming Yan

机构 * University of Edinburgh(爱丁堡大学) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS)(多模态人工智能系统国家重点实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Ant Group(蚂蚁集团)

AI总结 提出统一框架COMPASS,通过共享专家令牌τ_c实现构图感知与生成的双向锚定,结合MoE骨干和Comp-11数据集,显著提升细粒度构图理解与可控生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08531 2026-09-01 cs.AI 版本更新

ForesightSafety-SAGE:A Fully Automated Scenario Generation and Safety Evaluation Framework for LLM Agents

VESTA: 一种全自动的LLM智能体场景生成与安全评估框架

Lu Jia, Haibo Tong, Feifei Zhao, Jindong Li, Dongqi Liang, Ping Wu, Qian Zhang, Yi Zeng

机构 * BrainCog AI Lab, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所类脑人工智能实验室) Beijing Institute of AI Safety and Governance (Beijing-AISI)(北京人工智能安全与治理研究院) Beijing Key Laboratory of Safe AI and Superalignment(北京市安全人工智能与超级对齐重点实验室) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) Long-term AI(长期人工智能)

AI总结 提出VESTA框架,基于五个风险维度自动生成1072个可执行场景,评估12个LLM智能体在任务执行中的行为安全风险,平均攻击成功率达47.1%。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04823 2026-09-01 cs.AI cs.CL

DR-LoRA: Dynamic Rank LoRA for Fine-Tuning Mixture-of-Experts Models

DR-LoRA:动态秩LoRA用于混合专家模型的微调

Guanzhi Deng, Bo Li, Ronghao Chen, Xiujin Liu, Zhuo Han, Huacan Wang, Lijie Wen, Linqi Song

机构 * City University of Hong Kong(香港城市大学) Tsinghua University(清华大学) Peking University(北京大学) University of Michigan(密歇根大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 DR-LoRA通过动态分配不同秩的LoRA模块,提升混合专家模型微调效果,实验表明其优于传统方法。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15281 2026-09-01 cs.CV 版本更新

StableWorld: Towards Stable and Consistent Long Interactive Video Generation

StableWorld: 向稳定和一致的长交互视频生成迈进

Ying Yang, Zhengyao Lv, Yujia Zeng, Tianlin Pan, Haofan Wang, Yueming Lyu, Binxin Yang, Hubery Yin, Chen Li, Jing Lyu, Ziwei Liu, Chenyang Si

机构 * PRLab, NJU(南京大学PRLab) HKU(香港大学) UCAS(中国科学技术大学) WeChat, Tencent Inc.(腾讯公司) NTU(国立清华大学)

AI总结 StableWorld通过动态帧淘汰机制提升长交互视频生成的稳定性和时间一致性,适用于多种生成框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04035 2026-09-01 cs.AI 版本更新

MobileDreamer: Generative Sketch World Model for GUI Agent

MobileDreamer: 用于GUI代理的生成式草图世界模型

Yilin Cao, Yufeng Zhong, Zhixiong Zeng, Siran Dai, Liming Zheng, Jing Huang, Haibo Qiu, Peng Shi, Wenji Mao

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Meituan(美团)

AI总结 MobileDreamer通过生成式草图世界模型和rollout想象策略,提升GUI代理在长周期任务中的决策能力,任务成功率提升5.25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06422 2026-09-01 cs.CV 版本更新

Phantom-Insight: Adaptive Multi-cue Fusion for Video Camouflaged Object Detection with Multimodal LLM

Phantom-Insight:基于多模态大语言模型的视频伪装目标自适应多线索融合检测方法

Hua Zhang, Changjiang Luo

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

AI总结 该研究针对视频伪装目标检测的两大问题,提出Phantom-Insight方法,通过多线索融合与解耦学习优化SAM,在MoCA-Mask数据集上达最优性能,且泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09557 2026-09-01 cs.CV cs.AI 版本更新

Evidence-Grounded Trustworthy Multimodal Reasoning and Evaluation Benchmark in Complex Urban Scenes

复杂城市场景中基于证据的可信多模态推理与评估基准

Zhaoyang Wei, Bowen Jiang, Xumeng Han, Jiashu Li, Xuehui Yu, Yuling Liu, Guorong Li, Zhenjun Han, Jianbin Jiao

机构 * University of Chinese Academy of Sciences(UCAS)(中国科学院大学)

AI总结 针对多模态大语言模型在复杂城市场景中推理可靠性不足及现有基准无法诊断推理过程的问题,提出AD2-Bench基准与EGVOR方法,提升了不利条件下多模态推理的稳定性。

Comments Accepted by IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17537 2026-09-01 cs.CL 版本更新

Popular but Wrong: Understanding and Mitigating LLM Overconfidence through Knowledge Popularity

流行但错误:通过知识流行度理解和缓解大语言模型(LLM)的过度自信

Shiyu Ni, Keping Bi, Jiafeng Guo, Xueqi Cheng

机构 * CAS Key Lab of Network Data Science and Technology, ICT, CAS(中国科学院信息科技研究院网络数据科学与技术重点实验室) State Key Laboratory of AI Safety(人工智能安全国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 该研究针对LLM过度自信问题,从知识流行度角度分析发现流行但错误的答案会加剧过度自信,通过融入知识流行度信号可显著缓解过度自信并提升置信度估计效果。

Comments EMNLP2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16157 2026-09-01 cs.CV 版本更新

Fast and Accurate Image Restoration and Generation with Rank Enhanced Linear Attention

基于秩增强线性注意力的快速准确图像恢复与生成

Yuang Ai

机构 * University of Chinese Academy of Sciences(中国科学院大学)

AI总结 研究旨在解决Transformer自注意力二次复杂度问题,提出秩增强线性注意力(RELA)及高效视觉Transformer(LAformer),通过集成深度卷积丰富特征表示,经实验验证LAformer在图像恢复和生成任务中性能优且计算高效。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18176 2026-09-01 cs.CV cs.AI 版本更新

CLIPure: Purification in Latent Space via CLIP for Adversarially Robust Zero-Shot Classification

CLIPure:基于CLIP的潜在空间纯化用于对抗鲁棒零样本分类

Mingkun Zhang, Keping Bi, Wei Chen, Jiafeng Guo, Xueqi Cheng

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 该研究提出CLIPure,一种基于CLIP多模态潜在空间的对抗鲁棒零样本分类纯化方法,含两个变体,在多个数据集上大幅提升了对抗鲁棒性,其中CLIPure-Cos不依赖生成模型且防御效率更高。

Comments accepted by ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏