arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanyang Technological University(南洋理工大学)

2026-02-04 至 2026-02-04 共收录 11
2602.03485 2026-02-04 cs.CL cs.AI cs.LG

Self-Verification Dilemma: Experience-Driven Suppression of Overused Checking in LLM Reasoning

自我验证困境:经验驱动的过度验证抑制在大语言模型推理中

Quanyu Long, Kai Jie Jiang, Jianda Chen, Xu Guo, Leilei Gan, Wenya Wang

机构 * Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学)

AI总结 本文提出了一种经验驱动的测试时框架,通过抑制过度的自我验证步骤,减少大语言模型推理中的token使用,同时保持或提升准确性。

Comments 19 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03373 2026-02-04 cs.CV

Unifying Watermarking via Dimension-Aware Mapping

通过维度感知映射统一水印技术

Jiale Meng, Runyi Hu, Jie Zhang, Zheming Lu, Ivor Tsang, Tianwei Zhang

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

AI总结 DiM通过维度感知映射统一水印技术,在视频领域实现不同维度嵌入与提取以提升水印能力。

Comments 29 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03263 2026-02-04 cs.AI

CSR-Bench: A Benchmark for Evaluating the Cross-modal Safety and Reliability of MLLMs

CSR-Bench: 一种评估多模态大语言模型跨模态安全性和可靠性的基准

Yuxuan Liu, Yuntian Shi, Kun Wang, Haoting Shen, Kun Yang

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Nanyang Technological University(南洋理工大学)

AI总结 CSR-Bench通过四个压力测试模式评估多模态大语言模型的跨模态安全性和可靠性,发现模型在多模态输入下表现下降,且安全提升可能源于拒绝导向的启发式方法。

Comments 25 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03130 2026-02-04 cs.CV cs.CE

FinMTM: A Multi-Turn Multimodal Benchmark for Financial Reasoning and Agent Evaluation

FinMTM:面向金融推理和智能体评估的多轮多模态基准

Chenxi Zhang, Ziliang Gan, Liyun Zhu, Youwei Pang, Qing Zhang, Rongjunchen Zhang

机构 * HiThink Research(HiThink研究机构) Wuhan University(武汉大学) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Shanghai Institute of Technology(上海理工大学)

AI总结 FinMTM提出一个多轮多模态基准,用于评估金融推理和智能体任务,通过多样化数据和任务设计,揭示了VLMs在视觉感知、推理和复杂工作流中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03100 2026-02-04 cs.AI

Risky-Bench: Probing Agentic Safety Risks under Real-World Deployment

Risky-Bench: 探索现实部署中智能体安全风险

Jingnan Zheng, Yanzhen Luo, Jingjun Xu, Bingnan Liu, Yuxin Chen, Chenhang Cui, Gelei Deng, Chaochao Lu, Xiang Wang, An Zhang, Tat-Seng Chua

机构 * National University of Singapore(国立新加坡大学) University of Science and Technology of China(中国科学技术大学) Southern University of Science and Technology(南方科技大学) University of Electronic Science and Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 Risky-Bench通过基于现实部署的安全原则,系统评估智能体在复杂任务中的安全风险,适用于多种部署场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03038 2026-02-04 cs.CV cs.AI

Bongards at the Boundary of Perception and Reasoning: Programs or Language?

Bongards在感知与推理边界上的问题:程序还是语言?

Cassidy Langenfeld, Claas Beger, Gloria Geng, Wasu Top Piriyakulkij, Keya Hu, Yewen Pu, Kevin Ellis

机构 * Cornell University(康奈尔大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出了一种神经符号方法,利用大语言模型和贝叶斯优化解决Bongard问题,通过生成参数化程序化表示来提升视觉推理能力。

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02550 2026-02-04 cs.LG cs.AI

HyPAC: Cost-Efficient LLMs-Human Hybrid Annotation with PAC Error Guarantees

HyPAC: 低成本的LLM-人类混合标注与PAC误差保证

Hao Zeng, Huipeng Huang, Xinhao Qu, Jianguo Huang, Bingyi Jing, Hongxin Wei

机构 * Department of Statistics and Data Science, Southern University of Science and Technology, China(统计与数据科学系,南方科技大学) Department of Statistics, University of California at Riverside, USA(统计系,加州大学河滨分校) College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(人工智能学院,香港中文大学(深圳))

AI总结 HyPAC通过自适应路由和PAC误差保证,实现低成本高效标注,降低78.51%成本并严格控制误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02178 2026-02-04 cs.CL

AR-MAP: Are Autoregressive Large Language Models Implicit Teachers for Diffusion Large Language Models?

AR-MAP:自回归大语言模型是否是扩散大语言模型的隐式教师?

Liang Lin, Feng Xiong, Zengbin Wang, Kun Wang, Junhao Dong, Xuecai Hu, Yong Wang, Xiangxiang Chu

机构 * AMAP, Alibaba Group(AMAP,阿里巴巴集团) Nanyang Technological University(南洋理工大学)

AI总结 AR-MAP通过利用自回归大语言模型作为隐式教师,有效提升扩散大语言模型的偏好对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22513 2026-02-04 cs.AI

Why Self-Rewarding Works: Theoretical Guarantees for Iterative Alignment of Language Models

为何自我奖励有效:语言模型迭代对齐的理论保证

Shi Fu, Yingjie Wang, Shengchao Hu, Peng Wang, Dacheng Tao

机构 * Nanyang Technological University(南洋理工大学)

AI总结 本文通过理论分析揭示了自我奖励语言模型在迭代对齐中的有效性,证明了其性能随迭代次数呈指数衰减,并为线性softmax模型提供了定制化的理论保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14103 2026-02-04 cs.CR cs.AI cs.LG cs.SD eess.AS

AudioJailbreak: Jailbreak Attacks against End-to-End Large Audio-Language Models

AudioJailbreak: 对端到端大音频-语言模型的攻击

Guangke Chen, Fu Song, Zhe Zhao, Xiaojun Jia, Yang Liu, Yanchen Qiao, Weizhe Zhang, Weiping Tu, Yuhong Yang, Bo Du

机构 * Wuhan University(武汉大学) Key Laboratory of System Software (Chinese Academy of Sciences)(中国科学院系统软件重点实验室) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) State Key Laboratory of Cryptology(密码学国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Nanjing Institute of Software Technology(南京软件技术研究所) Ant Group(蚂蚁集团) Nanyang Technological University(南洋理工大学) Zhejiang Lab(浙江实验室) Pengcheng Laboratory(鹏城实验室)

AI总结 AUDIOJAILBREAK 提出了一种针对端到端大音频-语言模型的新型音频攻击方法,具备非同步性、通用性、隐蔽性和空中鲁棒性,适用于弱攻击者场景。

Comments Accepted by IEEE Transactions on Dependable and Secure Computing (TDSC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12728 2026-02-04 cs.CV cs.MM

SpecFLASH: A Latent-Guided Semi-autoregressive Speculative Decoding Framework for Efficient Multimodal Generation

SpecFLASH: 一种基于潜在引导的半自回归推测解码框架,用于高效多模态生成

Zihua Wang, Ruibo Li, Haozhe Du, Joey Tianyi Zhou, Yu Zhang, Xu Yang

机构 * Southeast University, Nanjing, China(东南大学) Nanyang Technological University, Singapore(南洋理工大学) A STAR Centre for Frontier AI Research (CFAR), Singapore(A STAR前沿人工智能研究中心)

AI总结 SpecFLASH是一种针对多模态生成的高效推测解码框架,通过潜在引导的token压缩和半自回归解码方案,显著提升视觉任务的解码速度。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏