arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-26 至 2026-05-26 共收录 656 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 29 篇

2605.24946 2026-05-26 cs.CV 83%

Interpretability Transfer from Language to Vision via Sparse Autoencoders

通过稀疏自编码器实现从语言到视觉的可解释性迁移

Alexey Kravets, Da Li, Chuan Li, Da Chen, Vinay P. Namboodiri

机构 * University of Bath, UK(巴斯大学) Lambda, Inc.(Lambda公司) Samsung AI Centre Cambridge(三星AI研究中心)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);language model(abstract)

AI总结 提出VISTA框架,通过约束视觉投影器将视觉token映射到LLM的文本SAE空间,实现无需专用视觉SAE的视觉可解释性,并在对象移除和替换任务上分别提升35%和47%。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05483 2026-05-26 cs.AI 83%

MMUEChange: A Generalized LLM Agent Framework for Intelligent Multi-Modal Urban Environment Change Analysis

MMUEChange:面向智能多模态城市环境变化分析的通用LLM智能体框架

Zixuan Xiao, Jun Ma, Siwei Zhang

机构 * Department of Urban Planning and Design, The University of Hong Kong(香港大学城市规划与设计系)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.AI

AI总结 提出MMUEChange多模态智能体框架,通过模块化工具包和模态控制器实现异构城市数据灵活集成与跨模态对齐,在三个城市案例中任务成功率提升46.7%并有效缓解幻觉。

Journal ref Applied Soft Computing 190 (2026) 114576

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07961 2026-05-26 cs.AI 79%

Probing the Preferences of a Language Model: Integrating Verbal and Behavioral Tests of AI Welfare

探究语言模型的偏好:整合AI福祉的言语与行为测试

Valen Tagliabue, Leonard Dung

机构 * Future Impact Group (FIG)(未来影响集团) Ruhr-University Bochum(波鸿鲁尔大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 本研究通过言语报告和行为实验(虚拟环境导航与话题选择)测量语言模型的偏好,发现偏好满足可作为AI福祉的实证代理,但测量一致性因模型和条件而异。

Comments Forthcoming in Philosophy and the Mind Sciences (PhiMiSci)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25831 2026-05-26 cs.CL cs.AI cs.LG 75%

Clarify, Abstain or Answer? Strategising in Conversation with Belief-Augmented Generation

澄清、弃权或回答?基于信念增强生成的对话策略

Joris Baan, Wilker Aziz, Barbara Plank, Raquel Fernández

机构 * University of Amsterdam(阿姆斯特丹大学) MCML Munich(慕尼黑MCML) LMU Munich(慕尼黑莱茵-魏尔堡大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出信念增强生成(BAG)方法,通过将大语言模型自身的信念状态注入提示,使其推理多个采样响应并决定对话策略(回答、澄清或弃权),从而提升多轮模糊问答的准确性和策略决策的忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24552 2026-05-26 cs.CR 75%

Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling

椭球控制:通过良性潜在建模的白名单越狱防御

Luoyu Chen, Weiqi Wang, Zhiyi Tian, Feng Wu, Ahmed Asiri, Shui Yu

专题命中 知识编辑与模型理解 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出一种基于白名单视角的测试时防御方法Ellipsoid Control,通过拟合良性数据的各向异性椭球约束投影梯度下降,在任意输入上触发拒绝同时最小化良性潜在几何的扭曲,从而在增强安全性的同时保持模型效用。

Comments Under review by TIFS

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22856 2026-05-26 eess.SP cs.AI cs.IT cs.LG cs.NI math.IT 73%

PilotWiMAE: Pilot-Native Representation Learning for Wireless Channels

PilotWiMAE:面向无线信道的导频原生表示学习

Berkay Guler, Giovanni Geraci, Hamid Jafarkhani

机构 * Center for Pervasive Communications and Computing, University of California, Irvine(加州大学尔湾分校普及通信与计算中心) Nokia and Universitat Pompeu Fabra(诺基亚与庞培法布拉大学)

专题命中 知识编辑与模型理解 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出PilotWiMAE自监督框架,直接处理噪声导频观测,通过分解注意力机制和补丁归一化重构,在缩小观测空间的同时实现跨频段波束选择和信道表征,优于监督基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16953 2026-05-26 cs.AI cs.CL 73%

How do Humans Process AI-generated Hallucination Contents: a Neuroimaging Study

人类如何处理AI生成的幻觉内容:一项神经影像学研究

Shuqi Zhu, Yi Zhong, Ziyi Ye, Bangde Du, Yujia Zhou, Qingyao Ai, Yiqun Liu

机构 * Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) Institute of Trustworthy Embodied AI, Fudan University, Shanghai, China(复旦大学可信具身人工智能研究院)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过EEG实验,研究人类在处理多模态大语言模型生成的幻觉与非幻觉内容时的神经动力学差异,揭示误判的幻觉内容未能触发标准神经认知事实验证通路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24064 2026-05-26 cs.LG cs.AI 73%

Generative Representation Learning on Hyper-relational Knowledge Graphs via Masked Discrete Diffusion

超关系知识图谱上的生成式表示学习:基于掩码离散扩散

Jaejun Lee, Seheon Kim, Joyce Jiyoung Whang

机构 * School of Computing(计算学院) Department of AI Computing, KAIST, Daejeon, South Korea(人工智能计算系,韩国科学技术院,大田,韩国)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 针对超关系知识图谱中任意掩码查询的补全与事实生成任务,提出基于掩码离散扩散的生成式表示学习方法KREPE,统一链接预测与事实生成,性能达到最优。

Comments 28 pages, 16 figures, 18 tables, 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04295 2026-05-26 cs.LG cs.AI 73%

LLMs Uncertainty Quantification via Adaptive Conformal Semantic Entropy

通过自适应共形语义熵进行LLM不确定性量化

Hamed Karimi, Vaishali Meyappan, Reza Samavi

机构 * Toronto Metropolitan University(多伦多 Metropolitan 大学) Vector Institute(向量研究所)

专题命中 知识编辑与模型理解 :LLM(title_cn);分类 cs.AI、cs.LG

AI总结 提出自适应共形语义熵(ACSE)方法,通过聚类语义熵并自适应调整不确定性分数,结合共形校准实现统计可靠的接受/弃权决策,在多个数据集上优于现有基线。

Comments Accepted for publication in the Proceedings of the 35th International Joint Conference on Artificial Intelligence (IJCAI 2026); 14 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25377 2026-05-26 cs.CV cs.AI 70%

Adversarial Orthogonal Disentanglement for LVLM Hallucination Mitigation

对抗正交解缠用于LVLM幻觉缓解

Ruoxi Cheng, Haoxuan Ma, Zhengfei Hai, Yiyan Huang, Ranjie Duan, Tianle Zhang, Xu Yang, Ziyi Ye, Xingjun Ma

机构 * Fudan University(复旦大学) Tencent(腾讯) Nanjing University(南京大学) Southeast University(东南大学) Great Bay University(大坝大学) TeleAI, China Telecom(TeleAI,中国电信)

专题命中 知识编辑与模型理解 :language model(abstract);instruction tuning(abstract);分类 cs.AI

AI总结 提出对抗正交解缠(AOD)框架,通过最小最大目标学习幻觉相关方向,并利用双前向对比解码策略,在不需额外训练的情况下缓解大型视觉语言模型(LVLM)的幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24077 2026-05-26 eess.SP cs.LG 70%

LWM-CDE: A Representation Space for Wireless Data Reasoning and Transferability

LWM-CDE:无线数据推理与可迁移性的表示空间

Sadjad Alikhani, Akshay Malhotra, Shahab Hamidi-Rad, Ahmed Alkhateeb

机构 * School of Electrical, Computer and Energy Engineering, Arizona State University(电气、计算机与能源工程学院,亚利桑那州立大学) InterDigital, Inc.(InterDigital公司)

专题命中 知识编辑与模型理解 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 提出基于预训练无线基础模型特征空间的数据集相似性框架LWM-CDE,通过对比学习和几何形状损失微调数据集嵌入,构建距离可靠指示可迁移性的结构化流形,在无线基准测试中比现有指标更高效且与经验迁移性能相关性更强。

Comments The model and relevant scripts are available on the WILab Hugging Face page: https://huggingface.co/wi-lab

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18979 2026-05-26 cs.LG 70%

Dynamic Optimization and Safety Indicator Injection for Jailbreaking Text-to-Image Models with Multimodal Safety Filters

动态优化与安全指示注入:针对多模态安全过滤器的文本到图像模型越狱方法

Zixuan Chen, Hao Lin, Ke Xu, Xinghao Jiang, Tanfeng Sun

机构 * Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出OptJail框架,通过动态提示优化与自适应安全指示注入,绕过文本和图像过滤器,实现高成功率越狱,并揭示多模态防御的系统性漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20772 2026-05-26 cs.CV 67%

VIHD: Visual Intervention-based Hallucination Detection for Medical Visual Question Answering

VIHD: 基于视觉干预的医学视觉问答幻觉检测

Jiayi Chen, Benteng Ma, Zehui Liao, Winston Chong, Yasmeen George, Jianfei Cai

机构 * Department of Data Science \& AI, Faculty of Information Technology, Monash University, Melbourne, VIC 3800, Australia Alfred Health Radiology, Alfred Health, Melbourne, VIC 3004, Australia School of Translational Medicine, Faculty of Medicine, Nursing Health Sciences, Monash University, Melbourne, VIC 3800, Australia Hong Kong Polytechnic University, Hong Kong SAR, China

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 提出VIHD方法,通过视觉依赖探测和视觉干预解码校准语义熵,有效检测医学多模态大语言模型中的幻觉响应。

Comments Early accepted by MICCAI 2026. This version of the contribution has been accepted for publication, after peer review (when applicable) but is not the Version of Record and does not reflect post-acceptance improvements, or any corrections

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25263 2026-05-26 cs.CL cs.AI 62%

Mimir: Large-scale Multilingual Concept Modeling

Mimir:大规模多语言概念建模

Elio Musacchio, Lucia Siciliani, Pierpaolo Basile

机构 * Department of Computer Science(计算机科学系) University of Bari Aldo Moro(巴里阿尔多·莫罗大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出Mimir,一个1.6B参数的大规模概念模型,通过多语言预训练和指令微调实现概念级别的理解与生成,替代传统的token预测范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01322 2026-05-26 cs.LG cs.CL 62%

PolySAE: Modeling Feature Interactions in Sparse Autoencoders via Polynomial Decoding

PolySAE: 通过多项式解码建模稀疏自编码器中的特征交互

Panagiotis Koromilas, Andreas D. Demou, James Oldfield, Yannis Panagakis, Mihalis Nicolaou

机构 * The Cyprus Institute(塞浦路斯研究所) University of Athens(雅典大学) University of Oxford(牛津大学) Archimedes AI/Athena Research Center(阿基米德AI/雅典娜研究中心) University of Cyprus(塞浦路斯大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.LG

AI总结 提出PolySAE,在稀疏自编码器解码器中引入高阶项以建模特征交互,通过低秩张量分解在共享投影子空间上捕获成对和三元特征交互,在保持可解释性的同时提升探测F1约8%,并产生与共现频率无关的组合结构。

Comments 43rd International Conference on Machine Learning (ICML 2026); Code: https://github.com/pakoromilas/PolySAE

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24057 2026-05-26 cs.LG cs.AI 62%

Feature Lottery? A Bifurcation Theory of Concept Emergence

特征彩票?概念涌现的分岔理论

Fuming Yang

机构 * MIT(麻省理工学院)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出一种基于分岔理论的方法,通过损失Hessian驱动的超临界叉形分岔检测表示动力学中的结构涌现,并引入无标签相位坐标β/β_c,在多种设置下验证了四个不同的转变阶段,揭示了特征可解释性的早期可预测性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21406 2026-05-26 cs.CV cs.LG 57%

Generation Enhances Understanding in Unified Multimodal Models via Multi-Representation Generation

通过多表示生成增强统一多模态模型的理解能力

Zihan Su, Hongyang Wei, Kangrui Cen, Yong Wang, Guanhua Chen, Chun Yuan, Xiangxiang Chu

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) AMAP, Alibaba Group(阿里妈妈,阿里巴巴集团) Shanghai Jiao Tong University(上海交通大学) Southern University of Science and Technology(南方科技大学)

专题命中 知识编辑与模型理解 :post-training(abstract);分类 cs.LG

AI总结 提出UniMRG方法,通过辅助生成像素、深度和分割等多重表示,增强统一多模态模型的理解能力,减少幻觉并提升空间理解。

Comments Code: https://github.com/Sugewud/UniMRG

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24398 2026-05-26 cs.CV cs.AI cs.GR 57%

VectorArk: Learning Practical Image Vectorization with Rounded Polygon Representation

VectorArk: 学习基于圆角多边形表示的实际图像矢量化

Tarun Gehlaut, Difan Liu, Charu Bansal, Krutik Malani, Souymodip Chakraborty, Ankit Phogat, Matthew Fisher, Vineet Batra

机构 * Adobe

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 提出VectorArk模型,采用圆角多边形表示和退化模型,实现鲁棒且实用的图像矢量化,在多个数据集上取得优越的几何完整性和伪影抑制效果。

Comments CVPR 2026. Project page: https://vectorark.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24008 2026-05-26 cs.LG cs.CV cs.SE 57%

CAFD: Concept-Aware DNN Fault Detection using VLMs

CAFD: 使用视觉语言模型的概念感知深度神经网络故障检测

Amin Abbasishahkoo, Mahboubeh Dadkhah, Lionel Briand

机构 * School of EECS, University of Ottawa(渥太华大学电子工程与计算机科学学院) Research Ireland Lero centre for software, University of Limerick(利默尼克大学爱尔兰研究中心)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.LG

AI总结 提出概念感知故障检测(CAFD)方法,通过整合模型信号、距离特征和基于视觉语言模型的概念故障比(CFR)特征,在保持效率的同时显著提升DNN故障检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25328 2026-05-26 cs.CV cs.MM 50%

DIVA: Harnessing the Representation Divergence in Unified Multimodal Models for Mutual Reinforcement

DIVA: 利用统一多模态模型中的表示差异实现相互增强

Renjie Lu, Xulong Zhang, Xiaoyang Qu, Shangfei Wang, Jianzong Wang

机构 * Ping An Technology (Shenzhen) Co., Ltd., Shenzhen, China(平安科技(深圳)有限公司,深圳,中国) University of Science and Technology of China(中国科学技术大学)

专题命中 知识编辑与模型理解 :post-training(abstract)

AI总结 针对统一多模态模型中理解与生成任务因监督信号差异导致相互干扰的问题,提出DIVA框架,通过分解视觉表示为共享和独有成分并利用互信息估计实现内部协同,在理解与生成任务上分别提升7.82%和8.46%。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他LLM 36 篇

2409.08379 2026-05-26 cs.SE cs.AI econ.GN q-fin.EC 92%

The Impact of Large Language Models on Open-source Innovation: Evidence from GitHub Copilot

大型语言模型对开源创新的影响:来自GitHub Copilot的证据

Doron Yeverechyahu, Raveesh Mayya, Gal Oestreicher-Singer

机构 * Coller School of Management, Tel Aviv University(特拉维夫大学科尔学院) Stern School of Business, New York University(纽约大学斯特恩商学院)

专题命中 其他LLM :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 利用GitHub Copilot推出的自然实验,通过三种识别策略和两种分类方法,发现LLM使开源贡献增加28%-40%,且增量贡献增长显著大于实质性贡献,表明LLM偏向于利用现有代码库而非探索新功能。

Comments JEL Classification: O31, C88, J24, O35, L86

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05004 2026-05-26 cs.CL 92%

Can Large Language Models Resolve Semantic Discrepancy in Self-Destructive Subcultures? Evidence from Jirai Kei

大语言模型能否解决自我毁灭亚文化中的语义差异?来自Jirai Kei的证据

Peng Wang, Xilin Tao, Siyi Yao, Jiageng Wu, Yuntao Zou, Zhuotao Tian, Libo Qin, Dagang Li

机构 * School of Computer Science and Engineering, Macau University of Science and Technology(澳门科技大学计算机科学与工程学院) SKLPlanets, Macau University of Science and Technology(澳门科技大学SKLPlanets) College of Software, Northeastern University(东北大学软件学院) School of Energy and Power Engineering, Huazhong University of Science and Technology(华中科技大学能源与动力工程学院) School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机科学与技术学院)

专题命中 其他LLM :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 针对亚文化中自我毁灭行为检测面临的知识滞后和语义错位问题,提出多智能体框架SAS,通过自动检索和亚文化对齐显著提升LLM检测性能,并优于现有先进方法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24421 2026-05-26 cs.CR cs.LG 92%

Poisoning the Watchtower: Prompt Injection Attacks Against LLM-Augmented Security Operations Through Adversarial Log Content

毒害瞭望塔:通过对抗性日志内容对LLM增强的安全运营进行提示注入攻击

Rohan Pandey, Archit Bhujang

机构 * DigitalOcean Arizona State University(亚利桑那州立大学)

专题命中 其他LLM :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究攻击者控制的日志字段如何向LLM注入指令(日志基底提示注入),提出四类攻击分类,并评估不同防御下的攻击成功率。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23924 2026-05-26 cs.CL cs.IR q-fin.GN 90%

Improving the Completeness and Comparability of Segment Disclosures: A Large Language Model Approach

提高分部披露的完整性和可比性:一种大语言模型方法

Yue Liu, Zhiyuan Cheng, Longying Lai

机构 * Rutgers Business School(罗格斯商学院) Rutgers University - Newark(罗格斯大学-新布朗斯维尔回声分校) School of Engineering(工程学院) Stanford University(斯坦福大学) Simon Business School(西蒙商学院) University of Rochester(罗切斯特大学)

专题命中 其他LLM :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本研究开发了一种基于大语言模型的框架,直接从10-K文件中提取分部披露信息,保留可报告和嵌套分部信息,并设计检索增强系统以支持跨公司和跨时间的可比性,从而解决结构化数据库中分部数据的完整性和可比性问题。

Comments 39 pages, 4 figures, submitted to Accounting Horizons

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06357 2026-05-26 cs.LG 90%

LLM-SAA: LLM-persona Generated Distributions for Decision-making

LLM-SAA:基于LLM人格生成分布的决策方法

Jackie Baek, Yunhan Chen, Ziyu Chi, Will Ma

机构 * Stern School of Business, New York University(纽约大学 Stern 商学院) Department of Computer Science, Columbia University(哥伦比亚大学 计算机科学系) Graduate School of Business and Data Science Institute, Columbia University(哥伦比亚大学 商学院和数据科学研究院)

专题命中 其他LLM :LLM(title,title_cn);分类 cs.LG

AI总结 研究利用LLM生成分布(如模拟消费者支付意愿)支持下游决策,通过三个经典问题(分类优化、定价、报童模型)评估其实际效用,发现低数据场景下有效,且决策无关指标(如Wasserstein距离)可能误导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06366 2026-05-26 cs.CR cs.AI 89%

SafeGPT: Preventing Data Leakage and Unethical Outputs in Enterprise LLM Use

SafeGPT:防止企业LLM使用中的数据泄露和不道德输出

Pratyush Desai, Luoxi Tang, Yuqiao Meng, Zhaohan Xi

机构 * Binghamton University(宾夕法尼亚州立大学)

专题命中 其他LLM :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出SafeGPT双护栏系统,通过输入侧检测/编辑、输出侧审核/重构及人工反馈,有效降低数据泄露风险和偏见输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23909 2026-05-26 cs.AI cs.LG 88%

Confidence Calibration in Large Language Models

大型语言模型中的置信度校准

Noam Michael, Daniel BenShushan, Jacob Bien, Don A. Moore

机构 * U.C. Berkeley(伯克利大学) University of Southern California(南加州大学)

专题命中 其他LLM :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 通过预注册研究,发现大型语言模型(LLMs)的置信度普遍高于准确率,且存在显著的难易效应:困难测试中过度自信,简单测试中信心不足,并提出了LifeEval测试用于评估不同难度下的模型校准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24490 2026-05-26 cs.AI cs.LG q-fin.PM 88%

Market Regime Council for Dynamic Credit Assignment in Multi-Agent LLM Decision Systems

市场制度委员会:多智能体LLM决策系统中的动态信用分配

Yunhua Pei, Zerui Ge, Jin Zheng, John Cartlidge

机构 * University of Bristol, UK(布里斯托大学)

专题命中 其他LLM :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出市场制度委员会(MRC),一种基于Shapley值进行在线智能体加权、贝叶斯自适应混合和制度依赖乘数的多智能体决策系统,在加密货币投资中实现高夏普比率和累计收益。

Comments 35 pages, 13 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24048 2026-05-26 cs.LG cs.AI 88%

Mixture of Complementary Agents for Robust LLM Ensemble

互补代理混合:鲁棒的大语言模型集成

Yichi Zhang, Kevin Lu, Yuang Zhang, Jie Gao, Lirong Xia, Fang-Yi Yu

机构 * DIMACS, Rutgers University(罗格斯大学DIMACS研究中心) Department of Mathematics, Rutgers University(罗格斯大学数学系) Department of Computer Science, George Mason University(乔治·梅森大学计算机科学系) Department of Computer Science, Rutgers University(罗格斯大学计算机科学系)

专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 将大语言模型选择视为组合选择问题,提出基于互补性的贪心选择算法,在性能与成本间取得最佳平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25922 2026-05-26 cs.CV 88%

Closed-Loop Bidirectional Prompting for Adversarial Robustness of Vision Language Models

闭环双向提示用于视觉语言模型的对抗鲁棒性

Xiao Liu, Jiaxiang Liu, Boci Peng, Boren Hu, Yusong Wang, Xiwen Chen, Prayag Tiwari, Liming Zhang, Mingkun Xu

机构 * University of Macau(澳门大学) Guangdong Institute of Intelligence Science and Technology(广东智能科学与技术研究院) Peking University(北京大学) Independent Researcher(独立研究员) Institute of Science Tokyo(东京科学研究院) Morgan Stanley(摩根大通) Halmstad University(哈马碧大学)

专题命中 其他LLM :language model(title,abstract);prompting(title,abstract)

AI总结 针对视觉语言模型在对抗扰动下跨模态语义对齐脆弱的问题,提出闭环双向提示方法,通过动态反馈循环恢复跨模态一致性,并引入语义锚点约束循环更新,实现实例自适应保护,在11个数据集上达到最先进的鲁棒性和泛化性能。

Comments 24 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏