arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2272 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 2272 篇

2606.26366 2026-07-10 cs.AI cs.CL cs.CY 新提交 57%

Narration-of-Thought: Inference-Time Scaffolding for Defeasible Ethical Reasoning in Large Language Models

思维叙述:大型语言模型中可废止伦理推理的推理时支架

Patrick Cooper, Alvaro Velasquez

机构 * Department of Computer Science(计算机科学系) University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 针对道德困境中标准思维链的两种失败模式,提出思维叙述(NoT)系统提示,将思维链结构化为五个部分,无需训练即可大幅减少利益相关者崩溃和不确定性抑制,并通过消融实验和跨家族训练法官验证其有效性。

Comments 24 pages, 8 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07663 2026-07-09 cs.AI 新提交 57%

Recursive Self-Improvement in AI: From Bounded Self-Refinement to Autonomous Research Loops

人工智能中的递归自我改进:从有界自我优化到自主研究循环

Mingguang Chen, Licheng Wang, Bo Qu

机构 * University of California, Riverside (UCR)(加州大学河滨分校) AlphaAvatar(阿尔法阿凡达) Illinois Institute of Technology (IIT)(伊利诺伊理工学院)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 研究人工智能系统自身改进,通过对1250篇论文调查区分有界自我优化与开放式递归自我改进(RSI),考察评估器设计空间并排序信号,发现自我改进强度与层次相关,失败模式源于违规,指出治理级测量是薄弱环节。

Comments 42 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07189 2026-07-09 cs.AI 新提交 57%

Does AI Understand Imaging? A Systematic Benchmark of Agentic AI for Computational Imaging Tasks

人工智能理解成像吗?计算成像任务中智能体人工智能的系统基准测试

Ethan Chung, Chuanjun Zheng, Jasper Tan, Jingxi Li, Haopeng Zhang, Huaijin Chen

机构 * University of Hawaii at Manoa(夏威夷大学马诺阿分校) Glass Imaging(玻璃成像公司)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI

AI总结 研究人工智能在计算成像任务中的表现,提出ImagingBench基准测试,涵盖五类20个任务及三种评估设置,对多模态系统测试发现智能体模型比专门方法弱,该基准可测差距与跟踪进展。

Comments 14 pages, 11 figures. Preprint / work in progress. Paper Webpage: https://cirp-lab.github.io/imagingbench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06649 2026-07-09 cs.CR cs.LG 新提交 57%

POPS: Recovering Unlearned Multi-Modality Knowledge in MLLMs with Prompt-Optimized Parameter Shaking

POPS:通过提示优化参数抖动恢复多模态大语言模型中未学习的多模态知识

Zhangheng LI, Jianing Zhu, Junyuan Hong, Sungmin Eum, Shuowen Hu, Suya You, Zhangyang Wang

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.LG

AI总结 研究针对多模态大语言模型中隐私敏感信息擦除不彻底问题,提出POPS对抗策略,通过提示后缀优化生成潜在私人示例并微调模型,实验揭示现有MMU算法弱点,POPS能近乎完全恢复敏感信息,暴露隐私保护漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14152 2026-07-08 cs.CL cs.AI cs.CR cs.CY 版本更新 57%

ROK-FORTRESS: Measuring the Effect of Geopolitical Transcreation for National Security and Public Safety

ROK-FORTRESS:衡量地缘政治转译对国家安全和公共安全的影响

Michael S. Lee, Yash Maurya, Drew Rein, Bert Herring, Jonathan Nguyen, Kyungho Song, Udari Madhushani Sehwag, Jiyeon Cho, Kaustubh Deshpande, Yeongkyun Jang, Jiyeon Joo, Minn Seok Choi, Evi Fuelle, Christina Q. Knight, Joseph Brandifino, Max Fenkell

机构 * Scale AI

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 本文提出ROK-FORTRESS基准,通过英韩语言对和美韩地缘政治轴,评估语言与地缘政治交互对国家安全的影响,发现韩语版本存在压制效应,且模型间表现差异显著。

Comments 16 pages main text + appendix (74 pages total), 4 figures and 2 tables in main text; dataset at https://huggingface.co/datasets/ScaleAI/ROK-FORTRESS_public

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03677 2026-07-07 cs.LG 版本更新 57%

Uni-OPD: Unifying On-Policy Distillation with a Dual-Perspective Recipe

Uni-OPD:基于双视角方案的统一策略内蒸馏框架

Wenjin Hou, Shangpin Peng, Weinong Wang, Zheng Ruan, Yue Zhang, Zhenglin Zhou, Mingqi Gao, Yifei Chen, Kaiqi Wang, Hongming Yang, Chengquan Zhang, Zhuotao Tian, Han Hu, Yi Yang, Fei Wu, Hehe Fan

机构 * Zhejiang University(浙江大学) Shenzhen Loop Area Institute(深圳河套学院) LLM Department, Tencent(腾讯大模型部门)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.LG

AI总结 针对策略内蒸馏存在的信息状态探索不足、教师监督不可靠问题,提出跨大语言与多模态大模型的统一框架Uni-OPD,经多域实验验证其通用性与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02923 2026-07-07 cs.CL cs.AI 版本更新 57%

Council Mode: A Heterogeneous Multi-Agent Consensus Framework for Reducing LLM Hallucination and Bias

理事会模式:一种异质多智能体共识框架,用于减少大语言模型的幻觉和偏见

Shuai Wu, Xue Li, Yanna Feng, Yufang Li, Zhijun Wang, Ran Wang

机构 * Lead Researcher(研究员) Research Assistant(研究员) Academic Advisor(学术顾问) Research Consultant(研究顾问)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 本文提出理事会模式,通过多智能体共识框架减少LLM的幻觉和偏见,实验显示在HaluEval和TruthfulQA上 hallucination率降低35.9%,质量得分提升10.2个百分点,且在偏见方面表现更优。

Comments 24 pages, 8 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01657 2026-07-03 cs.CV 新提交 57%

Domain Generalization via Text-Anchored Information Bottleneck

基于文本锚定信息瓶颈的域泛化

Eunyi Lyou, Yunjeong Choi, Junho Lee, Joonseok Lee

机构 * Seoul National University(首尔大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 提出通过语言嵌入空间作为信息瓶颈来抑制视觉表征中的虚假线索,从而提升域泛化性能,实验表明该方法达到最新最优水平。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01457 2026-07-03 cs.CL cs.AI 新提交 57%

Grounded Optimization: A Layered Engineering Framework for Reducing LLM Hallucination in Automated Personal Document Rewriting

接地优化:一种减少自动个人文档重写中LLM幻觉的分层工程框架

Shashank Indukuri, Adarsh Agrawal

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 提出五层接地优化框架,通过时间验证、污染检测、结构不变性、提示接地和评估器,将简历重写中的幻觉率降至0.04-0.24。

Comments 13 pages, 1 figure. Equal contribution by both authors. Code and data: https://github.com/shashank-indukuri/grounded-optimization

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02329 2026-07-03 cs.AI cond-mat.mtrl-sci physics.comp-ph 新提交 57%

Grounded autonomous research: a fault-tolerant LLM pipeline from corpus to manuscript in frontier computational physics

基于语料库的前沿计算物理容错LLM流水线:从语料到论文的自主研究

Haonan Huang

机构 * Princeton University(普林斯顿大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 提出一个端到端LLM流水线,从11,083篇arXiv论文语料库出发,自主完成前沿计算物理研究,包括构思方向、复现文献、第一性原理计算和撰写论文,通过冗余设计实现容错。

Comments 39 pages, 5 figures. Accepted at the ICML 2026 AI for Science Workshop (https://openreview.net/forum?id=R5YXaPgUAx). Includes the pipeline-generated companion physics manuscript as an appendix. Data and scaffolding archive: https://doi.org/10.5281/zenodo.21126996

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30296 2026-07-02 cs.AI 版本更新 57%

ManimAgent: Self-Evolving Multimodal Agents for Visual Education

ManimAgent: 用于视觉教育的自进化多模态智能体

Wenjia Jiang, Zongyuan Cai, Yuanhang Shao, Chenru Wang, Boyan Han, Zhixue Song, Keyu Chen, Shengwei An, Xu Yang, Zhou Yang

机构 * University of Alberta(阿尔伯塔大学) Southeast University(东南大学) Virginia Tech(弗吉尼亚理工学院) Xidian University(西安电子科技大学) Vivavia Inc(Vivavia公司)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI

AI总结 提出ManimAgent,通过双通道情节记忆库跨任务传递反思经验,无需权重更新或人工种子,在代码生成任务中提升通过率并减少反思轮次。

Comments Project page: https://manimagent.github.io/. Code: https://github.com/jwj1342/Paper2Manim

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31002 2026-07-01 cs.AI cs.CL cs.LO 新提交 57%

Beyond Compilation: Evaluating Faithful Natural-Language-to-Lean Statement Formalization

超越编译:评估从自然语言到Lean的忠实语句形式化

Ke Zhang, Patricio Gallardo Candela, Sudhir Murthy, Yi Xie, Zhi Wang, Maziar Raissi

机构 * University of California, Riverside(加州大学河滨分校) University of Arizona(亚利桑那大学) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 提出忠实语句形式化评估方法,结合Lean编译、跨模型语义判断和人类专家校准,发现编译通过但语义不忠实的29.0%差距,并分解形式化流程中的关键干预因素。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28556 2026-06-30 cs.AI 57%

IMCBench: A benchmark for multimodal LLMs in Image-grounded Medical Conversations

IMCBench:面向多模态大语言模型在图像基础医疗对话中的基准测试

Maria Xenochristou, Ashutosh Joshi, Korosh Vatanparvar, Mohammad Abuzar Hashemi, Prasad Kasu, Deepak Bansal, Anchal Nema, Nivedita Wadhwa, Prashams S Jain, Rebecca Abraham, Will Kimbrough, Dilek Hakkani-Tur, Wilko Schulz-Mahlendorf

机构 * Amazon Health AI(亚马逊健康AI)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI

AI总结 提出IMCBench基准,结合临床图像与合成患者档案模拟多轮医疗对话,从安全性、准确性和不确定性使用三个维度评估模型,发现准确描述不等于安全指导。

Comments Accepted at ECML PKDD 2026. 22 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28330 2026-06-30 cs.IR cs.AI 57%

High-Dimensional Concentration and Retrieval Instability in Embedding Spaces: Implications for Retrieval-Augmented Generation

嵌入空间中的高维浓度与检索不稳定性:对检索增强生成的影响

Ernesto Lopez Fune

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 研究高维嵌入空间中距离和余弦浓度的现象,通过数值实验揭示其对最近邻检索稳定性的影响,并表明这些效应可能削弱检索增强生成中的基础可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02896 2026-06-29 cs.LG 版本更新 57%

Bridging Mechanistic Interpretability and Prompt Engineering with Gradient Ascent for Interpretable Persona Control

通过梯度上升实现可解释人格控制与提示工程的桥梁

Harshvardhan Saini, Yiming Tang, Dianbo Liu

机构 * Department of Computer Science(计算机科学系) Indian Institute of Technology (ISM), Dhanbad(印度理工学院(ISM),丹巴德) National University of Singapore(新加坡国立大学) CIFAR Fellow(CIFAR研究员)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.LG

AI总结 本文提出RESGA和SAEGA方法,利用梯度上升优化随机初始化提示,以实现与识别的人格方向更一致的表示,有效控制LLM中的人格行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01924 2026-06-29 stat.ML cs.LG stat.AP stat.ME 版本更新 57%

Non-Linear Model-Based Sequential Decision-Making in Agriculture

基于非线性模型的农业序贯决策

Sakshi Arya, Wentao Lin

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.LG

AI总结 提出基于非线性模型的bandit算法,将探索-利用策略与可解释的生物学过程(如最大产量和养分效率)相结合,实现不确定条件下的自适应肥料管理,在利润和样本效率上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26922 2026-06-26 cs.RO cs.AI 新提交 57%

Risk-Aware Selective Multimodal Driver Monitoring with Driver-State World Modeling

风险感知的选择性多模态驾驶员监控与驾驶员状态世界建模

Daosheng Qiu, Haozhuang Chi, Hao Su, Shu Long, Xinyue Miao, Yongle Dong, Wei Zhang

机构 * Hubei University(湖北大学) Nanyang Technological University(南洋理工大学) Osaka University(大阪大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI

AI总结 提出成本感知的选择性推理框架,结合轻量级RGB-生理学生网络和门控机制,在低延迟下减少不安全决策,实现可部署的多模态驾驶员监控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26602 2026-06-26 cs.CV 新提交 57%

DiCoBench: Benchmarking Multi-Image Fine-Grained Perception via Differential and Commonality Visual Cues

DiCoBench: 通过差异性和共性视觉线索进行多图像细粒度感知的基准测试

Geng Li, Yuxin Peng

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV

AI总结 提出DiCoBench,一个包含765个样本的高分辨率多图像基准,通过差异性和共性视觉线索评估多模态大模型的细粒度感知能力,发现顶尖模型与人类准确率(98.3%)差距显著。

Comments Accepted by ECCV 2026. Project page with code: https://github.com/PKU-ICST-MIPL/DICO_Bench_ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24292 2026-06-24 cs.CV 新提交 57%

ActiveScope: Actively Seeking and Correcting Perception for MLLMs

ActiveScope: 主动寻求和纠正MLLMs的感知

Yajing Wang, Chao Bi, Junshu Sun, Shufan Shen, Zhaobo Qi, Shuhui Wang, Qingming Huang

机构 * University of Chinese Academy of Sciences(中国科学院大学) State Key Lab of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(中国科学院人工智能安全国家重点实验室,计算技术研究所,北京,中国) Harbin Institute of Technology (Weihai)(哈尔滨工业大学(威海))

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV

AI总结 提出ActiveScope框架,通过语义锚点定位和干扰抑制细化模块,解决MLLMs在高分辨率图像中的细粒度感知问题,在V* Bench上达到96.34%准确率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22889 2026-06-23 cs.LG 新提交 57%

Physiology-Aware CNN and Zero-Shot Multimodal LLMs for ECG Image Classification: A Comparative Study

生理感知CNN与零样本多模态大语言模型在心电图图像分类中的比较研究

Khalil Ahammad, Derek Abbott, Mohsen Dorraki

机构 * School of Computer Science and Information Technology, Adelaide University(阿德莱德大学计算机科学与信息学院) Australian Institute for Machine Learning (AIML)(澳大利亚机器学习研究所) Pi MedTech(Pi医疗科技) School of Electrical and Electronic Engineering, Adelaide University(阿德莱德大学电子与电气工程学院)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.LG

AI总结 研究比较了零样本多模态大语言模型和生理感知CNN在正常/异常心电图图像分类中的表现,发现CNN模型稳定且准确,而LLM分类接近随机。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22474 2026-06-23 cs.CL cs.AI 新提交 57%

Not All Claims Are Equally Risky: FACTOR for Adaptive Verification in Factual Long-Form Generation

并非所有声明都同样有风险:FACTOR 用于事实性长文本生成中的自适应验证

Areeba Hassan, Arooj Kausar, Syeda Kisaa Fatima, Gibrail Islam, Mehwish Fatima

机构 * School of Electrical Engineering Computer Science (SEECS), National University of Sciences

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 提出 FACTOR 方法,通过不确定性估计、自适应语言推理验证和候选重排序,在长文本生成中按声明级别风险分配验证资源,同时提高事实性和降低验证成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20526 2026-06-23 cs.AI 新提交 57%

DeepSWIP: Quotient-WMC Counterfactuals for Neural Probabilistic Logic Programs

DeepSWIP: 神经概率逻辑程序的商-WMC反事实

Saimun Habib, Vaishak Belle, Fengxiang He

机构 * University of Edinburgh(爱丁堡大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 提出DeepSWIP,一种用于DeepProbLog程序的单世界反事实语义,通过神经物化、SWIP和加权模型计数实现精确反事实推理,实验证明比孪生网络方法快2.14倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20527 2026-06-19 cs.CL cs.CV 新提交 57%

StylisticBias: A Few Human Visual Cues Drive Most Social Biases in MLLMs

StylisticBias: 少数人类视觉线索驱动多模态大语言模型中的大部分社会偏见

Shaghayegh Kolli, Timo Cavelius, Nafiseh Nikeghbal, Samantha Dalal, Jana Diesner

机构 * Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Princeton Center for Information and Technology Policy(普林斯顿信息与技术政策中心)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV

AI总结 提出StylisticBias基准,通过控制单一视觉属性变化,发现年龄和体型主导身份层面偏见,而时尚风格等约15个属性解释近80%的偏见变化,偏见集中于少数视觉线索。

Comments Accepted to the non-archival workshops AI4Good and Culture x AI at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20469 2026-06-19 cs.LG cs.CG 新提交 57%

Fisher-Geometric Sharpness and the Implicit Bias of SGD toward Flat Minima

Fisher-几何锐度与SGD对平坦极小值的隐式偏好

Md Sakir Ahmed, Kumaresh Sarmah, Hemen Dutta

机构 * Gauhati University(高哈蒂大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.LG

AI总结 针对SGD偏好平坦极小值但欧氏锐度不具重参数化不变性的问题,提出基于Fisher信息矩阵的黎曼锐度,证明其不变性,并导出SGD稳态分布集中于平坦极小值,PAC-Bayes界联系泛化性能。

Comments 18 pages, 5 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22959 2026-06-19 cs.CV 版本更新 57%

Can Agents Distinguish Visually Hard-to-Separate Diseases in a Zero-Shot Setting? A Pilot Study

智能体能否在零样本设置中区分视觉上难以分离的疾病?一项初步研究

Zihao Zhao, Frederik Hauke, Juliana De Castilhos, Sven Nebelung, Daniel Truhn

机构 * Department of Diagnostic and Interventional Radiology, University Hospital Aachen, 52074 Aachen, Germany(诊断与介入放射科,亚琛大学医院,德国亚琛,52074)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV

AI总结 本研究探索多模态大语言模型智能体在零样本下区分视觉混淆疾病(如黑色素瘤与不典型痣、肺水肿与肺炎)的能力,提出基于对比裁决的多智能体框架,在皮肤镜数据上准确率提升11个百分点,但总体性能仍不足临床部署。

Comments Code available at https://github.com/TruhnLab/Contrastive-Agent-Reasoning. Accepted by MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04990 2026-06-17 cs.CR cs.AI 版本更新 57%

From Agent Traces to Trust: A Survey of Evidence Tracing and Execution Provenance in LLM Agents

从智能体痕迹到信任:LLM智能体中的证据追踪与执行溯源

Yiqi Wang, Jiaqi Zhang, Taotao Cai, Zirui Liu, Qingqiang Sun, Zequn Sun, Zhangkai Wu, Manqing Dong, Mingkai Zheng, Xuefei Yin, Yanming Zhu

机构 * Griffith University(格里菲斯大学) Jiangsu University(江苏大学) University of Southern Queensland(南方昆士兰大学) Peking University(北京大学) Great Bay University(大湾大学) Nanjing University(南京大学) Macquarie University(麦觉瑞大学) Southern University of Science and Technology(南方科学与技术大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 本文系统综述了LLM智能体中的证据追踪与执行溯源方法,通过统一溯源视角连接检索、工具使用、记忆等环节,提出分类体系并讨论开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01365 2026-06-16 cs.AI 版本更新 57%

Early Diagnosis of Wasted Computation in Multi-Agent LLM Systems via Failure-Aware Observability

多智能体LLM系统中浪费计算资源的早期诊断:基于故障感知的可观测性

Xianyou Li, Weiran Yan, Yichao Wu, Penghao Liang, Mengwei Yuan, Jianan Liu, Jing Yang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 提出一种故障感知的可观测性框架,通过在线轨迹信号诊断多智能体LLM系统中的浪费计算,并在GAIA验证集上评估,揭示不同故障机制及其与资源消耗的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18909 2026-06-16 cs.LG cs.SY eess.SY 版本更新 57%

Descriptive versus Regulatory Uncertainty in Bounded Predictive Systems

描述性不确定性与监管性不确定性在有界预测系统中的区别

Ahmed Gamal Eldin

机构 * Nova University Lisbon – Cairo Branch (NOVA IMS)(里斯本诺瓦大学-开罗分校区(NOVA IMS))

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.LG

AI总结 本文研究了有界预测系统中描述性不确定性与监管性不确定性的区别,证明了当前Transformer架构在推理时仅限于描述性不确定性,并通过热力学原理和实验验证了这种区别,发现熵与准确性相互正交,且系统规模不影响熵的平坦性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12040 2026-06-12 cs.AI cs.GR 新提交 57%

A Lightweight Multi-Agent Framework for Automated Concrete Barrier Design

一种用于自动混凝土护栏设计的轻量级多智能体框架

Wanting Wang, Xiye Ma, Yuyang He, Minghui Cheng, Ran Cao

机构 * College of Civil Engineering, Hunan University(湖南大学土木工程学院) Department of Civil and Architectural Engineering, University of Miami(迈阿密大学土木与建筑系) School of Architecture, University of Miami(迈阿密大学建筑学院)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 提出基于AutoGen的“生成-评估-优化”闭环多智能体框架,实现混凝土护栏自动设计,准确率超98%,且8B参数轻量模型可优于631B旗舰模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08765 2026-06-12 cs.RO cs.CV 新提交 57%

RGB-S: Image-Aligned Tactile Saliency for Robust Dexterous Manipulation

RGB-S: 用于鲁棒灵巧操作的图像对齐触觉显著性

Shengcheng Luo, Kefei Wu, Xiaoying Zhou, Wanlin Li, Ziyuan Jiao, Chenxi Xiao

机构 * ShanghaiTech University(上海科技大学) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.CV

AI总结 提出RGB-S框架,通过正向运动学和相机标定将触觉传感器位置投影到RGB图像平面,生成力调制高斯显著性图,显式对齐触觉与视觉,在严重遮挡下灵巧操作成功率提升26.7个百分点。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏