arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10530 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10530 篇

2605.12313 2026-05-13 cs.CL cs.IR 57%

Overview of the MedHopQA track at BioCreative IX: track description, participation and evaluation of systems for multi-hop medical question answering

BioCreative IX MedHopQA 轨道概述:轨道描述、参与及多跳医学问答系统评估

Rezarta Islamaj, Joey Chan, Robert Leaman, Jongmyung Jung, Hyeongsoon Hwang, Quoc-An Nguyen, Hoang-Quynh Le, Harikrishnan Gurushankar Saisudha, Ganesh Chandrasekar, Rustam R. Taktashov, Nadezhda Yu. Bizyukova, Sofia I. R. Conceição, Paulo R. C. Lopes, Reem Abdel Salam, Mary Adewunmi, Zhiyong Lu

机构 * National Library of Medicine (NLM), National Institutes of Health (NIH)(美国国家医学图书馆(NLM)、国家卫生研究院(NIH)) University of Illinois at Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) Korea University(韩国大学) VNU University of Engineering and Technology, Hanoi, Vietnam(越南河内工程大学) Concordia University, Montreal, QC, CA(蒙特利尔大学) Institute of Biomedical Chemistry (IBMC), 10 bld. 8, Pogodinskaya str., 119121 Moscow, Russia(俄罗斯生物医学化学研究所(IBMC)) LASIGE, Departamento de Informática, Faculdade de Ciências, Universidade de Lisboa, 1749-016 Lisbon, Portugal(葡萄牙里斯本大学 LASIGE 实验室) Faculty of Engineering, Computer Engineering Department Cairo University(埃及开罗大学工程学院) Menzies School of Health Research, Charles Darwin University, NT, Australia(澳大利亚查尔斯达尔文大学梅恩兹健康研究中心) CaresAI, Australia(澳大利亚 CaresAI)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文介绍了BioCreative IX MedHopQA共享任务,旨在评估大型语言模型在多跳推理中的表现,通过构建1000个挑战性问题,展示了检索增强生成策略的重要性,并提供了公开数据集和评估结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12156 2026-05-13 cs.CL cs.SI 57%

Latent Causal Void: Explicit Missing-Context Reconstruction for Misinformation Detection

潜在因果空洞:为虚假信息检测的显式缺失上下文重建

Hui Li, Zhongquan Jian, Jinsong Su, Junfeng Yao

机构 * School of Informatics, Xiamen University(厦门大学信息学院) School of Computer and Data Science, Minjiang University(闽江学院计算机与数据科学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出Latent Causal Void方法,通过显式重建缺失事实来提升虚假信息检测效果,实验表明在双语基准上优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12105 2026-05-13 cs.AI 57%

Autonomy and Agency in Agentic AI: Architectural Tactics for Regulated Contexts

自主性与代理性在代理AI中的作用:受监管环境中的架构策略

Damir Safin, Dian Balta

机构 * fortiss GmbH(fortiss公司) Research Institute of the Free State of Bavaria for software-intensive systems(巴伐利亚自由州软件密集系统研究机构)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一个二维设计空间,通过六个架构策略和五个部署参数,为受监管环境中的代理AI设计提供原则性指导,强调责任、可审计性和可逆性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12022 2026-05-13 cs.CL 57%

SAGE: Scalable Automated Robustness Augmentation for LLM Knowledge Evaluation

SAGE:可扩展的自动鲁棒性增强用于LLM知识评估

Xiaoyuan Li, Yuzhe Wang, Moxin Li, Keqin Bao, Rui Men, Yichang Zhang, Dayiheng Liu, Wenjie Wang, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团) National University of Singapore(新加坡国立大学)

专题命中 推理评测 :verifier(abstract);分类 cs.CL

AI总结 SAGE通过细调小型模型构建大规模鲁棒性增强的知识评估基准,成本显著低于人工标注的HellaSwag-Pro,且细调模型可泛化至MMLU。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08151 2026-05-13 cs.DC cs.AI 57%

SPECTRE: Hybrid Ordinary-Parallel Speculative Serving for Resource-Efficient LLM Inference

SPECTRE:混合普通-并行推测服务用于资源高效的LLM推理

Jincheng Xie, Yawen Ling, Qi Xiao, Feiyu Zhang, Zhongyi Huang, Wen Hu, Yu Zheng

机构 * Tsinghua University(清华大学) AI Infra Team at JDT(AI基础设施团队) JD iCity, JD Technology, JD Intelligent Cities Research(京东i城、京东科技、京东智能城市研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 SPECTRE通过利用未充分利用的尾部模型服务作为远程草稿生成器,提升大型模型推理效率,采用混合策略、推测优先调度和草稿压缩技术,实现并行处理,提升吞吐量并减少干扰。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13841 2026-05-13 cs.CL 57%

The Challenge and Reward of Fair Play in Narrative: A Computational Approach

叙事中的公平游戏挑战与回报:一种计算方法

Eitan Wagner, Renana Keydar, Omri Abend

机构 * Department of Computer Science Hebrew University of Jerusalem(计算机科学系 Hebrew University of Jerusalem) Department of Law and Digital Humanities Hebrew University of Jerusalem(法律与数字人文系 Hebrew University of Jerusalem)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文通过信息论框架分析叙事中的意外与连贯性,提出公平游戏平衡机制,利用大语言模型验证理论,发现惊喜与连贯性不正相关,且文学作品中克里斯蒂的叙事更符合公平游戏标准。

Comments 47 pages, 11 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11813 2026-05-13 cs.AI 57%

Automated Reformulation of Robust Optimization via Memory-Augmented Large Language Models

通过记忆增强的大语言模型实现鲁棒优化的自动化重述

Jinbiao Chen, Shuang Jin, Guoyun Zhang, Junyu Zhang, Guanyi Wang, Hanzhang Qin

机构 * Department of Industrial Systems Engineering and Management, National University of Singapore(新加坡国立大学工业系统工程与管理系) Department of Data and Systems Engineering, The University of Hong Kong(香港大学数据与系统工程系) Institute of Operations Research and Analytics, National University of Singapore(新加坡国立大学运筹与分析研究所) Agency for Science, Technology and Research (A*STAR)(科技研究局(A*STAR))

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AutoREM框架,通过记忆增强提升鲁棒优化重述的准确性和效率,无需领域知识或参数更新,适用于不同基础大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11663 2026-05-13 cs.CL 57%

Human-Grounded Multimodal Benchmark with 900K-Scale Aggregated Student Response Distributions from Japan's National Assessment of Academic Ability

具有90万规模日本全国学业能力评估学生响应分布的多模态基准

Kyosuke Takami, Yuka Tateisi, Satoshi Sekine, Yusuke Miyao

机构 * Osaka Kyoiku University(大阪教养大学) University of Tokyo(东京大学) NII LLMC(日本国家信息与通信技术研究所大语言模型中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一个基于日本全国学业能力评估的多模态数据集,包含真实考试布局、图表和教育文本,用于评估多模态大语言模型的性能,通过精确匹配准确率和字符级F1分数分析不同学科间的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11269 2026-05-13 gr-qc astro-ph.HE astro-ph.IM cs.AI 57%

gwBenchmarks: Stress-Testing LLM Agents on High-Precision Gravitational Wave Astronomy

gwBenchmarks: 对高精度引力波天文学中LLM代理的应力测试

Tousif Islam, Digvijay Wadekar, Zihan Zhou

机构 * Kavli Institute for Theoretical Physics, University of California Santa Barbara, Kohn Hall, Lagoon Rd, Santa Barbara, CA 93106(加州大学圣芭芭拉分校凯弗利理论物理研究所) Center for Gravitational Physics, University of Texas at Austin, Austin, TX 78712, USA(德克萨斯大学奥斯汀分校引力物理中心) Department of Physics, Princeton University, Princeton, NJ 08540, USA(普林斯顿大学物理系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了最先进的LLM编码代理能否完成端到端的科学建模任务,通过八个任务测试其精度和物理系统推理能力,发现代理在复杂任务上表现不佳,无法达到领域要求。

Comments 26 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11255 2026-05-13 cs.CL 57%

HEBATRON: A Hebrew-Specialized Open-Weight Mixture-of-Experts Language Model

HEBATRON:一种 Hebrew 专用的开放权重混合专家语言模型

Noam Kayzer, Dan Revital, Ori Bar Joseph, Smadar Arvatz, Or Levi, Tal Geva, Shaltiel Shmidman, Amir DN Cohen, Noam Ordan, Omer Baruch, Kate Zinkovskaia, Zevi Apini, Sarel Weinberger

机构 * PwC(普华永道)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 HEBATRON基于NVIDIA Nemotron-3架构,通过三阶段课程学习提升性能,实现Hebrew推理准确率73.8%,并在长上下文支持下达到9倍推理吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11224 2026-05-13 cs.CV cs.AI 57%

ABRA: Agent Benchmark for Radiology Applications

ABRA:放射学应用代理基准测试

Bulat Maksudov, Vladislav Kurenkov, Kathleen M. Curran, Alessandra Mileo

机构 * School of Computing(计算学院) Dublin City University(都柏林城市大学) School of Medicine(医学院) University College Dublin(都柏林大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 ABRA是一个放射学代理基准测试,通过21个功能调用工具操作OHIF查看器和Orthanc DICOM服务器,包含655个生成任务,评估代理在规划、执行和结果方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11188 2026-05-13 cs.CR cs.AI cs.ET 57%

Adversarial SQL Injection Generation with LLM-Based Architectures

基于LLM架构的对抗性SQL注入生成

Ali Karakoc, H. Birkan Yilmaz

机构 * Department of Computer Engineering, NETLAB(计算机工程系,NETLAB)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出RADAGAS和RefleXQLi两种LLM-based系统,评估其在10个WAF和MySQL验证器上的对抗性SQL注入生成性能,发现RADAGAS-GPT4o在绕过WAFs方面表现优异。

Comments 32 pages, 8 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10865 2026-05-13 cs.AI cs.CV cs.SE 57%

BenchCAD: A Comprehensive, Industry-Standard Benchmark for Programmatic CAD

BenchCAD: 一个全面的、行业标准的程序化CAD基准测试

Haozhe Zhang, Kaichen Liu, Miaomiao Chen, Lei Li, Shaojie Yang, Cheng Peng, Hanjie Chen

机构 * University of Virginia(弗吉尼亚大学) University of California, San Diego(加州大学圣地亚哥分校) Rice University(莱斯大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 BenchCAD通过视觉问答、代码问答、图像到代码生成和指令引导的代码编辑评估模型,发现当前系统在生成精确参数化CAD程序方面存在不足,需进一步改进工业应用能力。

Comments 9 page 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10357 2026-05-13 cs.MM cs.AI 57%

RW-Post: Auditable Evidence-Grounded Multimodal Fact-Checking in the Wild

RW-Post: 实时可审计的多模态事实核查证据基础

Danni Xu, Shaojing Fan, Harry Cheng, Mohan Kankanhalli

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 RW-Post提出一个可审计的多模态事实核查基准,通过人机协同提取和审计流程,链接社交媒体帖子与推理轨迹及证据项,评估不同场景下的视觉 grounding 和证据利用能力。

Comments This submission was made in error. It was intended to replace the existing submission arXiv:2512.22933 rather than create a new submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05752 2026-05-13 cs.CL cs.SE 57%

AutoMonitor-Bench: Evaluating the Reliability of LLM-Based Misbehavior Monitor

AutoMonitor-Bench:评估基于LLM的误行监控可靠性

Shu Yang, Jingyu Hu, Tong Li, Hanqi Yan, Wenxuan Wang, Di Wang

机构 * King Abdullah University of Science and Technology(卡塔尔国王 Abdullah 科学与技术大学) University of Bristol(布里斯托大学) Washington University in St. Louis(圣路易斯华盛顿大学) King’s College London(伦敦国王学院) Renmin University of China(中国人民大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出AutoMonitor-Bench,首个系统评估LLM误行监控可靠性的基准,包含3010个标注样本,通过MR和FAR指标评估12个模型,揭示监控性能的差异及安全与效用的权衡。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10833 2026-05-12 cs.CV cs.AI 57%

MMVIAD: Multi-view Multi-task Video Understanding for Industrial Anomaly Detection

MMVIAD:多视角多任务视频理解用于工业异常检测

Xiran Zhao, Jing Jin, Yan Bai, Zhongan Wang, Yifeng Sun, Yihang Lou, Xuanyu Zhu, Tao Feng, Yingna Wu

机构 * ShanghaiTech University(上海科技大学) Tsinghua University(清华大学) Meituan Inc.(美团公司) Peking University(北京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出MMVIAD,首个工业异常检测连续多视角视频数据集及多任务评估基准,通过两阶段训练流程提升模型泛化能力,在四个任务中取得优于GPT-5.4的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10808 2026-05-12 cs.CR cs.AI 57%

Threat Modelling using Domain-Adapted Language Models: Empirical Evaluation and Insights

基于领域适应语言模型的威胁建模:实证评估与洞察

Saba Pourhanifeh, AbdulAziz AbdulGhaffar, Ashraf Matrawy

机构 * Department of Systems(系统部) School of Information Technology(信息技术学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文通过评估不同规模的领域适应语言模型,探讨了领域适应、模型规模、解码策略和提示技术对STRIDE威胁分类的影响,揭示了当前LLM在结构化威胁建模中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10597 2026-05-12 cs.SE cs.AI 57%

CrackMeBench: Binary Reverse Engineering for Agents

CrackMeBench:用于代理的二进制逆向工程

Isaac David, Arthur Gervais

机构 * University College London(伦敦大学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 CrackMeBench旨在评估语言模型代理在教育类CrackMe逆向工程任务中的能力,通过确定性二进制验证问题,结合公开校准CrackMe和生成任务,测试代理在无网络LinuxDocker沙箱中的表现,提供可重复的测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10397 2026-05-12 cs.CV cs.AI 57%

AnomalyClaw: A Universal Visual Anomaly Detection Agent via Tool-Grounded Refutation

AnomalyClaw:通过工具引导的反驳实现通用视觉异常检测代理

Xi Jiang, Yinjie Zhao, Zesheng Yang, Feng Zheng

机构 * Department of Computer Science and Engineering, Southern University of Science and Technology (SUSTech), Shenzhen, China(南方科技大学计算机科学与工程系,深圳,中国) School of EEE, Nanyang Technological University (NTU), Singapore(南洋理工大学电子工程学院,新加坡) CFAR, Agency for Science, Technology and Research (A*STAR), Singapore(科技研究局(A*STAR)的CFAR,新加坡)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AnomalyClaw,一种无需训练的视觉异常检测代理,通过多轮反驳过程提升异常判断。在CrossDomainVAD-12基准上,AnomalyClaw在多个模型上均取得显著提升,且引入自演化扩展提升模型性能。

Comments We release the agent, the benchmark, and the analysis artifacts at https://github.com/jam-cc/AnomalyClaw

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10339 2026-05-12 cs.CL 57%

An Annotation Scheme and Classifier for Personal Facts in Dialogue

对话中个人事实的标注方案与分类器

Konstantin Zaitsev

机构 * HSE University(俄罗斯莫斯科高等经济学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出改进的个人事实分类标注方案,引入新类别和属性以提升对话系统中的事实存储与过滤能力,并训练多头分类器,实现81.6%的宏F1分数,优于现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10120 2026-05-12 cs.CV cs.AI 57%

MicroWorld: Empowering Multimodal Large Language Models to Bridge the Microscopic Domain Gap with Multimodal Attribute Graph

MicroWorld: 通过多模态属性图赋能多模态大语言模型,弥合微观领域差距

Manyu Li, Ruian He, Chenxi Ma, Weimin Tan, Bo Yan

机构 * Shanghai Key Laboratory of Intelligent Information Processing(上海智能信息处理关键实验室) School of Computer Science, Fudan University(复旦大学计算机科学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 MicroWorld通过构建多模态属性图增强多模态大语言模型在微观领域的能力,无需领域微调即可提升推理性能,实验显示在MicroVQA和MicroBench基准上均取得显著提升。

Comments 29 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28902 2026-05-12 cs.AI 57%

ChartDiff: A Large-Scale Benchmark for Comprehending Pairs of Charts

ChartDiff:一种大规模的图表对理解基准

Rongtian Ye

机构 * Department of Computer Science, Aalto University(阿尔托大学计算机科学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ChartDiff,首个大规模多图表对比总结基准,通过8541对图表数据评估不同模型,揭示通用模型与专用模型在对比总结中的性能差异。

Comments 21 pages, 17 figures, accepted to ACL 2026: the 4th Workshop on Advances in Language and Vision Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22963 2026-05-12 cs.RO cs.AI 57%

Commanding Humanoid by Free-form Language: A Large Language Action Model with Unified Motion Vocabulary

通过自由形式语言控制人形机器人:一个统一动作词汇的大型语言动作模型

Zhirui Liu, Kaiyang Ji, Ke Yang, Yahao Fan, Jingyi Yu, Ye Shi, Jingya Wang

机构 * ShanghaiTech University(上海科技大学)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出Humanoid-LLA模型,通过统一的人形机器人动作词汇解决语言与动作数据稀缺及物理稳定性问题,实现自由语言指令到全身动作的直接转换,提升人形机器人在真实环境中的泛化能力和动作多样性。

Comments Project page: https://humanoidlla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18923 2026-05-12 cs.CL 57%

Holmes: A Benchmark to Assess the Linguistic Competence of Language Models

Holmes:一个评估语言模型语言能力的基准

Andreas Waldis, Yotam Perlitz, Leshem Choshen, Yufang Hou, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab)(通用知识处理实验室) Technical University of Darmstadt(达姆施塔特技术大学) Information Systems Research Lab(信息系统研究实验室) Lucerne University of Applied Sciences and Arts(卢塞恩应用科学与艺术大学) IBM Research AI(IBM AI研究部) MIT CSAIL(MIT CSAIL实验室) MIT-IBM Watson AI Lab(MIT-IBM沃森AI实验室) IBM Research Europe - Ireland(IBM欧洲爱尔兰研究部)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 Holmes基准通过分类器探测方法评估语言模型对语法、形态学等语言现象的理解,发现模型大小、架构和指令微调显著影响性能,提出FlashHolmes提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10038 2026-05-12 cs.AI 57%

TimeClaw: A Time-Series AI Agent with Exploratory Execution Learning

TimeClaw: 一种具备探索性执行学习的时间序列AI代理

Hangchen Liu, Dongyuan Li, Renhe Jiang, Jiewen Deng, Weiwei Ye, Yoshihide Sekimoto

机构 * The University of Tokyo(东京大学) Southern University of Science and Technology(南方科技大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 TimeClaw通过探索-比较-蒸馏-再注入四阶段循环,提升时间序列任务的探索性执行学习能力,在金融和天气预测中取得一致优势。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09295 2026-05-12 cs.CL 57%

LEAF-SQL: Level-wise Exploration with Adaptive Fine-graining for Text-to-SQL Skeleton Prediction

LEAF-SQL: 基于分层探索与自适应细化的文本到SQL骨架预测

Zhao Tan, Xiping Liu, Qing Shu, Qizhi Wan, Dexi Liu, Changxuan Wan

机构 * School of Computing(计算学院) Artificial Intelligence(人工智能) Jiangxi University of Finance(江西财经大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 LEAF-SQL通过分层探索与自适应细化方法,提升复杂SQL生成性能,实验表明其在BIRD基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11087 2026-05-12 cs.LG 57%

CausalGaze: Unveiling Hallucinations via Counterfactual Graph Intervention in Large Language Models

CausalGaze: 通过反事实图干预揭示大语言模型的幻觉

Linggang Kong, Lei Wu, Yunlong Zhang, Xiaofeng Zhong, Zhen Wang, Yongjie Wang, Yao Pan

机构 * College of Electronic Engineering, National University of Defense Technology(国防科技大学电子工程学院) Anhui Province Key Laboratory of Cyberspace Security Situation Awareness and Evaluation(安徽省网络空间安全态势感知与评估重点实验室) Institute of Computer Application, China Academy of Engineering Physics(中国工程物理研究院计算机应用研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 CausalGaze通过反事实图干预揭示大语言模型的幻觉,利用结构因果模型提升模型可解释性,在四个数据集和三个常用LLM上实验表明其有效性,尤其在TruthfulQA数据集上比现有方法提升3.3%的AUROC。

Comments Accepted as ACL2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02954 2026-05-12 cs.SD cs.AI 57%

The World is Not Mono: Enabling Spatial Understanding in Large Audio-Language Models

世界并非单一声场:为大型音频-语言模型启用空间理解

Yuhuan You, Lai Wei, Xihong Wu, Tianshu Qu

机构 * School of Intelligence Science and Technology(智能科学与技术学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出TWNM框架,通过物理基础的FOA模拟和元数据引导训练,实现音频场景分析的三层次能力,提升空间音频语言理解的准确性和可审计性。

Comments 25 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09222 2026-05-12 cs.DB cs.AI cs.SE 57%

Detect, Localize, and Explain: Interactive Hierarchical Log Anomaly Analytics with LLM Augmentation

检测、定位与解释:基于LLM增强的交互式分层日志异常分析

Lei Ma, Suhani Chaudhary, Ethan Shanbaum, Athanasios Tassiadamis, Peter M. VanNostrand, Dennis M. Hofmann, Haowen Xu, Elke Rundensteiner

机构 * Worcester Polytechnic Institute, USA(沃斯特理工学院,美国) University of Nevada, Las Vegas, USA(内华达大学拉斯维加斯分校,美国)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Krone系统,通过分层日志抽象和 orchestration 框架,结合LLM推理实现日志异常的精准检测、定位与解释,提供交互式可视化工具支持软件工程师和系统运维人员进行可解释的分层日志分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09152 2026-05-12 cs.CL q-bio.NC 57%

Meow-Omni 1: A Multimodal Large Language Model for Feline Ethology

Meow-Omni 1:用于猫类行为学的多模态大语言模型

Jucheng Hu, Zhangquan Chen, Yulin Chen, Chengjie Hong, Liang Zhou, Tairan Wang, Sifei Li, Giulio Zhu, Feng Zhou, Yiheng Zeng, Suorong Yang, Dongzhan Zhou

机构 * University College London(伦敦大学学院) Tsinghua University(清华大学) Nanjing University(南京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 Meow-Omni 1通过融合视频、音频和生理时间序列数据,实现对动物意图的精准识别,其在MeowBench基准测试中达到71.16%的准确率,推动了跨物种意图理解及基础模型在兽医诊断和野生动物保护中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏