arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10530 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10530 篇

2605.10831 2026-05-12 cs.LG cs.AI cs.CE cs.CL 67%

SLIM: Sparse Latent Steering for Interpretable and Property-Directed LLM-Based Molecular Editing

SLIM:稀疏潜在引导用于可解释和属性导向的基于大语言模型的分子编辑

Mingxu Zhang, Yuhan Li, Lujundong Li, Dazhong Shen, Hui Xiong, Ying Sun

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) The 63rd Research Institute, National University of Defense Technology, Nanjing(国防科技大学第六三研究所,南京)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SLIM通过稀疏潜在特征空间提升分子编辑效果,实现属性导向的可解释编辑,实验显示在多个分子属性上提升达42.4个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10530 2026-05-12 cs.IR 67%

Personalized Deep Research: A User-Centric Framework, Dataset, and Hybrid Evaluation for Knowledge Discovery

个性化深度研究:以用户为中心的框架、数据集和混合评估方法用于知识发现

Xiaopeng Li, Wenlin Zhang, Yingyi Zhang, Pengyue Jia, Yejing Wang, Yichao Wang, Yong Liu, Huifeng Guo, Xiangyu Zhao

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 本文提出PDR框架,结合用户上下文动态调整检索深度和广度,通过混合评估方法提升检索效用和报告相关性,验证了个性化知识获取的可行性。

Comments Accepted to SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10034 2026-05-12 cs.RO 67%

Beyond Self-Play and Scale: A Behavior Benchmark for Generalization in Autonomous Driving

超越自我博弈与规模:面向自动驾驶泛化的行为基准

Aron Distelzweig, Faris Janjoš, Andreas Look, Anna Rothenhäusler, Daniel Jost, Oliver Scheel, Raghu Rajan, Daphne Cornelisse, Eugene Vinitsky, Joschka Boedecker

机构 * University of Freiburg(弗赖堡大学) Bosch Center for Artificial Intelligence(博世人工智能中心) Coburg University of Applied Sciences(科堡应用科学大学) New York University(纽约大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 本文提出BehaviorBench,通过评估、复杂性和行为多样性三个维度,解决自动驾驶大规模强化学习政策在标准化评估中的性能问题,并提出混合规划器提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09844 2026-05-12 cs.AI cs.CL cs.LG 67%

The Metacognitive Probe: Five Behavioural Calibration Diagnostics for LLMs

元认知探测:用于大语言模型的五种行为校准诊断

Rafael C. T. Oliveira

机构 * Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出元认知探测工具,通过五个维度评估大语言模型的自信行为,揭示模型在特定领域的过度自信问题,展示了Gemini 2.5 Flash在不同任务中的显著差异。

Comments 27 pages, 13 tables. Code, data, prompts, and rubrics released with the paper. OSF deposit pending; DOI in v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09665 2026-05-12 cs.LG cs.AI cs.CL 67%

Learning Multi-Indicator Weights for Data Selection: A Joint Task-Model Adaptation Framework with Efficient Proxies

学习多指标权重用于数据选择:一种联合任务-模型适应框架与高效代理

Jingze Song, Zihao Chen, Wenqing Chen, Zibin Zheng

机构 * School of Software Engineering, Sun Yat-sen University(中山大学软件学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种联合任务-模型适应框架,通过在紧凑的tiny-validation集上利用上下文学习信号,无需全量微调即可学习多指标权重,提升数据选择效率和性能。

Comments This work has been accepted at IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08703 2026-05-12 cs.AI cs.CL cs.CV cs.LG 67%

RewardHarness: Self-Evolving Agentic Post-Training

RewardHarness: 自我进化代理的后训练

Yuxuan Zhang, Penghui Du, Bo Li, Cong Wei, Junwen Miao, Huaisong Zhang, Songcheng Cai, Yubo Wang, Dongfu Jiang, Yuyu Zhang, Ping Nie, Wenhu Chen, Changqian Yu, Kelsey R. Allen

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Kolors Team, Kuaishou Technology(快手团队) Carnegie Mellon University(卡内基梅隆大学) University of Waterloo(滑铁卢大学) Etude AI Tsinghua University(清华大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RewardHarness通过自我进化代理框架,利用少量人类偏好示例迭代优化工具库,实现高效图像编辑评估,准确率达47.4%,超越GPT-5 5.3个百分点。

Comments Project page: https://rewardharness.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08647 2026-05-12 cs.CL cs.AI cs.LG 67%

AgentCollabBench: Diagnosing When Good Agents Make Bad Collaborators

AgentCollabBench: 评估好代理为何会成为差合作者

Aritra Mazumder, Shubhashis Roy Dipta, Nusrat Jahan Lia, Tanzila Khan, Kainat Raisa Hossain, Nehaa Shri, Shubhrangshu Debsarkar, Humayra Tasnim, Gour Gupal Talukder Shawon, Debjoty Mitra, Sumaiya Ahmed Rani, Al Jami Islam Anik, Al Nafeu Khan

机构 * University of Utah(犹他大学) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) University of Dhaka(达卡大学) Vellore Institute of Technology(韦洛雷理工学院) University of Virginia(弗吉尼亚大学) Rajshahi University of Engineering and Technology(拉贾加赫尔工程与技术大学) Shahjalal University of Science and Technology(沙赫jalal科学与技术大学) BRAC University(BRAC大学) Islamic University of Technology(伊斯兰技术大学) Comilla University(科摩拉大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出AgentCollabBench,通过900个经人类验证的任务评估多代理系统中四个行为风险:指令衰减、虚假信念传播、上下文泄露和追踪耐久性,揭示模型在多跳信息生存中的结构问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07806 2026-05-11 cs.CL cs.AI cs.LG 67%

Beyond Confidence: Rethinking Self-Assessments for Performance Prediction in LLMs

超越置信度:重新思考用于大语言模型性能预测的自我评估

Sree Bhattacharyya, Samarth Khanna, Leona Chen, Lucas Craig, Tharun Dilliraj, James Z. Wang

机构 * Department of Computer Science and Engineering, College of Engineering, The Pennsylvania State University(计算机科学与工程系,工程学院,宾夕法尼亚州立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于认知评估理论的多维自我评估框架,通过六个评估维度和置信度预测模型失败,发现能力相关维度在多数场景中表现更优,且努力维度在推理任务中更具预测性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07145 2026-05-11 cond-mat.mtrl-sci cs.CV 67%

Fine-tuning a vision-language model for fracture-surface morphology recognition

对骨折表面形貌识别进行视觉-语言模型的微调

Quanliang Liu, Jungtaek Kim, Kangwook Lee, Hyunseok Oh

机构 * Department of Materials Science & Engineering, University of Wisconsin–Madison(威斯康星大学麦迪逊分校材料科学与工程系) Department of Electrical & Computer Engineering, University of Wisconsin–Madison(威斯康星大学麦迪逊分校电气与计算机工程系) KRAFTON Ludo Robotics

专题命中 推理评测 :reasoning(abstract,abstract_cn)

AI总结 本文通过微调开源视觉-语言模型,利用定制化的13168张骨折表面图像数据集,提升了对骨折表面形貌的识别能力,展示了在材料表征中的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22831 2026-05-11 cs.LG cs.AI cs.CL cs.CV cs.CY 67%

Direction-Flipped Influence Audits Reveal Hidden Structure in Moral Choices of LLMs

反向影响审计揭示大语言模型道德选择中的隐藏结构

Phil Blandfort, Tushar Karayil, Alex McKenzie, Urja Pawar, Robert Graham, Dmitrii Krasheninnikov

机构 * Predictably Weird Independent AE Studio

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过反向影响审计发现,短上下文提示使LLM道德选择率变化12-18个百分点,揭示基线评分遗漏的结构,且部分显著效应出现反向效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16155 2026-05-08 cs.NE 67%

PRIMETIME : Limits of LLMs in Temporal Primitives

PRIMETIME:LLMs在时间原语中的极限

Edward Gaere, Florian Wangenheim

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 本文提出PRIMETIME合成生成器,用于评估大语言模型中时间推理基础操作(解析和日期时间算术)的分解性。研究发现各原语可靠性各异,且通过生成器可生成训练数据提升事件规划任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00116 2026-05-04 cs.CL cs.AI cs.LG 67%

ViLegalNLI: Natural Language Inference for Vietnamese Legal Texts

ViLegalNLI:越南法律文本的自然语言推理

Nhung Thi-Hong Duong, Mai Ngoc Ho, Tin Van Huynh, Kiet Van Nguyen

机构 * University of Information Technology(信息技术大学) Vietnam National University(越南国家大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ViLegalNLI,首个针对法律领域构建的越南语自然语言推理数据集,包含42,012个前提-假设对,涵盖多种法律领域,用于评估法律推理的结构逻辑与术语一致性。

Comments 33 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22615 2026-05-01 cs.RO 67%

GazeVLA: Learning Human Intention for Robotic Manipulation

GazeVLA:学习人类意图以促进机器人操作

Chengyang Li, Kaiyi Xiong, Yuan Xu, Lei Qian, Yizhou Wang, Wentao Zhu

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology, Ningbo(宁波东部科技研究院) Peking University(北京大学) ShanghaiTech University(上海科技大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出GazeVLA框架,通过学习人类意图弥合人机之间的固有差距,提升机器人操作性能。

Comments Project page: https://gazevla.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25591 2026-04-29 eess.AS cs.AI cs.CL cs.LG cs.SD 67%

Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models

穿越不确定性:音频感知大语言模型不确定性估计的实证研究

Chun-Yi Kuan, Wei-Ping Huang, Hung-yi Lee

机构 * Graduate Institute of Communication Engineering, National Taiwan University, Taiwan(台湾大学通讯工程研究所) Artificial Intelligence Center of Research Excellence (AI-CoRE), National Taiwan University, Taiwan(台湾大学人工智能卓越研究中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了音频感知大语言模型的不确定性估计,通过多种方法对比发现语义层面方法在通用音频推理中表现更优,且在可靠性导向任务中效果依赖模型和基准。

Comments Manuscript in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16422 2026-04-21 cs.CL cs.AI cs.LG 67%

Injecting Structured Biomedical Knowledge into Language Models: Continual Pretraining vs. GraphRAG

将结构化生物医学知识注入语言模型:持续预训练与GraphRAG

Jaafer Klila, Sondes Bannour Souihi, Rahma Boujelben, Nasredine Semmar, Lamia Hadrich Belguith

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过持续预训练和GraphRAG两种方法将结构化生物医学知识注入语言模型,提升其在生物医学领域的表现,实验显示BERTUMLS在知识密集型问答任务中表现优异,GraphRAG在PubMedQA和BioASQ上提升显著。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09836 2026-04-20 cs.AI cs.CL cs.LG 67%

COMPOSITE-Stem

COMPOSITE-STEM基准:通过70个专家编写的任务评估AI代理的科学推理能力

Kyle Waters, Lucas Nuzzi, Tadhg Looram, Alessandro Tomasiello, Ariel Ghislain Kemogne Kamdoum, Bikun Li, Damien Sileo, Egor Kretov, Francesco Fournier-Facio, Georgios Soloupis, Haile Kassahun, Hew Wolff, Jiaqi Cai, Lianghui Li, Marc Roth, Mohinder Naiya, Naixu Guo, Qicheng Tang, Richard Wheeler, Samuele Sala, Serguei Popov, Steven Dillmann, Yuqi Li

机构 * PortexAI University of Milano-Bicocca(米兰-比科卡大学) University of Calgary(卡尔加里大学) University of Chicago(芝加哥大学) Inria(法国国家信息与自动化技术研究院) Fraunhofer Institute for Individualized Medical Technology IMTE(弗劳恩霍夫个性化医疗技术研究所) University of Cambridge(剑桥大学) Independent(独立) McGill University(麦吉尔大学) Massachusetts Institute of Technology(麻省理工学院) École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) Queen Mary University of London(伦敦大学玛丽女王学院) Dot Ingredients National University of Singapore(新加坡国立大学) Georgia Institute of Technology(佐治亚理工学院) University of Edinburgh(爱丁堡大学) Murdoch University(墨尔本大学) University of Porto(波尔图大学) Stanford University(斯坦福大学) Stony Brook University(史泰津布鲁克大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出COMPOSITE-STEM基准,通过70个专家编写任务评估AI代理的科学推理能力,结合精确匹配评分和LLM作为评委的协议,展示AI在科学领域的能力突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14216 2026-04-17 cs.MM cs.AI cs.CL cs.CV cs.GR cs.LG 67%

Neuro-Oracle: A Trajectory-Aware Agentic RAG Framework for Interpretable Epilepsy Surgical Prognosis

Neuro-Oracle:一种具有轨迹意识的代理RAG框架用于可解释性癫痫手术预后

Aizierjiang Aiersilan, Mohamad Koubeissi

机构 * The George Washington University(乔治华盛顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Neuro-Oracle框架,通过三维Siamese对比编码器提取术前术后MRI变化,检索历史相似手术轨迹,并利用量化Llama-3-8B推理代理生成自然语言预后,验证了轨迹意识检索架构的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14198 2026-04-17 cs.LG cs.AI cs.CL 67%

MixAtlas: Uncertainty-aware Data Mixture Optimization for Multimodal LLM Midtraining

MixAtlas: 多模态大语言模型中训练过程中的数据混合优化方法

Bingbing Wen, Sirajul Salekin, Feiyang Kang, Bill Howe, Lucy Lu Wang, Javier Movellan, Manjot Bilkhu

机构 * Apple(苹果公司) University of Washington(华盛顿大学) Virginia Tech(弗吉尼亚理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MixAtlas通过双轴分解训练语料,结合小代理模型与高斯过程代理,优化多模态大语言模型的训练混合策略,提升性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14664 2026-04-17 cs.SD eess.AS 67%

SpeechLLM-as-Judges: Towards General and Interpretable Speech Quality Evaluation

SpeechLLM-as-Judges: 向通用和可解释的语音质量评估迈进

Hui Wang, Jinghua Zhao, Yifan Yang, Shujie Liu, Junyang Chen, Yanzhe Zhang, Shiwan Zhao, Jinyu Li, Jiaming Zhou, Haoqin Sun, Yan Lu, Yong Qin

机构 * College of Computer Science, Nankai University(南开大学计算机科学学院) Microsoft Corporation(微软公司) Microsoft Research Asia(微软亚洲研究院)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出SpeechLLM-as-Judges框架,利用大语言模型进行结构化语音质量评估,构建了包含多语言语音片段的SpeechEval数据集,并开发了SQ-LLM模型,在多种任务和语言上表现出色。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11970 2026-04-15 cs.CV cs.AI cs.CL cs.LG 67%

INDOTABVQA: A Benchmark for Cross-Lingual Table Understanding in Bahasa Indonesia Documents

INDOTABVQA:一种用于巴厘语文档中跨语言表格理解的基准测试

Somraj Gautam, Anathapindika Dravichi, Gaurav Harit

机构 * IIT Jodhpur(印度理工学院贾尔普尔分校) Punjabi University(旁遮普大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出INDOTABVQA基准测试,用于评估跨语言表格视觉问答性能,包含1593张文档图像和四语问题-答案对,揭示了VLM在单语和跨语言设置下的性能差异,并展示了微调对提升准确性的作用。

Comments Accepted in ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11102 2026-04-14 cs.CV cs.MM 67%

OmniScript: Towards Audio-Visual Script Generation for Long-Form Cinematic Video

OmniScript: 向长篇影视视频的音频-视觉脚本生成迈进

Junfu Pu, Yuxin Chen, Teng Wang, Ying Shan

机构 * ARC Lab, Tencent(腾讯ARC实验室)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出视频到脚本任务,介绍OmniScript模型,通过渐进式训练在长篇叙事理解中实现高效脚本生成,优于开源模型并接近专有模型。

Comments Project Page: https://arcomniscript.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18073 2026-04-14 cs.CV 67%

FPBench: A Comprehensive Benchmark of Multimodal Large Language Models for Fingerprint Analysis

FPBench: 多模态大语言模型在指纹分析中的综合基准测试

Ekta Gavas, Sudipta Banerjee, Chinmay Hegde, Nasir Memon

机构 * New York University(纽约大学) University of Wyoming(怀俄明大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出FPBench基准测试,评估20种多模态大语言模型在7个真实和合成数据集上的8项生物识别任务,发现微调视觉和语言编码器可提升性能7%-39%。

Comments Revised version with additional experiments and code release

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13047 2026-04-14 cs.CL cs.AI cs.LG 67%

Multi-Model Synthetic Training for Mission-Critical Small Language Models

多模型合成训练用于关键任务小型语言模型

Nolan Platt, Pragyansmita Nayak

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出利用多模型生成技术,将AIS数据转化为问答对,训练出准确率达75%的低成本小型模型,为专业领域AI应用提供可复现的合成数据生成框架。

Comments 8 pages. Accepted as a full paper to the 3rd International Conference on Foundation and Large Language Models (IEEE FLLM) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03336 2026-04-14 cs.AI cs.CL cs.LG 67%

Disambiguation-Centric Finetuning Makes Enterprise Tool-Calling LLMs More Realistic and Less Risky

以消歧为核心的知识蒸馏使企业工具调用LLM更真实且更安全

Ashutosh Hathidara, Julien Yu, Sebastian Schreiber

机构 * SAP Labs(SAP实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出DiaFORGE框架,通过三阶段流程提升企业工具调用LLM的准确性和安全性,实验显示其在工具调用成功率上优于GPT-4o和Claude-3.5-Sonnet。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18931 2026-04-14 cs.AI cs.CL cs.LG 67%

Can Large Language Models Infer Causal Relationships from Real-World Text?

大语言模型能否从现实文本中推断因果关系?

Ryan Saklad, Aman Chadha, Oleg Pavlov, Raha Moraffah

机构 * Worcester Polytechnic Institute(伍斯特理工学院) Apple(苹果公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨大语言模型能否从现实文本中推断因果关系,构建了首个现实世界数据集,发现最佳模型在因果推断上的F1分数仅为0.535。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09554 2026-04-14 cs.AI cs.CL cs.LG 67%

LABBench2: An Improved Benchmark for AI Systems Performing Biology Research

LABBench2:一种改进的AI系统进行生物研究的基准测试

Jon M Laurent, Albert Bou, Michael Pieler, Conor Igoe, Alex Andonian, Siddharth Narayanan, James Braza, Alexandros Sanchez Vassopoulos, Jacob L Steenwyk, Blake Lash, Andrew D White, Samuel G Rodriques

机构 * Broad Institute, Cambridge, MA, USA(博德研究所,美国马萨诸塞州剑桥市)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LABBench2,一个包含近1900个任务的改进基准,用于评估AI在真实世界中执行科学任务的能力,展示了当前前沿模型在不同子任务上的性能差异,并提供了数据集和评估工具以促进社区使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06950 2026-04-10 cs.CV 67%

Making MLLMs Blind: Adversarial Smuggling Attacks in MLLM Content Moderation

让 MLLMs 失明:MLLM 内容审核中的对抗走私攻击

Zhiheng Li, Zongyang Ma, Yuntong Pan, Ziqi Zhang, Xiaolei Lv, Bo Li, Jun Gao, Jianing Zhang, Chunfeng Yuan, Bing Li, Weiming Hu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(中国科学院自动化研究所多模态人工智能系统国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Beijing Key Laboratory of Super Intelligent Security of Multi-Modal Information(北京市多模态信息超智能安全重点实验室) Hellogroup University of Washington(华盛顿大学) Jilin University(吉林大学) ShanghaiTech University(上海科技大学)

专题命中 推理评测 :reasoning(abstract);CoT(abstract)

AI总结 本文揭示了MLLM在内容审核中面临的新威胁——对抗走私攻击,通过SmuggleBench基准测试发现多种模型易受攻击,提出通过感知和推理角度分析其根本原因并探索缓解策略。

Comments Accepted to ACL 2026. 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07274 2026-04-09 cs.CL cs.AI cs.LG 67%

A Systematic Study of Retrieval Pipeline Design for Retrieval-Augmented Medical Question Answering

检索增强医疗问答中检索流程设计的系统研究

Nusrat Sultana, Abdullah Muhammad Moosa, Kazi Afzalur Rahman, Sajal Chandra Banik

机构 * Department of Mechatronics & Industrial Engineering, Chittagong University of Engineering & Technology(吉大港工程与技术大学机电与工业工程系) Department of Mechanical Engineering, Chittagong University of Engineering & Technology(吉大港工程与技术大学机械工程系)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文系统评估了检索增强医疗问答的性能,发现检索增强显著提升了零样本医疗问答效果,最佳配置为密集检索加查询改写和重排序,准确率达60.49%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05930 2026-04-08 cs.CL cs.AI cs.LG cs.MA 67%

Can We Predict Before Executing Machine Learning Agents?

在执行机器学习代理之前,我们能否进行预测?

Jingsheng Zheng, Jintian Zhang, Yujie Luo, Yuren Mao, Yunjun Gao, Lun Du, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Zhejiang University - Ant Group Joint Laboratory of Knowledge Graph(浙江大学-蚂蚁集团知识图谱联合实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过内部化执行先验来预测数据驱动的解决方案偏好,利用预验证的数据分析报告提升LLM的预测能力,并在FOREAGENT中实现预测-验证循环,加速收敛并超越基于执行的基线。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20983 2026-04-08 cs.CL cs.AI cs.LG 67%

Automatic Replication of LLM Mistakes in Medical Conversations

医疗对话中大语言模型错误的自动复制

Oleksii Proniakin, Diego Fajardo, Ruslan Nazarenko, Razvan Marinescu

机构 * Lumos AI

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MedMistake自动管道,通过提取医疗对话中LLM的错误生成单次问答对,构建基准测试集,验证了GPT、Claude和Grok在医疗问答任务中的最佳性能。

Comments 48 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏