arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10530 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10530 篇

2603.08852 2026-03-11 cs.AI cs.MA cs.SE 57%

LDP: An Identity-Aware Protocol for Multi-Agent LLM Systems

LDP:一种面向多智能体LLM系统的身份感知协议

Sunil Prakash

机构 * Indian School of Business(印度管理学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 LDP是一种面向多智能体LLM系统的身份感知协议,通过五种机制提升委托效率与可控性。

Comments 16 pages, 9 figures, 8 tables, 4 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15943 2026-03-11 cs.AI 57%

Small Language Models for Efficient Agentic Tool Calling: Outperforming Large Models with Targeted Fine-tuning

小型语言模型用于高效的代理工具调用:通过针对性微调超越大模型

Polaris Jhandi, Owais Kazi, Shreyas Subramanian, Neel Sendas

专题命中 推理评测 :CoT(abstract);分类 cs.AI

AI总结 本文通过针对性微调小型语言模型,在工具调用任务中超越大模型,展示了SLMs在成本优化和效率提升方面的潜力。

Comments Accepted at AAAI 2026 Workshop on Agentic AI Benchmarks and Applications for Enterprise Tasks

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08704 2026-03-10 cs.AI 57%

Evaluating Financial Intelligence in Large Language Models: Benchmarking SuperInvesting AI with LLM Engines

评估大型语言模型的金融智能:用LLM引擎基准测试SuperInvesting AI

Akshay Gulati, Kanha Singhania, Tushar Banga, Parth Arora, Anshul Verma, Vaibhav Kumar Singh, Agyapal Digra, Jayant Singh Bisht, Danish Sharma, Varun Singla, Shubh Garg

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AFIB基准测试,评估SuperInvesting等AI系统在金融分析中的性能,发现SuperInvesting在准确性、完整性和一致性方面表现最优。

Comments 12 pages, 6 Figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08358 2026-03-10 cs.CL 57%

Do Language Models Know Theo Has a Wife? Investigating the Proviso Problem

语言模型知道Theo有妻子吗?探究 proviso 问题

Tara Azin, Daniel Dumitrescu, Diana Inkpen, Raj Singh

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文通过设计诊断数据集,探究语言模型在处理条件句预设问题时的推理能力,发现模型依赖浅层模式匹配而非深度语义分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07670 2026-03-10 cs.AI 57%

Memory for Autonomous LLM Agents:Mechanisms, Evaluation, and Emerging Frontiers

自主LLM代理的记忆:机制、评估与新兴前沿

Pengfei Du

机构 * Hong Kong Research Institute of Technology(香港理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了自主LLM代理中记忆的机制、评估及未来发展方向,分析了五种核心机制及评估挑战,强调记忆对代理适应性和应用的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07607 2026-03-10 cs.DC cs.LG 57%

MAS-H2: A Hierarchical Multi-Agent System for Holistic Cloud-Native Autoscaling

MAS-H2:一种用于整体云原生自动扩展的分层多智能体系统

Hamed Hamzeh, Parisa Vahdatian

机构 * University of Westminster(威斯敏斯特大学) University of York(约克大学)

专题命中 推理评测 :planning(abstract);分类 cs.LG

AI总结 MAS-H2通过分层多智能体系统实现云原生自动扩展的前瞻性管理,减少资源浪费和性能下降,提升系统稳定性与资源利用效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02748 2026-03-10 cs.CV cs.AI 57%

iGVLM: Dynamic Instruction-Guided Vision Encoding for Question-Aware Multimodal Understanding

iGVLM:动态指令引导的视觉编码用于问题感知的多模态理解

Hanpeng Liu, Yaqian Li, Zidan Wang, Shuoxi Zhang, Zihao Bo, Rinyoichi Takezoe, Kaiwen Long, Kun He

机构 * School of Computer Science(计算机科学学院) Technology, Huazhong University of Science(科技,华中科技大学) Li Auto Inc.(Li汽车公司) Institute of AI for Industries, Chinese Academy of Sciences(产业人工智能研究所,中国科学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 iGVLM通过动态指令引导的视觉编码框架,提升多模态理解中对指令的敏感度,实现从通用感知到任务感知推理的平滑过渡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06599 2026-03-10 cs.CY cs.AI 57%

Building the ethical AI framework of the future: from philosophy to practice

构建未来的伦理AI框架:从哲学到实践

Jasper Kyle Catapang

机构 * Graduate School of Global Studies(全球研究研究生院) Tokyo University of Foreign Studies(东京外国语大学) AI Product Development Division(人工智能产品开发部门) Money Forward, Inc.(Money Forward公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种伦理设计控制架构,通过三重闸门机制整合后果论、义务论和美德伦理,为AI生命周期提供可执行的治理方案。

Journal ref AI Ethics 6, 150 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01528 2026-03-10 cs.CV cs.AI cs.RO 57%

DrivingGen: A Comprehensive Benchmark for Generative Video World Models in Autonomous Driving

DrivingGen:自主驾驶中生成视频世界模型的综合性基准

Yang Zhou, Hao Shao, Letian Wang, Zhuofan Zong, Hongsheng Li, Steven L. Waslander

机构 * University of Toronto(多伦多大学) CUHK MMLab(香港中文大学MMLab)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 DrivingGen提出首个综合性基准,用于评估生成驾驶世界模型的视觉真实性、轨迹合理性、时间一致性和可控性,揭示通用与专用模型间的权衡。

Comments ICLR 2026 Poster; Project Website: https://drivinggen-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20102 2026-03-10 cs.AI 57%

Human-Centered LLM-Agent System for Detecting Anomalous Digital Asset Transactions

面向人类的LLM-智能体系统用于检测异常数字资产交易

Gyuyeon Na, Minjung Park, Hyeonjeong Cha, Sangmi Chai

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 HCLA是一种面向人类的多智能体系统,用于通过自然语言交互提高数字资产交易异常检测的可解释性和透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10285 2026-03-10 cs.AI 57%

Reallocating Attention Across Layers to Reduce Multimodal Hallucination

跨层分配注意力以减少多模态幻觉

Haolang Lu, Bolun Chu, WeiYe Fu, Guoshun Nan, Junning Liu, Minghui Pan, Qiankun Li, Yi Yu, Hua Wang, Kun Wang

机构 * Beijing University of Posts and Telecommunications, China(北京邮电大学) Nanyang Technological University, Singapore(南洋理工大学) Guangxi Transportation Science and Technology Group, China(广西交通科学和技术集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 通过跨层分配注意力减少多模态幻觉,提升推理一致性和视觉忠实性。

Comments Acceptted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06148 2026-03-09 cs.CV cs.AI 57%

VLM-RobustBench: A Comprehensive Benchmark for Robustness of Vision-Language Models

VLM-RobustBench: 一种全面的视觉语言模型鲁棒性基准

Rohit Saxena, Alessandro Suglia, Pasquale Minervini

机构 * University of Edinburgh, UK(爱丁堡大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 VLM-RobustBench评估了视觉语言模型在不同图像失真下的鲁棒性,发现低严重性空间扰动对性能影响更大,提示需改进鲁棒性评估和训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05923 2026-03-09 cs.CL cs.HC 57%

Learning Next Action Predictors from Human-Computer Interaction

从人机交互中学习下一步动作预测器

Omar Shaikh, Valentin Teutschbein, Kanishk Gandhi, Yikun Chi, Nick Haber, Thomas Robinson, Nilam Ram, Byron Reeves, Sherry Yang, Michael S. Bernstein, Diyi Yang

机构 * Stanford University(斯坦福大学) Hasso Plattner Institute(哈索普拉特纳研究所) New York University(纽约大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出LongNAP模型,通过结合参数化和上下文学习,从用户行为的完整上下文中预测下一步动作,显著优于传统方法。

Comments 32 pages, 10 figures, see https://generalusermodels.github.io/nap

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05832 2026-03-09 cs.HC cs.AI 57%

Lexara: A User-Centered Toolkit for Evaluating Large Language Models for Conversational Visual Analytics

Lexara: 一种以用户为中心的评估工具包,用于评估用于对话式可视化分析的大型语言模型

Srishti Palani, Vidya Setlur

机构 * Tableau Research, Salesforce(Tableau研究机构,Salesforce)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 Lexara是一种以用户为中心的评估工具包,用于评估对话式可视化分析中的大型语言模型,通过多格式输出的可解释指标和交互式工具帮助用户进行模型和提示选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05689 2026-03-09 cs.CR cs.AI 57%

SecureRAG-RTL: A Retrieval-Augmented, Multi-Agent, Zero-Shot LLM-Driven Framework for Hardware Vulnerability Detection

SecureRAG-RTL: 一种基于检索增强的多智能体零样本LLM驱动框架用于硬件漏洞检测

Touseef Hasan, Blessing Airehenbuwa, Nitin Pundir, Souvika Sarkar, Ujjwal Guin

机构 * School of Computing, Wichita State University(计算机科学学院,威斯康星州立大学) Department of Electrical and Computer Engineering, Auburn University(电气与计算机工程系,阿伯茨兰大学) IBM

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 SecureRAG-RTL通过检索增强生成方法提升硬件漏洞检测准确率,实现30%的性能提升并公开基准数据集支持未来研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20230 2026-03-09 cs.AI cs.CV cs.MA 57%

A Multi-Agent System Enables Versatile Information Extraction from the Chemical Literature

多智能体系统实现从化学文献中灵活的信息提取

Yufan Chen, Ching Ting Leung, Bowen Yu, Jianwei Sun, Yong Huang, Linyan Li, Hao Chen, Hanyu Gao

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出了一种基于多模态大语言模型的多智能体系统,实现了从化学文献中高效提取化学信息,F1分数达76.27%,显著提升信息提取效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06541 2026-03-09 cs.DB cs.AI cs.MA 57%

KramaBench: A Benchmark for AI Systems on Data-to-Insight Pipelines over Data Lakes

KramaBench:一个用于数据湖上数据到洞察流程的AI系统基准测试

Eugenie Lai, Gerardo Vitagliano, Ziyu Zhang, Om Chabra, Sivaprasad Sudhir, Anna Zeng, Anton A. Zabreyko, Chenning Li, Ferdi Kossmann, Jialin Ding, Jun Chen, Markos Markakis, Matthew Russo, Weiyang Wang, Ziniu Wu, Michael J. Cafarella, Lei Cao, Samuel Madden, Tim Kraska

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Independent(独立研究者) University of Arizona(亚利桑那大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 KramaBench是一个用于评估AI系统在数据湖到洞察流程中端到端能力的基准测试,包含104个挑战,测试AI在自动化编排数据任务方面的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05129 2026-03-06 cs.AI cs.MA 57%

MedCoRAG: Interpretable Hepatology Diagnosis via Hybrid Evidence Retrieval and Multispecialty Consensus

MedCoRAG:通过混合证据检索和多专科共识进行可解释的肝病诊断

Zheng Li, Jiayi Xu, Zhikai Hu, Hechang Chen, Lele Cong, Yunyun Wang, Shuchao Pang

机构 * School of Cyber Science and Engineering, Nanjing University of Science and Technology(南京理工大学信息科学与工程学院) School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Department of Neurology, China-Japan Union Hospital of Jilin University(吉林大学中日联谊医院神经内科) Department of Anesthesiology, China-Japan Union Hospital of Jilin University(吉林大学中日联谊医院麻醉科) School of Computing, Macquarie University(麦考瑞大学计算机学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 MedCoRAG通过混合证据检索和多专科共识,提升肝病诊断的可解释性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22758 2026-03-06 cs.CL 57%

EchoMind: An Interrelated Multi-level Benchmark for Evaluating Empathetic Speech Language Models

EchoMind: 一种相互关联的多级基准,用于评估共情语音语言模型

Li Zhou, Lutong Yu, You Lyu, Yihang Lin, Zefeng Zhao, Junyi Ao, Yuhao Zhang, Benyou Wang, Haizhou Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Research Institute of Big Data(深圳大数据研究院) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 EchoMind是一种多级基准,用于评估SLMs在共情对话中的能力,揭示了现有模型在处理高表现性语音线索方面的不足。

Comments Speech Language Models, Spoken Language Understanding, Vocal Cue Perception, Empathetic Dialogue, Benchmark Evaluation; Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20333 2026-03-06 cs.CR cs.AI 57%

GhostEI-Bench: Do Mobile Agents Resilience to Environmental Injection in Dynamic On-Device Environments?

GhostEI-Bench: 移动代理在动态设备环境中的环境注入鲁棒性研究

Chiyu Chen, Xinhao Song, Yunkai Chai, Yang Yao, Haodong Zhao, Lijun Li, Jie Li, Yan Teng, Gongshen Liu, Yingchun Wang

机构 * Shanghai Jiao Tong University, School of Computer Science(上海交通大学计算机科学学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 GhostEI-Bench通过动态环境注入攻击评估移动代理的鲁棒性,揭示现有模型对欺骗性UI的脆弱性,并提供量化和缓解该威胁的框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10689 2026-03-06 cs.AI 57%

OmniVideoBench: Towards Audio-Visual Understanding Evaluation for Omni MLLMs

OmniVideoBench: 向多模态大语言模型的音频-视觉理解评估迈进

Caorui Li, Yu Chen, Yiyan Ji, Jin Xu, Zhenyu Cui, Shihao Li, Yuanxing Zhang, Wentao Wang, Zhenghao Song, Dingling Zhang, Ying He, Haoxiang Liu, Yuxuan Wang, Qiufeng Wang, Jiafu Tang, Zhenhe Wu, Jiehui Luo, Zhiyu Pan, Weihao Xie, Chenchen Zhang, Zhaohui Wang, Jiayi Tian, Yanghai Wang, Zhe Cao, Minxin Dai, Ke Wang, Runzhe Wen, Yinghao Ma, Yaning Pan, Sungkyun Chang, Termeh Taheri, Haiwen Xia, Christos Plachouras, Emmanouil Benetos, Yizhi Li, Ge Zhang, Jian Yang, Tianhao Peng, Zili Wang, Minghao Liu, Junran Peng, Zhaoxiang Zhang, Jiaheng Liu

机构 * NJU-LINK Team(南京大学链接团队)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 OmniVideoBench通过大规模基准测试评估多模态大语言模型在音频-视觉理解中的协同推理能力,揭示模型与人类推理间的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04142 2026-03-05 cs.LG 57%

A Multi-Agent Framework for Interpreting Multivariate Physiological Time Series

多智能体框架用于解释多变量生理时间序列

Davide Gabrielli, Paola Velardi, Stefano Faralli, Bardh Prenkaj

机构 * Sapienza University of Rome Rome Italy ISTC-CNR \& Sapienza University of Rome Rome Italy Technical University of Munich Munich Germany Sapienza University of Rome ISTC-CNR \& Sapienza University of Rome Technical University of Munich

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本研究提出Vivaldi多智能体框架,通过对比不同模型表现,发现智能体系统在非思考模型中提升解释质量,但在思考模型中反而降低相关性,强调了计算外部化在医疗AI中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03781 2026-03-05 cs.AI 57%

LifeBench: A Benchmark for Long-Horizon Multi-Source Memory

LifeBench: 一个用于长周期多源记忆的基准

Zihao Cheng, Weixin Wang, Yu Zhao, Ziyang Ren, Jiaxuan Chen, Ruiyang Xu, Shuai Huang, Yang Chen, Guowei Li, Mengshi Wang, Yi Xie, Ren Zhu, Zeren Jiang, Keda Lu, Yihong Li, Xiaoliang Wang, Liwei Liu, Cam-Tu Nguyen

机构 * Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(巴黎-罗克琴库特研究所) Rajiv Gandhi University(拉贾夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室) State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 Lifebench是一个用于长周期多源记忆的基准,通过密集连接的长周期事件模拟,推动AI代理在多样且时间延长的上下文中整合声明性和非声明性记忆推理。

Comments A total of 28 pages, 8 pages of main text, and 15 figures and tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09937 2026-03-05 cs.AI cs.DC 57%

Why Do AI Agents Systematically Fail at Cloud Root Cause Analysis?

为何AI代理在云根因分析中系统性失败?

Taeyoon Kim, Woohyeok Park, Hoyeong Yun, Kyungyong Lee

机构 * Hanyang University(汉阳大学) OKESTRO Co., Ltd.(OKESTRO公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文分析了基于LLM的云根因分析代理在推理、通信和环境交互中的系统性故障,揭示了幻觉数据和不完全探索等普遍问题,并通过改进通信协议减少故障率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06803 2026-03-05 cs.CL cs.MA 57%

SEVADE: Self-Evolving Multi-Agent Analysis with Decoupled Evaluation for Hallucination-Resistant Irony Detection

SEVADE:基于解耦评估的自演化多智能体分析用于抗幻觉讽刺检测

Ziqi Liu, Ziyang Zhou, Yilin Li, Mingxuan Hu, Yushan Pan, Zhijie Xu, Yangbin Chen

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 SEVADE通过自演化多智能体分析框架,结合解耦评估机制,提升抗幻觉讽刺检测的准确率和宏F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06743 2026-03-05 cs.RO cs.AI 57%

TPK: Trustworthy Trajectory Prediction Integrating Prior Knowledge For Interpretability and Kinematic Feasibility

TPK: 通过整合先验知识实现可解释性和运动学可行性轨迹预测

Marius Baden, Ahmed Abouelazm, Christian Hubschneider, Yin Wu, Daniel Slieter, J. Marius Zöllner

机构 * FZI Research Center for Information Technology(弗赖堡信息科技研究中心) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) CARIAD SE

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 TPK通过整合车辆、行人和自行车的交互和运动学先验知识,提高轨迹预测的可解释性和物理可行性。

Comments First and Second authors contributed equally; Accepted in the 36th IEEE Intelligent Vehicles Symposium (IV 2025) for oral presentation; Winner of the best paper award

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20505 2026-03-05 cs.AI 57%

MuRAL: A Multi-Resident Ambient Sensor Dataset Annotated with Natural Language for Activities of Daily Living

MuRAL:一个多居所环境传感器数据集,标注有自然语言用于日常活动

Xi Chen, Julien Cumin, Fano Ramparany, Dominique Vaufreydaz

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 MuRAL数据集通过自然语言标注多居所环境传感器数据,用于提升LLMs在日常活动识别中的性能和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03515 2026-03-05 cs.CY cs.AI 57%

The Controllability Trap: A Governance Framework for Military AI Agents

可控性陷阱:军事AI代理的治理框架

Subramanyam Sahoo

机构 * MARS (Mentorship for Alignment Researchers) 4.0 Fellow(MARS(对齐研究导师计划)4.0 Fellow) Cambridge AI Safety Hub (CAISH) University of Cambridge(剑桥AI安全中心(CAISH)剑桥大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文提出AMAGF框架,通过预防、检测和纠正三个支柱,解决军事AI代理中的控制失效问题,通过控制质量评分实现持续控制管理。

Comments Accepted at ICLR 2026 Workshop on Agents in the Wild. 20 Pages and 3 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03334 2026-03-05 cs.CL 57%

The CompMath-MCQ Dataset: Are LLMs Ready for Higher-Level Math?

CompMath-MCQ数据集:大语言模型是否准备好应对高级数学?

Bianca Raimondi, Francesco Pivi, Davide Evangelista, Maurizio Gabbrielli

机构 * Department of Computer Science and Engineering, University of Bologna(计算机科学与工程系,博洛尼亚大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 CompMath-MCQ数据集通过多选格式评估LLMs在高级数学推理中的表现,揭示其在复杂计算数学任务上的挑战。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03300 2026-03-05 cs.CL 57%

Benchmarking Legal RAG: The Promise and Limits of AI Statutory Surveys

法律RAG基准测试:AI立法调研的潜力与局限

Mohamed Afane, Emaan Hariri, Derek Ouyang, Daniel E. Ho

机构 * Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文评估了三种新兴工具在法律RAG基准测试中的表现,发现STARA性能显著提升,而商业平台表现不佳,同时揭示了DOL律师的遗漏问题,并提出了法律RAG的未来设计原则。

Comments Accepted at the 5th ACM Symposium on Computer Science and Law (CS&Law '26)

详情

展开后加载摘要…

URL PDF HTML 收藏