arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10507 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10507 篇

2504.13460 2026-08-18 cs.CV cs.AI 79%

Chain-of-Evidence Multimodal Reasoning for Few-shot Temporal Action Localization

基于证据链的多模态推理用于少样本时序动作定位

Mengshi Qi, Hongwei Ji, Wulian Yun, Xianlin Zhang, Huadong Ma

机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications(网络与交换技术国家重点实验室,北京邮电大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出基于证据链的多模态推理方法,通过结合文本和视觉信息提升少样本时序动作定位的性能。

Comments Accepted by TIP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14015 2026-08-17 cs.CV cs.AI 新提交 79%

MedClaw: Heuristic Agent Harness for Long-Horizon Surgical Video Reasoning

MedClaw:用于长程手术视频推理的启发式智能体框架

Yingying Fan, Penghui Du, Leyan Zhu, Runze He, Zimeng Wu, Yuxuan Zhang, Liang Chen, Jiahao Xie, Jiangtang Wang, Shuai Shao, Anchao Yang, Yutong Bai, Yan Wang

机构 * School of Automation and Intelligence, Beijing Jiaotong University(北京交通大学自动化与智能学院) University of Maryland(马里兰大学) Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州高等研究院) University of British Columbia(不列颠哥伦比亚大学) Beijing Tiantan Hospital, Capital Medical University(首都医科大学附属北京天坛医院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究提出MedClaw智能体框架,通过分离推理与感知、启发式技能蒸馏循环,在仅需约100个标注示例的情况下,于自建及公开手术视频基准MedClawBench上,显著优于现有一次性VLM和通用视频智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13667 2026-08-17 cs.AI cs.SE 新提交 79%

Second Thought: Reasoning in Parallel as LLM Agents Act and Observe

Second Thought:LLM智能体行动与观察时的并行推理

Zhensu Sun, Chengran Yang, Yunbo Lyu, Jieke Shi, David Lo

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出无需训练的推理框架Second Thought,利用LLM智能体行动与观察的空闲窗口并行推理,在多基准测试中降低轮次、减少主线程解码量,且Pass@1表现优于计算匹配对照组。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12282 2026-08-13 cs.AI 新提交 79%

VAKRA: Evaluating Multi-Hop Reasoning Across APIs and Retrieval Under Tool-Use Policies

VAKRA:评估工具使用策略下跨API与检索的多跳推理能力

Ankita Rajaram Naik, Anupama Murthi, Benjamin Elder, Siyu Huo, Raavi Gupta, Abhinav Jain, Praveen Venkateswaran, Abdulhamid Adebayo, Danish Contractor

机构 * IBM(国际商业机器公司(IBM))

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究推出VAKRA基准评估工具使用策略下跨API与检索的多跳推理,发现现有最优模型在相关任务上性能随推理深度显著下降,失败集中于语言介导推理环节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11738 2026-08-13 cs.CV cs.AI 新提交 79%

Advancing MLLM-based UAV Image Understanding and Reasoning: A Benchmark and a Training-Free Multi-Agent System

推进基于多模态大语言模型(MLLM)的无人机(UAV)图像理解与推理:基准测试及无训练多智能体系统

Haoyu Zhang, Shuoxun Zhang, Peng Ye, Lin Zhang, Jiakang Yuan, Shenghong Yi, Yuening Wang, Tao Chen

机构 * Fudan University(复旦大学) College of Future Information Technology(未来信息技术学院) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究构建UAVQA-Bench基准,识别MLLM用于无人机图像理解的三类失效模式,提出含DSPE、CAIR、DAAS的无训练多智能体系统UAV-MAS,其32B版本在基准上准确率超Gemini 3 Pro 4.0个百分点

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11415 2026-08-13 cs.IR cs.AI 新提交 79%

TRACES: A Benchmark for Epistemic Reliability in Scientific Reasoning by LLMs

TRACES:用于评估大型语言模型科学推理中认知可靠性的基准

Valentin Rodionov, Shamil Assylbekov

专题命中 推理评测 :reasoning(title);verifier(abstract);分类 cs.AI

AI总结 该研究构建了名为TRACES的基准,发现30种大型语言模型在识别42篇不可靠科学论文的认知可靠性时表现不佳,仅少数模型能有效拒绝有缺陷前提,凸显科学部署需护栏。

Comments 16 pages + appendices. 4 figures in the main text

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10954 2026-08-12 cs.CV cs.AI 新提交 79%

Evidence-Grounded Trustworthy Multimodal Reasoning and Evaluation Benchmark in Complex Urban Scenes

复杂城市场景中基于证据的可信多模态推理与评估基准

Zhaoyang Wei, Bowen Jiang, Xumeng Han, Jiashu Li, Xuehui Yu, Yuling Liu, Guorong Li, Zhenjun Han, Jianbin Jiao

机构 * University of Chinese Academy of Sciences (UCAS)(中国科学院大学) Tencent CDG(腾讯云与智慧产业事业群) Institute of Information Engineering, CAS(中国科学院信息工程研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 针对复杂城市场景中多模态大语言模型的推理可靠性问题,提出AD2-Bench基准与EGVOR模型,提升了不利条件下的多模态推理稳定性。

Comments Accepted by IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10908 2026-08-12 cs.CV cs.CL 新提交 79%

Order Matters: LVLMs as Judges for Temporal Reasoning in Image Sequences

顺序很重要:LVLMs作为图像序列时间推理的评判者

Martina Ianaro, Guilherme Fernandes, Maurizio Gabbrielli, Joao Magalhaes

机构 * University of Bologna(博洛尼亚大学) NOVA School of Science and Technology(NOVA科技学院) NOVA Laboratory for Computer Science and Informatics(NOVA计算机科学与信息实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究发现大视觉语言模型(LVLMs)作为多模态评判者存在时间顺序判别缺陷,受首因、近因等结构性偏差影响,呼吁构建时间感知的视觉序列评估范式。

Comments 34 pages, camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10438 2026-08-12 cs.AI 新提交 79%

Continuous Interaction Diffusion: A Diffusion-Native Runtime for Asynchronous Tool-Augmented Reasoning

连续交互扩散:面向异步工具增强推理的原生扩散运行时

Yuhang Cao

机构 * Nanjing University(南京大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 针对扩散语言模型异步工具增强推理的局限,提出连续交互扩散架构,将工具交互整合至迭代去噪,可提升效率并减少冗余,首次聚焦只读工具。

Comments 15 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08636 2026-08-12 cs.CL 版本更新 79%

InternAgentHarness: A Scalable Synthetic Environment for Enhancing LLM Agentic Abilities

InternBootcamp 技术报告:通过可验证的任务扩展提升大语言模型推理能力

Xiaozhe Li, Yongkang Chen, Shujian Deng, Peiji Li, Yichuan Ma, Huaxi Huang, Qiye Cai, Tianyi Lyu, Le Ma, Linyang Li, Qipeng Guo, Dahua Lin, Kai Chen

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出InternBootcamp框架,通过可验证的任务扩展方法提升大语言模型的推理能力,为基于强化学习的模型优化、合成数据生成和模型评估提供了基础设施。

Comments InternAgentHarness tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19001 2026-08-12 cs.CL 版本更新 79%

HarmThoughts: A Benchmark for Fine-Grained Harmful Behavior Detection in Reasoning Traces

当安全失败之前:在推理链中基准测试有害行为检测

Ishita Kakkar, Enze Zhang, Rheeya Uppaal, Junjie Hu

机构 * Department of Computer Sciences, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出HarmThoughts基准,用于评估推理链中逐步的安全性。通过分析56931个句子,识别有害行为传播模式,发现现有检测器在细粒度行为检测上存在不足,揭示了过程级安全监控的关键缺口。

Comments Accepted at COLM 2026 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25143 2026-08-12 cs.CV cs.CL 版本更新 79%

TemMed-Bench: Evaluating Temporal Medical Image Reasoning in Vision-Language Models

TemMed-Bench:评估视觉语言模型的时序医学图像推理能力

Junyi Zhang, Jia-Chen Gu, Wenbo Hu, Yu Zhou, Robinson Piramuthu, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出TemMed-Bench时序医学图像推理基准,评估12个视觉语言模型,发现多数模型缺乏分析患者状况时序变化的能力,多模态检索扩充可显著提升其性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09873 2026-08-11 cs.CV cs.AI 新提交 79%

Sci-VBench: Evaluating Knowledge- and Reasoning-Intensive Video Generation in Science Domains

Sci-VBench:面向科学领域知识与推理密集型视频生成的评估

Diandian Zhang, Tingyu Song, Lin Fu, Zheyuan Yang, Yilun Zhao

机构 * Zhejiang University(浙江大学) UCAS(中国科学院大学) Tongji University(同济大学) Yale University(耶鲁大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究推出Sci-VBench基准,评估科学领域视频生成,测试16个模型后发现,视觉真实感提升未转化为科学与因果动态建模能力,且专有模型性能优于开源模型。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09230 2026-08-11 cs.AI 新提交 79%

SafeSceneReason: A Multimodal Reasoning Benchmark Connecting Industrial Hazards with Accident Knowledge

SafeSceneReason:连接工业危害与事故知识的多模态推理基准

Yuanchi Zhu, Kang An, Tengyue Wang, Zhongyu Yang, Chenxu Du, Xinqi Yang, Hebao Zhu, Bokai Zhao, Tianyu Liang, Ziliang Wang, Faqiang Qian, Yunli Yang, Weiyang Shi, Qibing Ren

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 SafeSceneReason是关联工业危害与事故知识的多模态推理基准,含两类问答对,评估发现现有视觉-语言模型在工业安全推理上存显著弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08061 2026-08-11 cs.AI 新提交 79%

CORDA: A Benchmark for Hierarchical Harm-Centric Moral Reasoning in Large Language Models

CORDA:面向大语言模型的以伤害为核心的分层道德推理基准

Siddarth Singh, Victoria Williams, Simon Rosen, Ebenezer Gelo, Helen Sarah Robertson, Ibrahim Suder, Benjamin Rosman, Geraud Nangue Tasse, Steven James

机构 * University of the Witwatersrand(威特沃特斯兰德大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 研究提出CORDA基准,评估大语言模型的以伤害为核心的分层道德推理,发现多数模型优先避免直接个人伤害,部分模型无法遵循指定优先级,该基准填补了LLM道德评估的核心空白。

Comments 8 pages, 6 figures. Accepted at the Fourth International Workshop on Value Engineering in AI (VALE 2026), affiliated with IJCAI-ECAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07838 2026-08-11 cs.AI 新提交 79%

Counterfactual Benchmarking and Training for Factuality Consistency and Order-Robust Grounded Reasoning in LLMs over Heterogeneous Knowledge

针对异构知识下大语言模型事实一致性与顺序鲁棒接地推理的反事实基准测试与训练

Shibo Chu, Yuze Liu, Tiehua Zhang, Zhishu Shen, Lianghua He, Haofen Wang, Zhijun Ding

机构 * Tongji University(同济大学) Swinburne University of Technology(斯威本科技大学) Wuhan University of Technology(武汉理工大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究构建异构知识下LLM事实一致性基准TKFQA,提出训练框架ORLF,可提升LLM的推理与顺序鲁棒性,优于多种基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07796 2026-08-11 cs.AI 新提交 79%

CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR

CliniCARE-Bench:电子健康记录中医疗推理的临床校准审计

Veronica Chatrath, Bryan Zhu, George Pu, Jingxuan Fan, Apaar Shanker, Varun Ursekar, Anahita Sharma, Jason Qin, Keqi Han, Soham Dinesh Tiwari, Soham Dan, Vijay Kalmath, Yuan Li, Daniel Yue Zhang, Chenguang Wang, Zainab Doctor, Zhijun Yin, Nigam H. Shah, Yuan Xue

机构 * Scale AI Emory University(埃默里大学) University of California, Santa Cruz(加州大学圣克鲁兹分校) Vanderbilt University Medical Center(范德堡大学医学中心) Stanford School of Medicine(斯坦福医学院) Stanford Health Care(斯坦福医疗保健系统) Clinical Excellence Research Center(临床卓越研究中心)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究推出首个面向部署的临床智能体基准CliniCARE-Bench,评估智能体对真实纵向电子健康记录的医疗推理,发现原始准确率夸大调查质量,无缺陷准确率更低且会重新排序排行榜。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08704 2026-08-11 cs.AI 版本更新 79%

AgentPSO: Evolving Agent Reasoning Skill via Multi-agent Particle Swarm Optimization

AgentPSO: 通过多智能体粒子群优化进化智能体推理能力

Hyunmin Hwang, Jaemin Kim, Choonghan Kim, Hangeol Chang, Jong Chul Ye

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 AgentPSO通过多智能体粒子群优化框架,使智能体在任务中进化推理能力,通过结合自身经验与群体最优技能,提升个体与集体推理性能,实验证明其优于静态单智能体和测试时多智能体方法。

Comments The 3rd AI for Math Workshop at the 43rd International Conference on Machine Learning (ICML), Seoul, South Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09459 2026-08-11 cs.CL 版本更新 79%

From Reasoning to Agentic: Credit Assignment in Reinforcement Learning for Large Language Models

从推理到代理:大型语言模型强化学习中的信用分配

Chenchen Zhang

机构 * Independent Researcher(独立研究员)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文探讨了大型语言模型强化学习中信用分配问题,总结了47种方法,并提出了可重用的资源,指出从推理到代理的转变使信用分配更加复杂,推动了新的方法发展。

Comments 50 pages, 4 figures. v3: expanded to a unified 69-paper corpus through July 31, 2026; adds restored-state identification results, blind coding of a 42-paper full-text subset, a source-located reporting audit, the CA-ID Card, and replay-fidelity analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09636 2026-08-11 cs.CL 版本更新 79%

MiraMind: Benchmarking Reliable Mental Health Reasoning beyond Answer Accuracy

MentraSuite:面向心理健康推理与评估的训练后大语言模型

Mengxi Xiao, Kailai Yang, Pengde Zhao, Enze Zhang, Ziyan Kuang, Zhiwei Liu, Weiguang Han, Shu Liao, Lianting Huang, Guojun Xiong, Victor Gutierrez Basulto, Jinpeng Hu, Min Peng, Qianqian Xie, Sophia Ananiadou

机构 * School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) Center for Language and Information Research, Wuhan University(武汉大学语言信息研究中心) The University of Manchester(曼彻斯特大学) School of Computer Science, Wuhan University(武汉大学计算机科学学院) Mount Holyoke College(马歇尔学院) Hefei University of Technology(合肥工业大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 MentraSuite通过训练后模型Mindora,提升心理健康推理的可靠性与一致性,适用于复杂的心理健康评估与诊断场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07417 2026-08-10 cs.CV cs.AI 新提交 79%

I Seek You in Videos: Identity-Conditioned Queries for Person-Centric Video Reasoning

我在视频中寻找你:面向以人为中心的视频推理的身份条件查询

Shibo Gao, Chongxiao Wang, Chenglong Huang, Jie Ma, Haolin Shi, Fei Ding, Jing Li, Qiang Lyu, Yangyang Liu, Yang Liu, Jun Liu, Linlin Huang, Peipei Yang

机构 * Beijing Jiaotong University(北京交通大学) HUJING Digital Media & Entertainment Group(汇晶数字媒体与娱乐集团) MAIS Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究提出了身份条件查询(ICQ)任务,构建了ISYV基准、训练集与框架,实验显示主流多模态大语言模型在该任务上表现不佳,ISYV模型性能优于强基线且接近闭源模型。

Comments Accepted to ACM Multimedia 2026 (MM '26). 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06865 2026-08-10 cs.CV cs.AI cs.MA 新提交 79%

Multi-Agent Forensic Reasoning for Generalizable Deepfake Video Detection

用于可泛化深度伪造视频检测的多智能体取证推理

Xuechao Zou, Shun Zhang, Kai Li, Yi Zhou, Xinyu Sun, Yuhui Chen, Zhe Wu, Congyan Lang, Junliang Xing

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 针对深度伪造检测的现有方法泛化性不足问题,本文构建含10万视频的FaceVid-Forensics-100K数据集,提出多智能体取证推理框架,在域外测试集上性能优于GPT、Gemini等模型。

Comments 22 pages, 8 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07269 2026-08-10 cs.CL 版本更新 79%

Joint Optimization of Reasoning and Dual-Memory for Self-Learning Diagnostic Agent

推理与双记忆联合优化的自学习诊断代理

Bingxuan Li, Simo Du, Yue Guo

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Jacobi Medical Center(雅各比医学中心)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出SEA自学习诊断代理,通过认知启发的双记忆模块联合优化推理与记忆管理,实现在MedCaseReasoning数据集上达到92.46%准确率,并在ER-Reason数据集上取得最佳表现,验证了经验转化为可重用知识的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04726 2026-08-06 cs.AI cs.CV 新提交 79%

When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning

当提示词成为像素:面向多模态推理的提示词-区域定位

Yongxin Wang, Ruizhe Zhou, Yueling Tang, Yingying Zhu, Xuemin Zhao, Xiaojun Chang, Xiaodan Liang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究针对多模态大语言模型在视觉化任务语义场景下的准确率下降问题,提出提示词-区域定位方法,有效提升了基准测试准确率且无需OCR或区域元数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04719 2026-08-06 cs.AI 新提交 79%

Diagnosing Tool-Selection Reasoning in LLM Agents with Canary Tools

用金丝雀工具诊断大语言模型智能体的工具选择推理

Atul Anand, Sourav Chattaraj

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究引入金丝雀工具诊断LLM智能体的工具选择推理,通过多维度分类法评估8个模型,发现模型能力提升会降低易感性,分类法具能力分层性,且发布了相关框架与数据。

Comments 10 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04567 2026-08-06 cs.CL 新提交 79%

STRIVE: Probing Reasoning Limits in Graded Plausibility Generation and Evaluation

STRIVE:探究分级合理性生成与评估中的推理极限

Bhiman Kumar Baghel, Anna Chrabaszcz, Tessa Warren, Michael Walsh Dickey, Haley C. Dresang, Xiang Lorraine Li

机构 * University of Pittsburgh(匹兹堡大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 STRIVE是基于LLM的框架,可联合生成评估跨越合理性类别与难度的受控事件集,实验中其优化后高质量事件集生成率达75.0%,为心理语言学研究减少手动工作量。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03038 2026-08-05 cs.CL stat.AP 新提交 79%

Beyond Accuracy: A Multidimensional Evaluation of Statistical Reasoning in Large Language Models

超越准确率:大型语言模型统计推理的多维度评估

Monnie McGee, Mateo Langston Smith, Julian Cabrera

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究结合多维度分析框架评估15款LLMs的统计推理,发现仅用准确率无法全面描述其统计推理能力,且存在厂商专属解释风格差异。

Comments 15 pages, 5 tables, 2 figures, presented at JSM 2026 and submitted for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01292 2026-08-04 cs.CL 新提交 79%

CrossLex: A Source-Grounded Benchmark for Cross-Jurisdictional Legal Reasoning in Large Language Models

CrossLex:面向大语言模型跨司法辖区法律推理的、基于法律来源的基准测试集

Xiaocui Yang, Xican Tan, Shoujie Chen, Shihan Xiao, Keke Tong, Xinyu Zhou

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出基于中、加州、德三国法律来源的CrossLex基准测试集,定义三项任务并提出联合评估指标,发现大语言模型在跨司法辖区法律推理上存在不足,旨在推动相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00100 2026-08-04 cs.CV cs.AI 新提交 79%

SPARC-Rad: A Multimodal Benchmark Dataset and Evaluation Pipeline for Spatial and Anatomical Reasoning in Radiology Vision-Language Models

SPARC-Rad:面向放射学视觉语言模型的空间与解剖推理多模态基准数据集及评估流程

Satvik Tripathi, Mustafa Ege Seker, Kristian Quevada, Ebubechukwu D Enwerem, Pratham Khandelwal, Emine Meltem, Bera Koca, Shahriar Faghani, Jacinta Arnold, Dania Daye, Tessa S. Cook

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究开发了SPARC-Rad多模态基准数据集及评估流程,用于评估放射学VLMs的空间与解剖推理能力,为相关模型的开发与部署前评估提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27860 2026-08-04 cs.AI 版本更新 79%

C-MIG: Multi-view Information Gain-based Retrieval-Augmented Generation for Clinical Diagnosis Reasoning

C-MIG:基于多视角信息增益的检索增强生成用于临床诊断推理

Yuwei Miao, Gen Li, Yunsheng Zeng, Xiandong Li, Yujin Wang, Siyu Chen, Luning Wang, Yunhao Qiao, Junfeng Wang, Jianwei Lv, Bo Yuan

机构 * Baidu Inc(百度公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出C-MIG框架,通过多视角信息增益和多重子查询检索增强策略,解决检索增强生成中奖励信号丢失和异构推理监督问题,在临床诊断任务上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏