arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-24 至 2026-08-24 共收录 31 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 31 篇

2608.21032 2026-08-24 cs.RO 新提交 82%

Roadside-Cooperative Autonomous Driving: From Data Platform to Vision-Language End-to-End Reasoning

路侧协同自动驾驶:从数据平台到视觉-语言端到端推理

Yitao Xu, Tong Wu, Yiyan Wu, Guoji Xu, Yanbo Jiang, Jiahao Wang, Zehong Ke, Junkai Jiang, Fang Zhang, Jianqiang Wang

专题命中 推理评测 :reasoning(title,abstract);planning(abstract)

AI总结 针对现有V2X基准的局限,推出V2XBench平台与Chat-V2XBench数据集,提出AURORA端到端协同驾驶框架,其在严重遮挡场景下路径完成率达98.21%、驾驶得分76.02,开创了可扩展的V2X-VLM范式。

Comments 15 pages, 5 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16633 2026-08-24 cs.CL cs.AI cs.MM 版本更新 81%

GeoExplain: Multimodal Reasoning based on Hierarchy of Visual Information in Street View

GeoExplain:基于街景图像视觉信息层次的多模态推理

Fenghua Cheng, Jinxiang Wang, Sen Wang, Zi Huang, Xue Li

机构 * The University of Queensland(昆士兰大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对现有多模态推理任务缺乏对不同粒度视觉线索推理的研究缺口,提出GeoExplain数据集与SightSense方法,实现街景图像的地理定位预测与可解释性说明,且方法在该数据集上表现优异。

Comments Updated version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13872 2026-08-24 cs.NE cs.AI 版本更新 80%

S-AI-Recursive: Convergent Recursive Reasoning

S-AI-Recursive:一种生物启发式且时间稀疏的AI架构,用于迭代、反思和节能推理

Said Slaoui

机构 * Mohammed V University(穆莱·伊斯梅尔大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出S-AI-Recursive架构,通过激素闭环迭代而非单向传递实现推理,结合生物启发式方法和数学模型,验证了时间稀疏性原理。

Comments Preprint. 55 pages. No figures. S-AI-Recursive: Convergent Recursive Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20797 2026-08-24 cs.AI 新提交 79%

Automated Trajectory Evaluation for Mobile Agents via Step-Level Consequence Reasoning and Aggregation

基于步骤级结果推理与聚合的移动智能体自动轨迹评估

Pengshuai Yang, Zijing Gao, Xue Yu, Benhui Zhuang, Bo Yuan, Junlan Feng

机构 * Jiutian Research(九天研究院) China Mobile(中国移动)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究提出CRATE(含安全评估扩展版CRATE-S)这一VLM-as-judge框架,通过步骤级推理解决移动智能体轨迹评估的上下文过载与安全缺失问题,在AndroidWorld、MobileRisk数据集上取得优于现有方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09772 2026-08-24 cs.AI 版本更新 79%

Two Heads are Better Than One: Test-time Scaling of Multi-agent Collaborative Reasoning

两个脑袋胜过一个:测试时扩展多智能体协作推理

Can Jin, Hongwu Peng, Qixin Zhang, Yujin Tang, Dimitris N. Metaxas, Tong Che

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究针对单智能体测试时扩展(TTS)的瓶颈,提出用多智能体系统(MAS)升级TTS,引入M500数据集并结合CEO智能体的自适应策略,微调的Qwen2.5-32B-MAS等模型性能优于基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20345 2026-08-24 cs.CL cs.AI cs.CY 新提交 76%

When Vocabulary Comprehension Fails Clinical Reasoning: Evaluating Therapy Bots' Safety Risks for Generation Alpha

当词汇理解失效于临床推理:评估面向阿尔法世代(Gen Alpha,2010-2024年出生)的治疗机器人的安全风险

Manisha Mehta, Virendra Mehta

机构 * Lynbrook High School(林布鲁克高中) University of Trento(特伦托大学)

专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI

AI总结 本研究构建两个基准评估Claude、GPT-4o等LLM的治疗机器人安全风险,发现其存在10-14个百分点的词汇理解与临床风险校准差距,识别六种失败模式,提出四项监管与技术改进建议。

Comments 42 pages, 6 figures. Accepted at ACM FAccT '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20492 2026-08-24 cs.CV 新提交 75%

Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs

以标注为回滚:面向视频多模态大语言模型的高效可扩展强化学习

Yunheng Li, Guohong Mu, Hao Li, Shengsheng Qian, Dingwen Zhang, Qibin Hou, Ming-Ming Cheng

机构 * Nankai University(南开大学) Northwestern Polytechnical University(西北工业大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) NKIARI

专题命中 推理评测 :CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 本文提出OraRL算法,将标注作为神谕回滚解耦优势估计,实现高效可扩展的视频MLLM强化学习,在多项视频感知基准上超越现有模型,解码速度大幅提升。

Comments Project page: this https URL (https://orarl.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20391 2026-08-24 cs.CL 新提交 74%

ImmigrationReason: A Structured Dataset of U.S. Immigration Appeals for Legal Reasoning Research

ImmigrationReason:面向法律推理研究的美国移民上诉结构化数据集

Amirhossein Afsharrad, Seyed Shahabeddin Mousavi

机构 * Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(title);分类 cs.CL

AI总结 本研究推出ImmigrationReason大规模结构化数据集,涵盖美国移民上诉裁决相关数据,可支撑法律推理领域的结果预测、错误分析及高风险监管智能体设计等研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01048 2026-08-24 cs.CL cs.LG 版本更新 73%

Compared to What? Baselines and Metrics for Counterfactual Prompting

与什么相比?反事实提示的基线和度量标准

Zihao Yang, Mosh Levy, Yoav Goldberg, Byron C. Wallace

机构 * Northeastern University(东北大学) Bar-Ilan University(巴伊兰大学) Allen Institute for AI(人工智能研究所)

专题命中 推理评测 :CoT(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文探讨了反事实提示中基线和度量标准的重要性,指出单纯改变文本因素无法准确评估模型敏感性,提出通过统计检验比较干预差异与改写影响的框架,发现模型对患者性别等的敏感性在考虑一般模型敏感性后显著降低。

Comments Published as a conference paper at COLM 2026. 33 pages, 10 figures, 18 tables. Code: this https URL (https://github.com/redagavin/counterfactual-prompting-baselines); Python package (cfprompt): this https URL (https://github.com/redagavin/cfprompt)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21140 2026-08-24 cs.CV cs.AI 新提交 70%

A Modular Agent for Reliable and Auditable Spatial Relation Verification in CT Scans

用于CT扫描中可靠且可审计的空间关系验证的模块化智能体

Simon Vincent Abel, Heiko Hillenhagen, Michael Götz, Timo Ropinski, Ayhan Can Erdur, Daniel Santak Wolf

机构 * Ulm University(乌尔姆大学) Ulm University Hospital(乌尔姆大学医院) Technical University of Munich (TUM)(慕尼黑工业大学(TUM)) TUM University Hospital(慕尼黑工业大学医院) Department of Radiation Oncology, TUM University Hospital(慕尼黑工业大学医院放射肿瘤科)

专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 针对医学视觉-语言模型空间推理薄弱的问题,提出模块化医学影像智能体,通过分阶段处理实现CT扫描空间关系验证,性能优于端到端基线,可作为未来医学影像智能体的构建块。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20938 2026-08-24 cs.AI 新提交 70%

No Judgment Without a Reason: Counterfactual Receipts for Versioned AI Evaluators

无理由不判断:面向版本化AI评估器的反事实收据

Ye Chen, Weining Zhang

机构 * Alibaba Group(阿里巴巴集团) Cheung Kong Graduate School of Business(长江商学院)

专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 该研究针对AI评估器的推理问责问题,提出反事实收据方法与ReasonBench基准,发现模型标准准确率掩盖鲁棒性缺陷,需解耦预测与认证以实现可信审计。

Comments 26 pages, 11 tables, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18300 2026-08-24 cs.AI 版本更新 70%

The Lifecycle of LLM-as-a-Judge for Large-Scale Recommendation Explanations

用于大规模推荐解释的LLM评判模型的生命周期

Emma Yanyang Kong, JJ Tan, Ishan Gupta, Lars Olds, Claire Campbell, David Fagnan, Ratna Kavuri, Veli Balin, Rohan Gosain, Louis Garcia, Minsu Jang

机构 * Netflix(网飞公司)

专题命中 推理评测 :reasoning(abstract,abstract_cn);分类 cs.AI

AI总结 该研究提出用于Netflix大规模推荐解释评估的LLM评判模型生命周期框架,经五周A/B测试证实,其对齐的解释可提升会员对新颖内容的观看及浏览到播放会话量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20699 2026-08-24 cs.CV 新提交 67%

ArtiMo: Agent-Driven Articulated Mesh Animation

ArtiMo:智能体驱动的关节网格动画

Chunyu Zou, Peng Dai, Yi-Hua Huang, Ze Yuan, Jingwei Huang, Yeming Yao, Xiaojuan Qi

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 ArtiMo是一种智能体驱动的零样本框架,结合URDF运动学约束与LLMs/VLMs,生成文本引导的关节网格动画,通过视觉自改进机制修正错误,在新基准数据集上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20418 2026-08-24 q-bio.QM cs.AI cs.LG 新提交 62%

Rigorous Evaluation of Large Language Models for Malaria Drug Discovery: Trade-offs in Performance, Scale, and Resource Utility

用于疟疾药物发现的大型语言模型的严格评估:性能、规模与资源效用之间的权衡

Marvellous O. Ajala (1), Zainab Ashimiyu-Abdusalam (1), Comfort Adesina (1) ((1) Magami Open Sciences Initiative)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究构建了Malaria-Instruct数据集,评估了多款开源LLM在疟疾虚拟筛选中的表现,发现微调后的开源LLM性能优于经典ML模型和专有模型,是高效的抗疟药物发现范式。

Comments 12 pages, 4 tables, 2 figures, Ijcai2026 style

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21021 2026-08-24 cs.CL cs.AI cs.NI 新提交 62%

Free-Text Evaluation of LLMs for 5G Domain Knowledge and Fault Analysis using LLM-as-Judge

基于LLM作为评判者的5G领域知识与故障分析大模型自由文本评估

Rishiraj Sengupta, Sotiris Chatzimiltis, Mohammad Shojafar, Xiatian Zhu

机构 * Surrey Institute for People-Centered Artificial Intelligence(萨里以人为本人工智能研究院) Google(谷歌)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文以自由文本格式评估Claude-Haiku-4.5等三个轻量型LLM的5G领域知识与故障分析能力,发现其故障诊断准确率超90%但规范召回不足,Gemini-3.1-Flash-Lite效率最优适合生产部署。

Comments 6pages, 4figures. Accepted for presentation in IEEE CSCN conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20634 2026-08-24 cs.CL cs.AI 新提交 62%

AgentMercury: Your Agent Can Synthesize Verifiable Environments for Business Scenarios at scale

AgentMercury:你的智能体可规模化合成面向业务场景的可验证环境

Minbyul Jeong, Chanwoong Yoon

机构 * Meridian Intelligence Global Inc.(子午线智能全球公司) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出AgentMercury框架,可规模化合成业务场景的可执行环境,经其训练的智能体策略在企业工作流及多领域基准上表现提升,且环境构建过程可通过微调学习优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20574 2026-08-24 cs.AI cs.CY cs.LG cs.SE 新提交 62%

FlavourBench: Ranking Frontier Language Models with Executable Culinary Ground Truth

FlavourBench:基于可执行烹饪基准真值的前沿语言模型排名

Josef Chen, Erim Hayretci

机构 * Imperial College London(帝国理工学院)

专题命中 推理评测 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 FlavourBench是一款自动化语言模型排名基准,以可执行烹饪系统为基准真值,评估27个前沿语言模型,发现Grok 4.6表现最优,可有效消除排行榜差异缺失,结果可靠。

Comments 10 pages, 5 figures. Evaluation of 27 frontier language-model endpoints on 534 identical tasks per model, comprising 14,418 scored model-task cells. Code: this https URL (https://github.com/josefchen/flavourbench) Dataset: this https URL (https://huggingface.co/datasets/josefchen/flavourbench) Interactive leaderboard: this https URL (https://huggingface.co/spaces/josefchen/flavourbench)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20361 2026-08-24 cs.CL cs.AI 新提交 62%

Toward Auto-Research: Mining Falsifiable Research Ideas from Paper Knowledge Graphs with Categorical Structure

迈向自动研究:利用具有分类结构的论文知识图谱挖掘可证伪的研究思路

Yuchen Wang, Zhongzhi Luan

机构 * Sino-German Joint Software Institute(中德软件联合研究所) Beihang University(北京航空航天大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对LLMs构建的自动研究思路生成系统的结构缺陷,提出基于范畴论的三层算法,可高效过滤跨领域研究思路候选,兼具高过滤比与高可证伪率,且支持日志记录。

Comments 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20349 2026-08-24 cs.CL cs.AI 新提交 62%

Beyond Prompt Engineering: A Systematic Analysis of Prompt Lexical Sensitivity and Its Impacts on Quality

提示工程之外:提示词词汇敏感性及其对质量影响的系统性分析

Qipeng Xie, Zi Liang, Jiafei Wu, Yufei Chen, Weizheng Wang, Wenao Ma, Zhong Ming, Haiqin Yang, Kaishun Wu

机构 * Shenzhen Technology University(深圳技术大学) The Hong Kong Polytechnic University(香港理工大学) Zhejiang Lab(之江实验室) The Chinese University of Hong Kong(香港中文大学) HKUST (Guangzhou)(香港科技大学(广州))

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对大型语言模型的提示词词汇敏感性开展大规模机制分析,揭示提示词性能稳定性缩放定律,提出自动化提示词优化智能体,可降低代码生成任务性能方差40.7%,为鲁棒提示工程提供可解释框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09748 2026-08-24 cs.DC cs.AI cs.LG cs.LO eess.SY 版本更新 62%

Defining Decentralization: An Ontological Perspective

去中心化的定义:一种本体论视角

Jakub Kacper Szeląg, Aydin Abadi, Mohammad Naseri

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对计算机领域缺乏通用去中心化定义的问题,提出基于图的本体框架,区分去中心化与分布性,引入两个新指标并实现浏览器工具,为联邦学习等系统提供一致的去中心化评估基础。

Comments 27 pages, 6 figures, preparing for submission, strengthened the formalisms behind ontological claims

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21357 2026-08-24 cs.AI 新提交 57%

VIALS: A Benchmark for Visual Interpretation of Artifacts in the Life Sciences

VIALS:生命科学领域人工产物视觉解释基准

Elaine Lau, Thanuka Udumulla, Lee Izhaki-Tavor, Francisco Guzmán, Nicholas Magazine, Jonas Mueller

机构 * Handshake AI

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究针对生命科学人工产物视觉解释的需求,构建含161项任务的VIALS基准,发现前沿视觉语言模型在该任务上存在领域知识与推理局限,凸显AI需具备此类能力以服务生命科学工作流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21305 2026-08-24 cs.CV cs.AI 新提交 57%

Re$^3$Cap: Retrieval-Guided Refinement for Image Captioning Enhancement via Reinforcement Learning

Re³Cap:基于强化学习的图像字幕增强的检索引导优化

Haonan Jia, Shichao Dong, Zenghui Sun, Jiawen Zheng, Ziqi Miao, Gege Shi, Qiuyu Zhao, Jinsong Lan, Xiaoyong Zhu, Bo Zheng

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝和天猫集团) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Re³Cap方法,利用多模态检索作为推理信号,通过CRS和CQA优化图像字幕,在COCO-LN500基准上关系推理性能较GRPO提升8.64%,优于SFT。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20975 2026-08-24 cs.AI 新提交 57%

Belief Without Behavior: Measuring the Translation of Theory of Mind into Coordinated Social Action in Vision-Language Models

无行为的信念:测量视觉-语言模型中心智理论到协同社会行动的转化

Tonglin Yan, Gregoire Sergeant-Perthuis, David Rudrauf

机构 * CIAMS, Université Paris-Saclay(巴黎萨克雷大学 CIAMS) CQSB, Sorbonne Université(索邦大学 CQSB)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 该研究提出基准MOSAIC评估视觉-语言模型的心智理论到协同社会行动的转化,发现多数模型存在瓶颈,而带显式ToM模块的PCM-LLM表现优异,证实显式信念-行动耦合的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20851 2026-08-24 cs.SE cs.AI 新提交 57%

BC-Bench: Evaluating Agentic Engineering in a Domain-Specific Language for ERP

BC-Bench:在ERP领域特定语言中评估智能体工程

Haoran Sun, Klaus Marius Hansen

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 该研究推出BC-Bench基准,评估智能体工程在ERP领域DSL(AL)上的表现,发现通用基准的改进未一致迁移到AL,凸显领域特定评估的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20414 2026-08-24 cs.AI cs.CV 新提交 57%

StateSight: Benchmarking Latent Spatial-State Reconstruction in Vision-Language Models

StateSight:评测视觉语言模型中的潜在空间状态重建能力

Michelle Lin

机构 * Thomas Jefferson High School for Science and Technology(托马斯·杰斐逊科学技术高中)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究推出StateSight基准及配套数据集StateSight-Steps,评估视觉语言模型的潜在空间状态重建能力,发现GPT-5.5、Claude Sonnet 5的表现均逊于人类基线,格式正确的响应可能掩盖空间结构恢复失败的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23740 2026-08-24 cs.CL 版本更新 57%

ZenGen: Social Mind for LLMs

Zing:大语言模型的社交智能

ZenGen Team, Ao Xiang, Bi Jingping, Chen Jiahui, Chen Lehan, Chen Yilin, Cheng Xueqi, Fan Yixing, Gan Kairong, Gao Haowen, Gao Jinhua, Gao Shuxuan, Gong Chang, Guo Jiafeng, Guo Ruijie, Han Zhouyu, He Guangfu, He Yichun, Jiang Shuo, Jing Shaoling, Jing Ya, Lei Chenhao, Lei Yan, Li Anqi, Li Chengao, Li Haoyu, Li Shitian, Liang Xinjian, Liu Zhaoge, Lyu Xingyu, Nie Zhuwei, Pang Liang, Quan Zeping, Shan Shiguang, Shen Huawei, Tang Xinran, Tian Feng, Wang Qian, Wang Ruiping, Wang Xiaohong, Xia Zaiyu, Xiao Yi, Xu Jiayuan, Xu Kehan, Xu Qianqian, Xu Tianyu, Xu Yongjun, Yang Haoming, Yang Jun, Yao Di, Yu Xiaoming, Zhang Futong, Zhang Jie, Zhang Shixuan, Zhang Yuxuan, Zhao Xinyu, Zhao Zhuoran, Zhong Yunfei, Zhu Shengyu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究大语言模型社交智能,提出Zijing框架,含测量基准SoMBench、训练方法Zing及推理架构Actio,通过实验证明社交智能大语言模型在评估、内化和落地方面需协同发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09885 2026-08-24 cs.CL 版本更新 57%

Index SLM Technical Report

索引SLM技术报告

Tianjiao Li, Lusheng Zhang, Shien He, Xiaojing Liu, Tianxing Yan, Mengran Yu, Ziang Cui, Kai Zhao, Xipeng Wang, Yang Liu, Yuxin Li

机构 * Bilibili(哔哩哔哩)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 哔哩哔哩开发Index-1.9B系列小语言模型,包括基础模型等四个模型。预训练采用特定方法,Index-1.9B-Base在标准基准测试表现出色,还进行了多项控制研究,所有模型及评估代码已公开。

Comments 16 pages, 9 figures. v3: updated author list to add Xipeng Wang

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20004 2026-08-24 cs.DB cs.CL 版本更新 57%

Human-Level Text-to-SQL via Reinforcement Learning on Verified Data, Without Pipeline Engineering

ReViSQL:实现人水平的文本到SQL

Yuxuan Zhu, Tengjun Jin, Yoojin Choi, Daniel Kang

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出ReViSQL框架,通过高质量训练数据提升SQL推理能力,首次在BIRD基准上达到人水平准确率,且在不同模型规模下均表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06519 2026-08-24 cs.CL 版本更新 57%

MedRAGChecker: Claim-Level Verification for Biomedical Retrieval-Augmented Generation

MedRAGChecker: 用于生物医学检索增强生成的声明级验证

Yuelyu Ji, Min Gu Kwak, Hang Zhang, Xizhi Wu, Chenyu Li, Yanshan Wang

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 推理评测 :verifier(abstract);分类 cs.CL

AI总结 MedRAGChecker通过声明级验证和诊断框架,提高生物医学RAG生成答案的可靠性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21133 2026-08-24 cs.CV cs.CR 新提交 50%

Masking Is Not Enough: Generative Restoration for Multimodal De-Identification in Medical AI

仅掩码不足:面向医疗AI的多模态去标识化生成式修复

Shiva Shrestha, Zongxing Xie, Chen Zhao, Liran Ma, Zhipeng Cai, Honghui Xu

机构 * Kennesaw State University(肯尼索州立大学) Miami University(迈阿密大学) Georgia State University(佐治亚州立大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 针对医疗图像-文本数据的PHI泄漏问题,提出端到端多模态净化框架ClinX,结合图像侧生成式修复与文本侧渐进式去标识化,在MedVQA中验证其优于仅OCR掩码的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏