arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10472 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10472 篇

2605.14752 2026-05-15 cs.LG cs.AI 62%

Cognitive-Uncertainty Guided Knowledge Distillation for Accurate Classification of Student Misconceptions

认知不确定性引导的知识蒸馏用于准确分类学生误解

Qirui Liu, Hao Chen, Weijie Shi, Jiajie Xu, Jia Zhu

机构 * South China University of Technology(华南理工大学) Tencent Financial Technology(腾讯金融科技) The Hong Kong University of Science and Technology(香港科学与技术大学) Soochow University(苏州大学) Zhejiang Key Laboratory of Intelligent Education Technology and Application, Zhejiang Normal University(浙江省智能教育技术与应用重点实验室,浙江师范大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种两阶段知识蒸馏框架,通过认知不确定性机制挖掘高价值样本,提升学生误解分类的准确率,实验表明在少量数据下优于现有方法。

Comments ACL 2026 Findings. 10 pages, 5 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14543 2026-05-15 cs.LG cs.AI 62%

RxEval: A Prescription-Level Benchmark for Evaluating LLM Medication Recommendation

RxEval: 一个处方级基准,用于评估LLM药物推荐

Shuhao Chen, Weisen Jiang, Changmiao Wang, Xiaoqing Wu, Xuanren Shi, Yu Zhang, James T. Kwok

机构 * The Hong Kong University of Science and Technology(香港科技大学) Southern University of Science and Technology(南方科技大学) The Chinese University of Hong Kong(香港中文大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学深圳校区) Shenzhen University General Hospital(深圳大学人民医院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 RxEval通过多选题评估LLM处方能力,包含1547个问题,涵盖584名患者、18种诊断类别和969种药物,测试16个LLM显示其挑战性和区分性,F1值从45.18到77.10,最佳精确匹配仅46.10%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14120 2026-05-15 cs.LG cs.CL 62%

Mini-JEPA Foundation Model Fleet Enables Agentic Hydrologic Intelligence

Mini-JEPA基础模型舰队实现智能水文智能

Mashrekur Rahman

机构 * Dartmouth Libraries, Dartmouth College(达特茅斯图书馆,达特茅斯大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Mini-JEPA基础模型舰队,通过路由代理为特定问题选择传感器,提升水文分析精度,实验显示其在土壤湿度、干旱和降水预测中优于AlphaEarth。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14062 2026-05-15 cs.AI cs.CL 62%

Know When To Fold 'Em: Token-Efficient LLM Synthetic Data Generation via Multi-Stage In-Flight Rejection

知何时该收手:通过多阶段飞行拒绝实现令牌高效的大语言模型合成数据生成

Anjir Ahmed Chowdhury, Syed Zawad, Feng Yan

机构 * Department of Computer Science University of Houston(计算机科学系休斯顿大学) IBM Research(IBM研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MSIFR框架,通过在生成过程中早期检测低质量轨迹以减少令牌浪费,提升合成数据生成效率,实验表明其在多个模型和基准上显著降低令牌消耗并保持准确性。

Comments 17 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14055 2026-05-15 cs.CL cs.AI 62%

PEML: Parameter-efficient Multi-Task Learning with Optimized Continuous Prompts

PEML:参数高效多任务学习与优化连续提示

Anjir Ahmed Chowdhury, Syed Zawad, Xiaolong Ma, Xu Dong, Feng Yan

机构 * IBM Research(IBM研究院) Argonne National Laboratory(阿贡国家实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PEML,通过优化连续提示和低秩适应实现多任务学习的高效微调,实验显示在多个基准测试中准确率提升显著。

Comments 26 pages, 8 figures, 18 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13950 2026-05-15 cs.LG cs.AI hep-ex hep-ph 62%

Collider-Bench: Benchmarking AI Agents with Particle Physics Analysis Reproduction

Collider-Bench:通过粒子物理分析复现评估AI代理

Darius A. Faroughy, Sofia Palacios Schweitzer, Ian Pang, Siddharth Mishra-Sharma, David Shih

机构 * New High Energy Theory Center(新高能理论中心) Department of Physics & Astronomy(物理与天文学系) Rutgers University(罗格斯大学) Faculty of Computing & Data Sciences(计算与数据科学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Collider-Bench,评估AI代理能否仅通过公开论文和开源软件复现LHC实验分析,强调物理推理和领域知识的重要性,结果显示无代理能超越物理学家在环解决方案。

Comments 23 pages | 9 figures | 4 tables | Code: https://github.com/dfaroughy/Collider-Bench | Task Corpus: https://huggingface.co/datasets/Dariusfar/ColliderBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13848 2026-05-15 cs.AI cs.CL cs.DC 62%

GraphBit: A Graph-based Agentic Framework for Non-Linear Agent Orchestration

GraphBit:一种基于图的代理框架用于非线性代理编排

Yeahia Sarker, Md Rahmat Ullah, Musa Molla, Shafiq Joty

机构 * MTSU InfinitiBit GmbH Salesforce Research

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 GraphBit通过显式定义DAG流程提高代理编排的可重复性和可审计性,在多个基准任务中表现优于现有框架,实现高准确率、低延迟和高吞吐量。

Comments 12 pages, 5 figures, 4 tables. Submitted to arXiv, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13485 2026-05-14 cs.LG cs.CL cs.IT math.IT 62%

Effective Context in Transformers: An Analysis of Fragmentation and Tokenization

Transformer中的有效上下文:碎片化与分词分析

Amirmehdi Jafari Fesharaki, Mohammadamin Rami, Aslan Tchamkerten

机构 * Department of Communications and Electronics(通讯与电子系) Institut Polytechnique de Paris(巴黎高等理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了不同表示方式对Transformer有限上下文预测的影响,发现碎片化会增加信息损失,而分词方法能扩展上下文范围,揭示了表示选择的信息论框架。

Comments 30 pages, 9 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13021 2026-05-14 cs.LG cs.AI 62%

Rethinking Efficient Graph Coarsening via a Non-Selfishness Principle

重新思考通过非自私原则的高效图粗化

Xu Bai, Bin Lu, Kun Zhang, Shengbo Chen, Xinbing Wang, Chenghu Zhou, Meng Jin

机构 * School of Information Science and Electronic Engineering, Shanghai Jiao Tong University, Shanghai, China(上海交通大学信息科学与电子工程学院) School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China(上海交通大学人工智能学院) School of Environment Science and Engineering, Shanghai Jiao Tong University, Shanghai, China(上海交通大学环境科学与工程学院) School of Artificial Intelligence, Nanchang University, Nanchang, China(南昌大学人工智能学院) Institute of Geographic Sciences and Natural Resources Research, Chinese Academy of Sciences, Beijing, China(中国科学院地理科学与资源研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出非自私原则的图粗化方法NOPE,通过局部各向同性假设降低计算复杂度,实现线性内存和近线性时间复杂度,实验显示在高阶节点上具有显著加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12645 2026-05-14 cs.CL cs.AI 62%

Training LLMs with Reinforcement Learning for Intent-Aware Personalized Question Answering

通过强化学习训练LLMs进行意图感知的个性化问答

Maryam Amirizaniani, Benjamin Charles Germain Lee, Jevin West, Nicholas Weber

机构 * University of Washington(华盛顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出IAP框架,通过强化学习直接从单轮问题推断用户意图并生成意图感知的回答,实验表明其在LaMP-QA基准上优于所有基线,平均宏得分提升约7.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09636 2026-05-14 cs.AI cs.CV cs.HC cs.LG 62%

PersonalAlign: Hierarchical Implicit Intent Alignment for Personalized GUI Agent with Long-Term User-Centric Records

PersonalAlign:面向个性化GUI代理的分层隐式意图对齐

Yibo Lyu, Gongwei Chen, Rui Shao, Weili Guan, Liqiang Nie

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PersonalAlign,通过长期用户记录实现个性化GUI代理的隐式意图对齐,引入AndroidIntent基准测试,评估代理在模糊指令解析和主动建议中的表现,HIM-Agent在执行和主动性能上提升显著。

Comments Accepted to ACL26 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08461 2026-05-14 cs.LG cs.AI cs.CV hep-ex 62%

Adapting Vision-Language Models for Neutrino Event Classification in High-Energy Physics

为高能物理中的中微子事件分类适应视觉-语言模型

Dikshant Sagar, Kaiwen Yu, Alejandro Yankelevich, Jianming Bian, Pierre Baldi

机构 * Department of Computer Science, University of California, Irvine, CA, USA(计算机科学系,加州大学欧文分校,加州,美国) Department of Physics, University of California, Irvine, CA, USA(物理系,加州大学欧文分校,加州,美国)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了将微调后的LLaMA 3.2应用于中微子事件分类,对比了Transformer架构与CNN在准确性和鲁棒性上的表现,展示了视觉-语言模型在物理事件分类中的潜力。

Comments Accepted for publication in Communications Physics (Nature Portfolio)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12525 2026-05-14 cs.SI cs.AI cs.CL 62%

PERCEIVE: A Benchmark for Personalized Emotion and Communication Behavior Understanding on Social Media

PERCEIVE:面向社交媒体个性化情绪与交流行为理解的基准测试

Jian Liao, Yujin Zheng, Suge Wang, Jianxing Zheng, Deyu Li

机构 * School of Computer and Information Technology, Shanxi University, China(山西大学计算机与信息学院) Key Laboratory of Computational Intelligence and Chinese Information Processing of Ministry of Education, Shanxi University, China(教育部计算智能与中文信息处理重点实验室,山西大学,中国) Joint Laboratory of Tourism Big Data in Shanxi Province, China(山西省旅游大数据联合实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 PERCEIVE是首个整合五维社交感知的双语大规模基准,通过真实用户互动捕捉读者个性化情绪响应,推动社交智能NLP研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12477 2026-05-13 cs.LG cs.CL 62%

MEME: Multi-entity & Evolving Memory Evaluation

MEME:多实体与演进记忆评估

Seokwon Jung, Alexander Rubinstein, Arnas Uselis, Sangdoo Yun, Seong Joon Oh

机构 * KAIST AI(韩国科学技术院人工智能实验室) Tübingen AI Center, University of Tübingen(图宾根大学图宾根人工智能中心) NAVER AI Lab(NAVER人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究探讨多实体与演进内存系统在持续环境中的表现,发现默认配置下所有系统在依赖推理上表现不佳,仅文件型代理配合Claude Opus 4.7能部分改善,但成本高且不实用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24985 2026-05-13 cs.CV cs.AI cs.LG cs.RO 62%

DarkQA: Benchmarking Vision-Language Models on Visual-Primitive Question Answering in Low-Light Indoor Scenes

DarkQA:在低光室内场景中对视觉-原始问题进行问答的视觉语言模型基准测试

Yohan Park, Hyunwoo Ha, Wonjun Jo, Tae-Hyun Oh

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) Pohang University of Science and Technology (POSTECH)(釜山科学技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 DarkQA针对低光环境下视觉语言模型的感知基本能力进行基准测试,通过多级低光条件评估,揭示模型在复杂任务中的局限性。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11727 2026-05-13 cs.AI cs.CL cs.CV 62%

Allegory of the Cave: Measurement-Grounded Vision-Language Learning

洞穴的寓言:基于测量的视觉-语言学习

Kepeng Xu, Li Xu, Gang He, Wenxin Yu

机构 * Xidian University(西电大学) Southwest University of Science and Technology(西南科技大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了视觉-语言模型在更接近底层相机测量的视觉接口下,基于测量的视觉-语言学习是否能提升性能。PRISM-VL模型结合RAW数据、相机条件接地和曝光括号监督聚合,通过高质量数据集和基准测试,提升了BLEU、ROUGE-L和LLM-Judge的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11334 2026-05-13 cs.LG cs.CL cs.IR 62%

VERDI: Single-Call Confidence Estimation for Verification-Based LLM Judges via Decomposed Inference

VERDI:基于验证的LLM裁判的单次调用置信度估计方法

Jasmine Qi, Danylo Dantsev, Muyang Sun

机构 * Indeed Inc(Indeed公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 VERDI通过分解推理过程提取置信度信号,无需额外调用,提升验证型LLM裁判的可信度评估。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11260 2026-05-13 cs.LG cs.AI 62%

Curriculum Learning-Guided Progressive Distillation in Large Language Models

基于课程学习的渐进蒸馏:大型语言模型中的知识蒸馏

Jincheng Cao, Fanzhi Zeng, Leqi Liu, Aryan Mokhtari

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Google Research(谷歌研究)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CLPD框架,通过结合数据难度与教师强度,改进知识蒸馏方法,实验证明其在推理任务中优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11143 2026-05-13 cs.CL cs.AI cs.IR 62%

ClinicalBench: Stress-Testing Assertion-Aware Retrieval for Cross-Admission Clinical QA on MIMIC-IV

ClinicalBench: 用于MIMIC-IV跨入院临床问答的应力测试型断言感知检索

Alex Stinard

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 ClinicalBench通过400个问题测试43名MIMIC-IV患者,评估断言敏感类别下的检索性能,采用EpiKG知识图谱检索方法,通过六种LLM模型测试,发现断言感知检索在临床问答中提升22个百分点。

Comments 46 pages including appendices (two-column preprint format). Under review at JAMIA. Code, frozen evaluator, and benchmark released at https://huggingface.co/datasets/alexstinard/epikg-clinicalbench. ClinicalBench v2 is a 400-question MIMIC-IV stress test for assertion-aware retrieval

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11086 2026-05-13 cs.CR cs.AI cs.LG 62%

ExploitGym: Can AI Agents Turn Security Vulnerabilities into Real Attacks?

ExploitGym:AI代理能否将安全漏洞转化为实际攻击?

Zhun Wang, Nico Schiller, Hongwei Li, Srijiith Sesha Narayana, Milad Nasr, Nicholas Carlini, Xiangyu Qi, Eric Wallace, Elie Bursztein, Luca Invernizzi, Kurt Thomas, Yan Shoshitaishvili, Wenbo Guo, Jingxuan He, Thorsten Holz, Dawn Song

机构 * UC Berkeley(加州大学伯克利分校) Max Planck Institute for Security and Privacy(马克斯·普朗克安全与隐私研究所) UC Santa Barbara(加州大学圣巴巴拉分校) Arizona State University(亚利桑那州立大学) Anthropic(Anthropic公司) OpenAI Google(谷歌)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 ExploitGym通过大规模真实漏洞数据评估AI代理的漏洞利用能力,揭示前沿模型在复杂漏洞利用中的表现,凸显AI发展对网络安全的潜在风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15664 2026-05-13 cs.LG cs.AI 62%

Stargazer: A Scalable Model-Fitting Benchmark Environment for AI Agents under Astrophysical Constraints

Stargazer:一种可扩展的AI代理在天体物理约束下的模型拟合基准环境

Xinge Liu, Terry Jingchen Zhang, Bernhard Schölkopf, Zhijing Jin, Kristen Menou

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) ELLIS Institute Tübingen(图宾根ELLIS研究所)

专题命中 推理评测 :test-time compute(abstract);分类 cs.AI、cs.LG

AI总结 Stargazer通过120个任务评估AI代理在动态物理约束下的模型拟合能力,揭示了数值优化与物理约束间的差距,并提供了可扩展的评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22933 2026-05-13 cs.AI cs.CL 62%

RW-Post: Auditable Evidence-Grounded Multimodal Fact-Checking in the Wild

RW-Post:可审计的证据导向多模态事实核查

Danni Xu, Shaojing Fan, Harry Cheng, Mohan Kankanhalli

机构 * School of Computing (SoC), National University of Singapore (NUS)(新加坡国立大学计算机学院(SoC)) National University of Singapore (NUS)(新加坡国立大学) Department of Electrical and Computer Engineering (ECE), National University of Singapore (NUS)(新加坡国立大学电子与计算机工程系(ECE))

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 RW-Post提出一种可审计的多模态事实核查基准,通过人类事实核查文章提取证据,支持不同场景下的可控评估,提升视觉 grounding 和证据利用能力。

Comments Code and dataset will be released at https://github.com/xudanni0927/AgentFact

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06371 2026-05-13 cs.CL cs.AI 62%

OASIS: A Multilingual and Multimodal Dataset for Culturally Grounded Spoken Visual QA

OASIS:一个多语言多模态数据集用于文化导向的语音视觉问答

Firoj Alam, Ali Ezzat Shahroor, Md. Arid Hasan, Zien Sheikh Ali, Hunzalah Hassan Bhatti, Mohamed Bayan Kmainasi, Shammur Absar Chowdhury, Basel Mousi, Fahim Dalvi, Nadir Durrani, Natasa Milic-Frayling

机构 * Qatar Computing Research Institute(卡塔尔计算研究 institute)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 OASIS是一个多语言多模态数据集,涵盖图像、文本和语音,旨在评估模型在现实场景中的文化导向推理能力,包含0.92M真实图像和14.8M问答对。

Comments Multimodal Foundation Models, Large Language Models, Native, Multilingual, Language Diversity, Contextual Understanding, Culturally Informed

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04265 2026-05-13 cs.AI cs.CL math.ST stat.ML stat.TH 62%

Don't Pass@k: A Bayesian Framework for Large Language Model Evaluation

不要Pass@k:大规模语言模型评估的贝叶斯框架

Mohsen Hariri, Amirhossein Samandar, Michael Hinczewski, Vipin Chaudhary

机构 * Department of Computer and Data Sciences, Case Western Reserve University(计算机与数据科学系,凯斯西储大学) Department of Physics, Case Western Reserve University(物理系,凯斯西储大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于贝叶斯的评估框架,用后验估计替代Pass@k和avg@N,提升排名稳定性与透明度,适用于二元和非二元评估。

Comments OpenReview (ICLR 2026): https://openreview.net/forum?id=PTXi3Ef4sT

Journal ref The Fourteenth International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10889 2026-05-12 cs.LG cs.AI 62%

Unmasking On-Policy Distillation: Where It Helps, Where It Hurts, and Why

揭示在线策略蒸馏:它何时有益,何时有害,以及原因

Mohammadreza Armandpour, Fatih Ilhan, David Harrison, Ajay Jaiswal, Duc N. M Hoang, Fartash Faghri, Yizhe Zhang, Minsik Cho, Mehrdad Farajtabar

机构 * Apple(苹果公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨在线策略蒸馏在不同场景下的有效性,提出基于梯度对齐度的诊断方法,发现蒸馏信号在学生表现不佳时更有效,且最优上下文依赖学生模型能力和任务需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10186 2026-05-12 cs.CL cs.AI 62%

LegalCiteBench: Evaluating Citation Reliability in Legal Language Models

LegalCiteBench: 评估法律语言模型中的引文可靠性

Sijia Chen, Hang Yin, Shunfan Zhou

机构 * Northeastern University(东北大学) Phala

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LegalCiteBench,用于评估法律语言模型在闭书环境下引文恢复、验证和案例匹配的能力,发现即使最强模型在引文检索和完成任务上得分低于7/100,且多数模型存在误导性引文问题。

Comments Preprint. 23 pages including references and appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10171 2026-05-12 cs.CL cs.AI 62%

When Reviews Disagree: Fine-Grained Contradiction Analysis in Scientific Peer Reviews

当评论存在分歧时:科学同行评审中的细粒度矛盾分析

Sandeep Kumar, Yash Kamdar, Abid Hossain, Bharti Kumari, Tanik Saikh, Asif Ekbal

机构 * Department of Computer Science and Engineering, Indian Institute of Technology Patna, India(印度理工学院帕纳瓦分校计算机科学与工程系) School of Computer Engineering, KIIT Deemed to be University, Bhubaneswar, India(比哈尔邦布尔萨大学计算机工程学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出细粒度的同行评审矛盾分析方法,通过识别矛盾证据跨度并分配矛盾强度评分,改进了现有二元矛盾检测方法,引入RevCI基准和IMPACT框架,并通过TIDE模型实现高效部署。

Comments accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08031 2026-05-12 cs.SD cs.AI cs.LG eess.AS 62%

AU-Harness: An Open-Source Toolkit for Holistic Evaluation of Audio LLMs

AU-Harness:音频大语言模型的开放式工具包

Hoang Nguyen, Sidharth Surapaneni, Akshay Kalkunte, Jash Mehta, Aman Tiwari, Oluwanifemi Bamgbose, Khyati Mahajan, Jash Shah, Shruthan Radhakrishna, Sathwik Tejaswi Madhusudhan, Vikas Yadav, Sai Rajeswar

机构 * ServiceNow University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 AU-Harness通过优化处理流程和并行执行,实现151%的速度提升,提供标准化提示协议和灵活配置,促进音频大语言模型的系统性发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10027 2026-05-12 cs.CL cs.AI 62%

Speech-based Psychological Crisis Assessment using LLMs

基于语音的心理危机评估使用大语言模型

Terumi Chiba, Yang Luo, Ziyun Cui, Yongsheng Tong, Chao Zhang

机构 * Tsinghua University(清华大学) Peking University Huilongguan Clinical Medical School(北京大学回龙guan临床医学院) WHO Collaborating Centre for Research and Training in Suicide Prevention(世界卫生组织自杀预防研究与培训协作中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用大语言模型自动分类危机等级,通过引入语音学注入方法和增强推理训练策略,提升热线服务质量。

Comments 5 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09918 2026-05-12 cs.LG cs.AI cs.CY 62%

NaiAD: Initiate Data-Driven Research for LLM Advertising

NaiAD:启动基于数据的研究以进行大语言模型广告

Yihang Zhang, Zimeng Huang, Ren Zhai, Yipeng Kang, Tonghan Wang

机构 * Tsinghua University(清华大学) College of AI(人工智能学院) Department of Literature, Arts and Communication(文学、艺术与传播系) Anhui International Studies University(安徽国际关系大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出NaiAD数据集,用于研究大语言模型广告,包含58999个精心构建的广告嵌入响应与用户查询,通过理论指导的评估指标提升用户体验和商业价值。

Comments 37 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏