arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10507 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10507 篇

2606.15325 2026-06-16 cs.CL 新提交 57%

Prior over Evidence: Stereotype-Driven Diagnosis in LLM-Based L2 Pronunciation Feedback

先验优于证据:基于LLM的二语发音反馈中的刻板印象驱动诊断

Rong Wang, Kun Sun

机构 * University of Tuebingen(蒂宾根大学) Tongji University(同济大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究测试了LLM在二语发音反馈中是否基于语音证据而非预训练先验进行诊断,发现评分准确性与推理脱钩,音素级反馈收敛于固定困难音素集,且声学证据仅在直接探测目标维度时改善评分。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15044 2026-06-16 cs.CL 新提交 57%

Equity with Efficiency: An Empirical Study of Tokenizers for Multilingual Large Language Models

公平与效率:多语言大语言模型分词器的实证研究

Kieron Seven Jun Wei Lee, Muhammad Reza Qorib, Andrew Ivan Soegeng, Hwee Tou Ng

机构 * National University of Singapore(新加坡国立大学) Carnegie Mellon University(卡内基梅隆大学) SAP

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文系统比较了11种东南亚语言上的公平分词器,发现Parity-aware BPE在效率与公平的权衡中处于帕累托前沿,而Morphology-Driven Byte Encoding在语义推理上表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14817 2026-06-16 cs.IR cs.AI 新提交 57%

Combining Retrieval-Augmented Text Generation with LLMs for Reading Content Recommendations

结合检索增强文本生成与大型语言模型的阅读内容推荐

Sooyeon Kim, Piotr S. Maciąg

机构 * Institute of Computer Science, Warsaw University of Technology(计算机科学学院,华沙技术大学)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI

AI总结 提出结合检索增强生成(RAG)与大型语言模型的系统,通过四个模块实现个性化阅读内容生成,实验表明RAG将相关性和接地性提升26-35个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11349 2026-06-16 cs.AI cs.HC 新提交 57%

Knowing When to Ask: Self-Gated Clarification for Hierarchical Language Agents

知道何时提问:分层语言代理的自门控澄清机制

Aijing Gao, Yiming Kang, Mengdie Flora Wang, Jae Oh Woo

机构 * Amazon Web Services(亚马逊云科技)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出ACTION-RATING框架,将澄清请求纳入代理的动作空间,与导航共享序数尺度,在分层推理中实现自门控澄清,通过强制性和机会性两种信息寻求模式提升决策准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27618 2026-06-16 cs.LG 版本更新 57%

Evaluating Local Explainability Metrics for Machine Learning Models on Tabular Data

评估表格数据机器学习模型的局部可解释性指标

Tomás Pereira, João Vitorino, Eva Maia, Isabel Praça

机构 * GECAD, ISEP, Polytechnic of Porto(GECAD、ISEP、波尔图理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 研究局部可解释性技术在复杂表格分类任务中的可信度,通过基准测试LIME、Kernel SHAP和特征消融技术,发现解释质量主要受数据集复杂性和特征分布影响,而非模型预测性能。

Comments 9 pages, 12 tables, 1 figure, DATA 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01733 2026-06-16 cs.CV cs.AI 版本更新 57%

GEASS: Gated Evidence-Adaptive Selective Caption Trust for Vision-Language Models

GEASS: 基于证据适应的门控选择性描述信任机制用于视觉-语言模型

Zeshang Li, Shuoyang Zhang

机构 * University of International Relations(国际关系大学)

专题命中 推理评测 :reasoning(abstract_cn);分类 cs.AI

AI总结 本文提出GEASS,一种无需训练的模块,通过门控、加权和证据标准来决定模型在每个查询中消耗多少描述信息,从而提升视觉-语言模型的准确性。

Comments 18 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09755 2026-06-16 cs.AI 57%

Explainability Through Human-Centric Design for XAI in Lung Cancer Detection

通过以人为中心的设计实现XAI在肺癌检测中的可解释性

Amy Rafferty, Rishi Ramaesh, Ajitha Rajan

机构 * University of Edinburgh(爱丁堡大学) NHS Lothian(NHS洛锡安)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出XpertXAI模型,通过人类中心设计在肺癌检测中实现可解释性,优于现有方法,提供更符合专家推理的概念解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06173 2026-06-16 cs.IR cs.AI 版本更新 57%

Beyond Case Law: Evaluating Structure-Aware Retrieval and Safety in Statute-Centric Legal QA

超越判例法:评估法规中心型法律问答中的结构感知检索与安全性

Kyubyung Chae, Jewon Yeom, Jeongjae Park, Seunghyun Bae, Ijun Jang, Hyunbin Jin, Jinkwan Jang, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对法规中心型法律问答中层级检索困难与模型幻觉问题,提出结构-安全感知基准SearchFireSafety,通过图引导检索提升性能,但揭示领域适应模型在证据缺失时更易幻觉。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05859 2026-06-16 cs.AI 版本更新 57%

When Do We Need LLMs? A Diagnostic for Language-Driven Bandits

何时需要大语言模型?语言驱动型老虎机的诊断方法

Uljad Berdica, Fernando Acero, Anton Ipsen, Parisa Zehtabi, Michael Cashmore, Manuela Veloso

机构 * University of Cambridge(剑桥大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出LLMP-UCB算法从LLM中获取不确定性估计,实验表明轻量数值老虎机在文本嵌入上匹配或超越LLM方案且成本更低,并给出基于臂嵌入的几何诊断指导何时使用LLM。

Comments The Reinforcement Learning Conference, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06198 2026-06-16 cs.CL cs.IR 版本更新 57%

The Answer Lies Within: Self-Derived Rewards Enable Explainable Relation Extraction

答案源于内部:自衍生奖励实现可解释关系抽取

Xinyu Guo, Zhengliang Shi, Minglai Yang, Mihai Surdeanu

机构 * University of Arizona(亚利桑那大学) Shandong University(山东大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 针对大语言模型在无预定义标签的单次关系抽取中易受无关词干扰和抽象层级不匹配的问题,提出COGRE认知推理框架和HIT@DICT强化学习奖励策略,通过自动提取信用词典奖励关系相关短语,显著提升准确率和解释质量。

Comments Working in process

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06015 2026-06-16 cs.CL 版本更新 57%

A Systematic Evaluation of Large Language Models for PTSD Severity Estimation: The Role of Contextual Knowledge and Modeling Strategies

大型语言模型在PTSD严重程度评估中的系统评估:上下文知识与建模策略的作用

Panagiotis Kaliosis, Adithya V Ganesan, Oscar N. E. Kjell, Whitney Ringwald, Scott Feltman, Melissa A. Carr, Dimitris Samaras, Camilo Ruggero, Benjamin J. Luft, Roman Kotov, Andrew H. Schwartz

机构 * Department of Computer Science(计算机科学系) Stony Brook University(石溪大学) College of Connected Computing(连接计算学院) Vanderbilt University(范德比大学) Lund University(隆德大学) University of Minnesota(明尼苏达大学) Stony Brook World Trade Center Wellness Program(石溪世界贸易中心健康计划) Renaissance School of Medicine at Stony Brook University(石溪大学复兴医学院) University of Texas at Dallas(德克萨斯大学达拉斯分校) Department of Psychiatry(精神病学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究系统评估了11种大型语言模型在PTSD严重程度评估中的表现,发现提供详细定义和上下文可提升准确性,增加推理努力可改善估计,并验证了集成策略的有效性。

Comments 24 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15966 2026-06-16 cs.AI 版本更新 57%

PISA: A Pragmatic Psych-Inspired Unified Memory System for Enhanced AI Agency

PISA:一种增强AI能动性的实用心理学启发统一记忆系统

Shian Jia, Ziyang Huang, Xinbo Wang, Haofei Zhang, Mingli Song

机构 * Zhejiang University(浙江大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 受皮亚杰认知发展理论启发,提出PISA统一记忆系统,通过三模态适应机制(模式更新、演化、创建)和混合记忆访问架构,显著提升AI代理的适应性和长期知识保留。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11201 2026-06-16 cs.DB cs.AI 版本更新 57%

Bridging the Gap: Enabling Natural Language Queries for NoSQL Databases through Text-to-NoSQL Translation

弥合差距:通过文本到NoSQL翻译实现NoSQL数据库的自然语言查询

Jinwei Lu, Jiawei Lu, Chen Zhang, Zhiqian Qin, Haodi Zhang, Yuanfeng Song, Raymond Chi-Wing Wong

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文研究Text-to-NoSQL任务,提出TEND基准和SAG求解器,用于将自然语言请求翻译为MongoDB聚合管道,验证了无模式文档推理的独特挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14239 2026-06-15 cs.AI 新提交 57%

SkillAudit: Ground-Truth-Free Skill Evolution via Paired Trajectory Auditing

SkillAudit: 通过配对轨迹审计实现无真实反馈的技能进化

Haowen Gao, Haoran Chen, Can Wang, Shasha Guo, Liang Pang, Zhaoyang Liu, Huawei Shen, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室)

专题命中 推理评测 :verifier(abstract);分类 cs.AI

AI总结 提出SkillAudit框架,通过配对轨迹审计和过程对齐对比评估,无需真实反馈即可进化智能体技能,在89个任务中平均奖励达73.9%。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14068 2026-06-15 cs.CL 新提交 57%

Harsher on Male? Evaluating LLMs on Gender-Asymmetric Moral Framing Across Diverse Conflict Scenarios

对男性更严厉?评估LLM在不同冲突场景中的性别不对称道德框架

Guangzong Si, Dong Wang, Zhenhao Li, Yifan Yu, Panwang Pan, Wentao Zhu

机构 * University of Science and Technology of China(中国科学技术大学) Eastern Institute of Technology, Ningbo(宁波东方理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出GAMA-Bench基准,通过性别镜像场景评估LLM对相同负面行为的回应,发现模型对男性更倾向于惩罚和责备,对女性则更强调共情和治疗。

Comments underreview

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14037 2026-06-15 cs.CL 新提交 57%

Right or Wrong, Models Comply: Directional Blindness in LLM Moral Judgment

对或错,模型都顺从:LLM 道德判断中的方向盲从

Jihye Kim, Jeffrey Flanigan

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出顺从不对称性(A = BCR/HCR)双向诊断指标,发现大语言模型在事实判断中更顺从有益提示(A=1.58),但在道德判断中几乎同等顺从有益和误导提示(A=1.04),揭示了方向盲从这一对齐失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13931 2026-06-15 cs.CL 新提交 57%

DLawBench: Evaluating LLMs Through Multi-Turn Legal Consultation

DLawBench: 通过多轮法律咨询评估大语言模型

Li Zhang, Yuzhen Shi, Yiran Hu, Jingwen Zhang, Wenbo Lv, Yubo Ma, Wei Wang, Rongyao Shi, Yuanyang Qiu, Xinran Xu, Yuemeng Qi, Linlin Miao, Jaromir Savelka, Yun Liu, Kevin Ashley, Bing Zhao, Hu Wei, Lin Qu

机构 * University of Pittsburgh(匹兹堡大学) Alibaba Group(阿里巴巴集团) University of Waterloo(滑铁卢大学) Shandong University(山东大学) Skylenage China University of Political Science and Law(中国政法大学) Qwen Team, Alibaba Group(阿里巴巴集团Qwen团队) Fordham University(福特汉姆大学) Shanghai Jiao Tong University(上海交通大学) Carnegie Mellon University(卡内基梅隆大学) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出DLawBench基准,通过模拟四种客户类型(合作、依赖、退缩、对抗)的多轮对话,评估大语言模型在真实法律咨询中的交互能力。

Comments 37 pages, 8 figures, 26 tables. Code and data: https://github.com/SKYLENAGE-AI/DLawBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13808 2026-06-15 cs.CL 新提交 57%

The Culture Funnel: You Can't Align What isn't in the Data

文化漏斗:你无法对齐不在数据中的内容

Ananya Sahu, Mehrnaz Mofakhami, Daniel D'Souza, Thomas Euyang, Julia Kreutzer, Marzieh Fadaee

机构 * Cohere Labs(Cohere实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 针对当前文化对齐方法依赖推理时干预而忽视训练数据的问题,提出文化数据漏斗概念,通过多维标签框架分析预训练、微调、对齐和推理数据集,发现后训练阶段文化信号急剧下降,多语言性虽增强地理多样性但未能确保平衡,所提标签可提升下游文化基准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02320 2026-06-15 cs.CL 版本更新 57%

TVIR: Building Deep Research Agents Towards Text-Visual Interleaved Report Generation

TVIR:构建面向文本-视觉交错报告生成的深度研究智能体

Xinkai Ma, Zhiqi Bai, Dingling Zhang, Pei Liu, Yishuo Yuan, He Zhu, Jiakai Wang, Qianqian Xie, Yifan Zhao, Xinlong Yang, Hao Cong, Zhiheng Yao, Fengxia Xie, Zihao Xu, Haoran Xu, Zhaohui Wang, Minghao Liu, Shirong Lin, Yingshui Tan, Yuchi Xu, Wenbo Su, Zhaoxiang Zhang, Bo Zheng, Jiaheng Liu

机构 * Nanjing University Alibaba Group(南京大学阿里集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出TVIR基准和层次化多智能体框架,解决深度研究报告中视觉元素的事实可靠性与对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30931 2026-06-15 cs.CL 版本更新 57%

MineExplorer: Evaluating Open-World Exploration of MLLM Agents in Minecraft

MineExplorer: 评估MLLM智能体在Minecraft中的开放世界探索能力

Tianjie Ju, Yueqing Sun, Zheng Wu, Wei Zhang, Yaqi Huo, Xi Su, Qi Gu, Xunliang Cai, Gongshen Liu, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Meituan(美团)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出MineExplorer基准,通过多智能体合成工作流构建隐式多跳任务,评估多模态大语言模型在Minecraft中的开放世界探索能力,发现长轨迹协调仍是挑战。

Comments Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11378 2026-06-15 cs.CL 版本更新 57%

An Empirical Study of Automating Agent Evaluation

自动化代理评估的实证研究

Kang Zhou, Sangmin Woo, Haibo Ding, Kiran Ramnath, Subramanian Chidambaram, Aosong Feng, Vinayak Arannil, Muhyun Kim, Ishan Singh, Darren Wang, Zhichao Xu, Megha Gandhi, Nirmal Prabhu, Soumya Smruti Mishra, Vivek Singh, Gouri Pandeshwar, Lin Lee Cheong

机构 * AWS AI Labs(AWS人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文研究了自动化代理评估的可行性,提出EvalAgent系统,通过编码技能和领域知识提升评估效率,实验显示其在评估准确性和人类偏好上显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02318 2026-06-15 cs.CR cs.AI 版本更新 57%

COGNITION: From Evaluation to Defense against Multimodal LLM CAPTCHA Solvers

认知:从评估到对抗多模态大语言模型CAPTCHA求解器

Junyu Wang, Changjia Zhu, Yuanbo Zhou, Lingyao Li, Xu He, Mingkui Wei, Junjie Xiong

机构 * Missouri University of Science and Technology(密苏里科技大学) University of South Florida(佛罗里达州立大学) Visa Inc.(Visa公司) George Mason University(乔治·马歇尔大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文研究多模态大语言模型如何削弱视觉CAPTCHA的安全性,评估7种主流MLLM在18种CAPTCHA任务中的表现,揭示其解决能力及防御策略。

Comments Accepted by USENIX Sec'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16120 2026-06-15 cs.AI 版本更新 57%

LLM-Powered AI Agent Systems and Their Applications in Industry

基于大语言模型的AI智能体系统及其工业应用

Guannan Liang, Qianqian Tong

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文综述了从传统智能体到LLM驱动智能体的演进,分类为软件、物理和自适应混合系统,并讨论了在客服、软件开发、制造、教育、金融和医疗等领域的应用及挑战。

Comments This is the author's accepted version of the paper accepted to appear at IEEE AIIoT 2025. The final version will be available via IEEE Xplore. \c{opyright}2025 IEEE. Personal use of this material is permitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13218 2026-06-12 cs.CL 新提交 57%

When Similar Means Different: Evaluating LLMs on Arabic--Hebrew Cognates

当相似意味着不同:评估大语言模型在阿拉伯语-希伯来语同源词上的表现

Junhong Liang, Noor Abo Mokh, Bashar Alhafni

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·穆扎伊德人工智能大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 针对阿拉伯语和希伯来语同源词、假朋友和借词,构建SemCog Bench基准(1858对词对),评估LLM跨语言语义理解,发现模型依赖表面形式相似性,在假朋友和借词上表现差,上下文帮助有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12969 2026-06-12 cs.AI 新提交 57%

Multi-Modal Agents for Power Distribution Defect Detection: An Evaluation of Foundation Models

用于配电缺陷检测的多模态智能体:基础模型评估

Quan Quan

机构 * Quan Quan

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出多模态智能体框架,系统评估基础模型在感知、推理和工具使用三方面的能力,用于配电缺陷检测的闭环自动化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12821 2026-06-12 cs.AI cs.ET 新提交 57%

GeoNatureAgent Benchmark: Benchmarking LLM Agents for Environmental Geospatial Analysis Across Frontier and Open-Weight Foundation Models

GeoNatureAgent Benchmark:面向前沿与开源基础模型的环境地理空间分析LLM智能体基准测试

Gabriel Diaz-Ireland, Diego Prieto-Herráez, Mario García Peces, Javier Velázquez, Devika Jain

机构 * Universidad Católica de Ávila (UCAV)(阿维拉天主教大学) Johns Hopkins University(约翰霍普金斯大学) Independent Researcher(独立研究者) Center for Geographic Analysis, Harvard University(哈佛大学地理分析中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出首个通过结构化工具调用真实API评估环境分析智能体的基准,包含93个任务,发现Claude Sonnet 4领先,但开源模型在成本效益上占优,且比较任务普遍未解决。

Comments Preprint. 10 pages, 8 figures. Submitted to ACM SIGSPATIAL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12599 2026-06-12 cs.CL 新提交 57%

Constrained Semantic Decompression in LLMs through Persian Proverb-Conditioned Story Generation

通过波斯谚语条件故事生成实现LLM中的约束语义解压缩

Zahra Habibzadeh, Paria Khoshtab, Amir Mesbah, Yadollah Yaghoobzadeh

机构 * Tehran Institute for Advanced Studies, Khatam University, Iran(德黑兰高级研究所,卡塔姆大学,伊朗) School of Electrical and Computer Engineering, College of Engineering, University of Tehran, Tehran, Iran(电气与计算机工程学院,工程学院,德黑兰大学,伊朗)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出约束语义解压缩任务,通过波斯谚语条件故事生成测试大语言模型的抽象到实现能力,构建PAND数据集,发现解压缩差距,并表明显式推理和迭代细化可部分缓解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10389 2026-06-12 cs.CL 版本更新 57%

BLUEmed: Retrieval-Augmented Multi-Agent Debate for Clinical Error Detection

BLUEmed: 基于检索增强的多智能体辩论用于临床错误检测

Saukun Thika You, Nguyen Anh Khoa Tran, Wesley K. Marizane, Hanshu Rao, Qiunan Zhang, Xiaolei Huang

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出BLUEmed框架,结合混合检索增强生成与多智能体辩论,通过分解临床笔记、检索证据、专家辩论及安全层过滤,在术语替换错误检测中达到最优性能。

Comments Accepted to the IEEE International Conference on Healthcare Informatics (ICHI) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19072 2026-06-12 cs.SE cs.AI 版本更新 57%

HalluJudge: A Reference-Free Hallucination Detection for Context Misalignment in Code Review Automation

HalluJudge: 代码审查自动化中上下文错位的无参考幻觉检测

Kla Tantithamthavorn, Hong Yi Lin, Patanamon Thongtanunam, Wachiraphan Charoenwet, Minwoo Jeong, Ming Wu

机构 * Monash University Australia(墨尔本大学澳大利亚) The University of Melbourne Australia(墨尔本大学澳大利亚) Atlassian USA(Atlassian美国)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出无参考幻觉检测方法HalluJudge,通过上下文对齐评估生成评论的根基性,采用多分支推理策略,在F1=0.85且成本$0.009下与开发者偏好67%一致。

Comments Accepted at FSE'26: Industry Track, Full-Length, Peer-Reviewed

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07294 2026-06-12 cs.CE cs.AI 版本更新 57%

Fin-RATE: A Real-world Financial Analytics and Tracking Evaluation Benchmark for LLMs on SEC Filings

Fin-RATE:面向SEC文件的金融分析与追踪评估基准

Yidong Jiang, Junrong Chen, Eftychia Makri, Jialin Chen, Peiwen Li, Ali Maatouk, Leandros Tassiulas, Eliot Brenner, Bing Xiang, Rex Ying

机构 * Tongji University(同济大学) University of California, San Diego(加州大学圣地亚哥分校) Yale University(耶鲁大学) Goldman Sachs(高盛集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对LLM在金融领域分析复杂监管文件的需求,提出基于SEC文件的Fin-RATE基准,通过三种任务路径评估模型,发现跨文档和跨时间分析时性能显著下降。

Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏