arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10507 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10507 篇

2607.26886 2026-07-30 cs.CV cs.AI cs.CL cs.CY 新提交 62%

Hearsay: Vision-Language Medical Diagnoses Without an Image

Hearsay:无需图像的视觉-语言医学诊断

Siddharth Vohra

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon Web Services AI Native(亚马逊网络服务AI原生部门)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究发现前沿视觉-语言模型在无图像时会基于人口统计学特征编造医学诊断,存在不同失败模式,提出需直接审计其结构化输出通道并将探针词敏感性作为核心评估维度。

Comments Peer-reviewed and presented at the 1st Workshop on Toward Trustworthy Vision-Language Models in the Wild (TrustVLM), co-located with ACM ICMR 2026, Amsterdam. Non-archival workshop. Reviews public on OpenReview. 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26455 2026-07-30 cs.CL cs.AI 新提交 62%

ForgetBench: Benchmarking Forgetting Dynamics of Long-Term Parametric Memory in Language Models

ForgetBench:语言模型中长期参数记忆的遗忘动态基准测试

Ruxi Gu, Zhenliang Zhang, Wei Wang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出ForgetBench基准测试,通过两种评估范式与统一分析框架,揭示现有LLMs在长期知识保留与泛化间难以平衡的问题,为未来模型记忆机制优化提供方向。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26317 2026-07-30 cs.CY cs.AI cs.CL 新提交 62%

Aligning LLM-Simulated and Human Examinees for Psychometric Calibration: A Cognitive Diagnostic Profiling Approach

对齐大语言模型模拟与人类应试者的心理测量校准:一种认知诊断画像方法

Wenjie Zhou, Yunting Liu, Renjiao Tang, Mark Wilson

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出认知诊断画像(CDP)零样本框架,优化LLM模拟应试者的心理测量对齐,在Tatsuoka分数减法数据集上提升了能力分布、掌握画像及题目难度与人类的匹配度,助力LLM模拟应试者用于测试开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25959 2026-07-30 cs.CL cs.AI 版本更新 62%

Detecting Knowledge Inconsistencies Across Text, Tables, and Knowledge Graphs

跨文本、表格和知识图谱检测知识不一致性

Fanfu Wei, Thibault Ehrhart, Raphaël Troncy

机构 * EURECOM(欧洲电信学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究跨文本、表格和知识图谱的知识不一致性检测问题,提出\textsc{Kontrast}框架,通过文本到SPARQL和语言模型推理比较并分类不一致性,实验表明跨模态不一致性常见且有价值,为知识审计提供工具并建立基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22720 2026-07-30 cs.LG cs.CL cs.CV stat.ML 版本更新 62%

CausalGate: Causal Importance Distillation for Transformer Module Pruning

因果门控:用于Transformer模块剪枝的因果重要性蒸馏

Kiran Nair, Smriti Regmi, Rodrigue Rizk

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究针对大语言模型自适应推理方法不足,提出CausalGate框架,在校准阶段隔离子层测量语义损伤,再用特定目标和损失将结构重要性提炼为标量门控,经实验验证其在多模型上优于基线,能降低硬件延迟且无操作开销。

Comments In-Review at a conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03273 2026-07-30 cs.CV cs.AI cs.CL 版本更新 62%

VistaHop: Benchmarking Long-Horizon Visual DeepSearch

VistaHop: 视觉深度搜索的多跳视觉推理基准

Hang He, Chuhuai Yue, Chengqi Dong, Chengcheng Wan, Ting Su, Haiying Sun, Jiajun Chai, Xiaohan Wang, Guojun Yin

机构 * East China Normal University(东华大学) Meituan(美团) Shanghai Innovation Institute(上海创新研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出VistaHop基准,通过多跳问答任务评估多模态大推理模型在视觉深度搜索中的迭代图像检查、视觉锚点定位和跨证据链推理能力,实验表明现有模型表现有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11178 2026-07-30 cs.AI cs.CL cs.MM cs.SI 版本更新 62%

TANDEM: Temporal-Aware Neural Detection for Multimodal Hate Speech

TANDEM: 面向多模态仇恨言论的时间感知神经检测

Girish A. Koushik, Helen Treharne, Diptesh Kanojia

机构 * Nature-Inspired Computing & Engineering, University of Surrey(Surrey大学自然启发计算与工程系) Surrey Centre for Cyber Security, University of Surrey(Surrey大学网络安全中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出TANDEM统一框架,通过串联强化学习策略联合优化视觉-语言和音频-语言模型,将音频-视觉仇恨检测转化为结构化推理问题,在HateMM上目标识别F1达0.73(提升30%),并保持精确时间定位。

Comments Accepted to AAAI-ICWSM 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25066 2026-07-29 cs.AI cs.CL 新提交 62%

Addressable Recall Compaction for Long Context-Window Control in AI Agents

用于人工智能代理中长上下文窗口控制的可寻址召回压缩

Thang Dang, Yuma Ichikawa, Sakina Fatima, Koichi Shirahata

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对长时程语言模型代理上下文窗口超界问题,提出ARC框架,将存档与活动上下文分离,以ID可寻址日志存储工具观察结果,压缩时替换旧观察结果。实验表明该方法能提高信息保留和服务效率。

Comments 20 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24814 2026-07-29 cs.AI cs.LG q-bio.OT 新提交 62%

Aletheia: An Offline-First Clinical Decision Support System for Differential Diagnosis in Low-Resource Healthcare Settings

Aletheia:用于低资源医疗环境中鉴别诊断的离线优先临床决策支持系统

Joseph Walusimbi, Ann Move Oguti, Abubakhari Sserwadda, Precious Boss Kasasira, Charles Brian Okoboi

机构 * Soroti University(索罗蒂大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对撒哈拉以南非洲低资源医疗环境,提出基于Qwen2.5 - 3B - Instruct并经QLoRA微调的Aletheia临床决策支持系统,评估显示其在诊断准确率等指标上表现良好,证明在无云设施的资源受限环境初级保健层部署大语言模型临床推理的可行性。

Comments 8 pages, 11 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02050 2026-07-28 cs.CY cs.AI cs.HC cs.LG 版本更新 62%

Principles and Guidelines for Randomized Controlled Trials in AI Evaluation

人工智能评估中随机对照试验的原则与指南

Christopher Kelly, Angelica Chowdhury, Alexandra Campili, Bimpe Ayoola, Devin Barbour, Thomas Chen Dawson, Ze Shen Chin, Rokas Gipiškis

专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对人工智能评估随机对照试验缺乏通用标准和共享词汇的问题,借鉴多学科实践综合五条原则,形成33条可操作指南,为其发挥设计工具、评估标准和标准制定蓝图的作用,提供评估标准、共享语言及指南。

Comments 33 pages, ICML 2026 (Workshop on Technical AI Governance Research) and Technical AI Safety Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24371 2026-07-28 cs.CL cs.AI 新提交 62%

Closed-Loop Validation-Repair for Healthcare Interoperability: A Multi-Model Study of Schema Compliance in Clinical LLMs

医疗保健互操作性的闭环验证修复:临床大语言模型中模式合规性的多模型研究

Jianru Shen

机构 * University of Montana(蒙大拿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究医疗大语言模型集成到电子健康记录系统面临的模式不合规问题,通过在多场景下部署三个开源模型并评估,发现模式不合规具有一致性,验证 - 修复框架可有效提高合规率,为医疗互操作性提供保障。

Comments Accepted at the 2026 IEEE International Conference on Systems, Man, and Cybernetics (SMC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23915 2026-07-28 cs.CL cs.AI 新提交 62%

Understanding Tone-Dependent Inference Cost in Large Language Models

理解大语言模型中与语气相关的推理成本

Akhil Kumar, Om Dobariya

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究提示语气对大语言模型答案准确性及推理成本的影响,通过在MMLU数据集上对七种语气进行实验,发现输出令牌长度变化超准确性变化,不同模型在不同语气下有不同表现,揭示语气对答案质量和推理资源消耗的作用。

Comments 16 pages, 1 figure, 9-page Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23514 2026-07-28 cs.CL cs.AI cs.MM 新提交 62%

Novel Claim or Déjà Vu? Rethinking "Contamination-Free'' Dynamic Evaluation for Multimodal Automated Fact-Checking

新主张还是似曾相识?重新思考多模态自动事实核查的“无污染”动态评估

Haorui He, Xinwen Chen, Dacheng Wen, Reynold Cheng, Francis C. M. Lau, Yupeng Li

机构 * Hong Kong Baptist University(香港浸会大学) The University of Hong Kong(香港大学) Beijing Normal-Hong Kong Baptist University(北京师范大学-香港浸会大学联合国际学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究多模态自动事实核查中基准的污染风险,通过实证研究静态和动态基准,发现动态评估虽能减少但不能消除污染,新主张可多种方式验证,污染会致性能膨胀和排名扭曲,为可信评估提供实用指南。

Comments Accepted at ACM Multimedia (ACM MM), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22592 2026-07-28 cs.AI cs.CL cs.IR 新提交 62%

Structure Over Scale: Schema-Constrained Causal Graphs for RAG

结构跨越尺度:用于检索增强生成的模式约束因果图

Marc Saouda, Rajprakash Bale, Eren Aldis, Cloves Almeida

机构 * Boston Consulting Group(波士顿咨询集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对GraphRAG问题,提出HCG-RAG,用模式约束因果图取代开放式提取,构建紧凑两层图。该方法成本低,答案质量优,在医学等基准测试中表现出色,对比实验显示因果图作为检索过滤器有优势,表明图内容比节点数量更重要。

Comments 26 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10156 2026-07-28 cs.IR cs.AI cs.CL 版本更新 62%

$τ$-Rec: A Verifiable Benchmark for Agentic Recommender Systems

$τ$-Rec:面向智能推荐系统的可验证基准

Bharath Sivaram Narasimhan, Karthik R Narasimhan

机构 * Independent Researcher(独立研究员) Princeton University(普林斯顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对多轮对话式智能推荐系统评估中主观性强、成本高的问题,提出$τ$-Rec基准,通过可验证奖励和揭示标记引导机制,结合pass^k可靠性指标,系统评估模型推理一致性,发现当前最佳模型可靠性仅约57%。

Comments Accepted at ACM RecSys 2026 (Reproducibility and Resource Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05792 2026-07-28 cs.AI cs.LG cs.LO cs.SE 62%

Can LLMs Write Correct TLA+ Specifications? Evaluating Natural-Language-to-TLA+ Generation

LLM 能写出正确的 TLA+ 规范吗?自然语言到 TLA+ 生成的评估

Arslan Bisharat, Brian Ortiz, Eric Spencer, Khushboo Bhadauria, TaiNing Wang, George K. Thiruvathukal, Konstantin Laufer, Mohammed Abuhamad

机构 * Department of Computer Science, Loyola University Chicago(洛约奈大学芝加哥分校计算机科学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文首次系统评估基于 LLM 从自然语言合成 TLA+ 规范的能力,发现模型在语义正确性上仅达 8.6%,且成功依赖于渐进式提示,揭示了模型大小与质量无关、代码专用模型表现不佳等关键发现。

Comments 12 pages, 11 tables. Accepted at the 21st International Conference on Software Technologies (ICSOFT 2026); Recommended as Best Paper Award Candidate

Journal ref ICSOFT 2026, pp. 39-50, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05515 2026-07-28 cs.AI cs.CL cs.CV 版本更新 62%

LEGO Co-builder: Exploring Fine-Grained Vision-Language Modeling for Multimodal LEGO Assembly Assistants

乐高协同构建器:探索用于多模态乐高组装助手的细粒度视觉语言建模

Haochen Huang, Yue Su, Xin Sun, Moonisa Ahsan, Mohammad Aliannejadi, Irene Viola, Zhaochun Ren, Chuang Yu, Aneta Lisowska, Artem Belopolsky, Koen Hindriks, Pablo Cesar, Junxiao Wang, Jiahuan Pei

机构 * Vrije University of Amsterdam University of Amsterdam Centrum Wiskunde \& Informatic University of Amsterdam National Institute of Informatics Centrum Wiskunde \& Informatic Centrum Wiskunde \& Informatic Leiden University University College London Vrije University of Amsterdam Centrum Wiskunde \& Informatica Technische Universiteit Delft Guangzhou University Vrije University of Amsterdam Centrum Wiskunde \& Informatic

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对视觉语言模型理解多模态组装指令的挑战,提出乐高协同构建器基准,引入统一框架评估多个VLMs及推理模型,发现物体检测性能高但细粒度场景理解和状态检测有挑战,还发布相关资源助力未来研究。

Comments This version has been accepted by ICMI 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22153 2026-07-27 cs.AI cs.LG 新提交 62%

Industrial Tokenization for LLM-Based Health Intelligence: A Federated Architecture for Industrial Evidence Integration

基于大语言模型的工业健康智能的工业令牌化:一种用于工业证据集成的联邦架构

Deshui Li, Xiao-Ming Yuan, Zishun Wang

机构 * Mingyang Smart Energy Co., Ltd.(明阳智慧能源集团股份有限公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究工业健康管理中异构信息源集成问题,提出工业令牌化概念及联邦架构,将特定源分析输出转为工业令牌,以实现跨源推理。给出基于振动诊断输出等的端到端诊断令牌路径,定位工业令牌化为语义接口。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20908 2026-07-24 cs.LG cs.AI 新提交 62%

Multi-turn RL with Structural and Performance Aware Rewards for CUDA Kernel Generation

用于 CUDA 内核生成的具有结构和性能感知奖励的多轮强化学习

Quazi Ishtiaque Mahmud, Nesreen K. Ahmed, Ali Jannesari

机构 * Iowa State University(爱荷华州立大学) Cisco AI Research(思科人工智能研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对 CUDA 内核生成,提出 CudaPerf 框架,结合可验证执行奖励与结构代码感知奖励,分离线排序和在线训练两阶段,利用执行反馈迭代细化,通过实验证明其显著优于基线,在加速和正确性上有大幅提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20709 2026-07-24 cs.AI cs.CL 新提交 62%

NVIDIA-labs OO Agents: Native Python Object-Oriented Agents

NVIDIA实验室的OO智能体:原生Python面向对象智能体

Paul Furgale, Severin Klingler, James Nolan, Matt Staats, Gaia Di Lorenzo, Elisa Martinez Abad, Christian Schüller, Razvan Dinu, Alessio Devoto, Pascal Berard, Gal Kaplun, Elad Sarafian, Riccardo Roveri, Leon Derczynski, Ricardo Silveira Cabral

机构 * NVIDIA-labs(英伟达实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究提出NOOA这一Python框架构建可靠AI智能体,采用智能体即Python对象的编程模型,结合六个面向模型的理念,证明当前模型能有效使用此接口并在相关测试中表现良好,为智能体开发提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20558 2026-07-24 cs.LG cs.AI 新提交 62%

StabilityBench: Benchmarking Instability in LLMs

StabilityBench:评估大语言模型中的不稳定性

Emma Kondrup, Zachary Yang, Anne Imouza, Reihaneh Rabbany

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型实际行为难测、现有评估协议有局限的问题,提出StabilityBench基准测试工具,通过注入现实模拟增强现有基准,应用于四个基准测试评估九个模型,发现性能不稳定,还提出StabilityBench-Mini以实现更现实评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20526 2026-07-24 cs.AI cs.LG stat.ML 新提交 62%

ConfidenceBench: Evaluating Confidence Calibration in Large Language Models

ConfidenceBench:评估大语言模型中的置信度校准

Matthew ffrench-Constant, Daniel Yang, Xinmeng Huang, Sanyam Kapoor

机构 * ETH Zurich(苏黎世联邦理工学院) University of Pennsylvania(宾夕法尼亚大学) New York University(纽约大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型在特定场景下仅靠准确性不足的问题,提出ConfidenceBench校准基准,用Brier分数评估15个前沿LLMs口头置信度,经实验发现模型准确性与校准差异大,证明口头置信度校准是LLM可靠性重要维度,补充了基于准确性的评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19604 2026-07-23 cs.CL cs.LG 新提交 62%

Scaling Laws for Hypernetwork-Based Knowledge Injection in Large Language Models

基于超网络的大语言模型知识注入的缩放定律

Nischay Dhankhar, Dos Baha, Abulhair Saparov

机构 * Nace AI(Nace人工智能公司) Purdue University(普渡大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究大语言模型训练时知识注入问题,核心方法是用超网络生成LoRA适配器,主要贡献是发现超网络注入能力随规模变化规律,能可靠进行分布外泛化,为训练时适应提供新基础及缩放定律。

Comments Preprint, 22 pages, 14 figures. Dataset collection available at https://huggingface.co/collections/nace-ai/hypernetwork-datasets

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19353 2026-07-23 cs.AI cs.LG 新提交 62%

Benchmarking Confidential GPU Inference on NVIDIA H100 under Intel TDX

在英特尔 TDX 下对 NVIDIA H100 上的机密 GPU 推理进行基准测试

Wei Wang, Abdul Hyee Waqas, Burns Smith

机构 * Mozilla

专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究在英特尔 TDX 下 NVIDIA H100 GPU 上,比较标准与机密计算模式对语言模型推理的影响。通过两个模型实验,测量多项指标,发现机密模式会使首次令牌时间增加、全局令牌吞吐量下降,较大模型更早饱和,为容量规划提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28282 2026-07-23 cs.LG cs.AI cs.DC 版本更新 62%

Pre-Deployment Complexity Estimation for Federated Perception Systems

联邦感知系统部署前复杂度估计

KMA Solaiman, Shafkat Islam, Ruy de Oliveira, Bharat Bhargava

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) Purdue University Northwest(普渡大学西北校区) Purdue University(普渡大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种无需分类器的预部署框架,用于估计联邦学习在分布式环境中的学习复杂度,通过联合建模数据固有属性和环境特征,实验表明该指标与联邦学习性能及通信成本密切相关。

Comments Accepted and presented at Edge AI Research Symposium 2026 (EdgeAI2026), San Diego, CA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19219 2026-07-22 cs.CL cs.AI 新提交 62%

Beyond Score Prediction: LLM-Based Essay Scoring and Feedback Generation via Reinforcement Learning with Rubric Rewards

超越分数预测:基于强化学习和评分标准奖励的基于大语言模型的作文评分与反馈生成

Xuefeng Jin, Jiashuo Zhang, Teng Cao, Bin Yang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究基于大语言模型的作文评分与反馈生成,提出RLAES框架,通过强化学习联合优化。引入RFE评估框架,提出AGFO和ACR方法。实验表明RFE能捕捉一致性,RLAES-AGFO在评分性能上最佳,保持反馈质量同时避免反馈退化。

Comments 12 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19096 2026-07-22 cs.AI cs.CL 新提交 62%

Supra Cognitive Modes: A Routed Architecture for Agent Memory

超认知模式:一种用于智能体记忆的路由架构

Joshua Tobkin, David Yang

机构 * Supra Research(超研)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究智能体记忆工作负载,提出超认知模式(SCM)架构,通过共享摄取底层及相关机制处理查询,在三个基准上进行表征,给出参考运行成绩等,展示了一种路由配置及故障模式,验证了相关设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19011 2026-07-22 cs.CL cs.AI cs.MM 新提交 62%

Computational Humor with Multimodal LLMs: Methods, Datasets, Evaluation, and Challenges

基于多模态语言模型的计算幽默:方法、数据集、评估及挑战

Tuo Liang, Zhe Hu, Disheng Liu, Jing Li, Yu Yin

机构 * Case Western Reserve University(凯斯西储大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究聚焦于单图像和多面板作品中的视觉幽默理解,通过与先前综述对比,按能力层次组织文献,综合基准设计等内容,追溯领域转变,指出进展的主要障碍包括易出现捷径的评估、文化覆盖有限等问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18360 2026-07-22 cs.CR cs.AI cs.LG 新提交 62%

HALLMARK: Diagnosing Three Failure Modes in LLM Citation Verifiers

HALLMARK:诊断大语言模型引用验证器中的三种失败模式

Patrik Reizinger, Wieland Brendel

专题命中 推理评测 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型引用验证器的失败模式,通过HALLMARK基准测试评估多种验证器,发现误报率决定验证器是否可部署,并具体指出三种失败模式,强调误报率是部署瓶颈,未检测到的伪造对科学记录代价更高。

Comments 59 pages, 7 figures, 40 tables. Benchmark and code: https://github.com/rpatrik96/hallmark (v1.2.0); verification tool: https://github.com/rpatrik96/bibtexupdater (v1.5.0)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18228 2026-07-21 cs.AI cs.CL 新提交 62%

Logical Judgments Under Pressure: Diagnosing Syllogistic Stability with Learned Soft Prefixes

压力下的逻辑判断:用学习到的软前缀诊断三段论稳定性

Brian K Chen

机构 * National University of Singapore(新加坡国立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究在三段论推理基准前加软前缀,探究学习到的上下文压力对模型逻辑判断的影响,发现软前缀能改变正确答案,在多模型测试中效果优于随机对照,主要影响是答案偏好,不同模型有显著差异。

Comments 41 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏