arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10530 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10530 篇

2606.06217 2026-06-05 cs.CV cs.AI 70%

DisasterBench: A Multimodal Benchmark for UAV-Based Disaster Response in Complex Environments

DisasterBench: 复杂环境中基于无人机灾害响应的多模态基准

Tan Zhang, Quanyou Li, Lu Zhang, Jun Liu, Xiaofeng Zhu, Ping Hu

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出DisasterBench多模态基准,涵盖14种灾害场景和9个响应任务,并设计轻量级模型DisasterVL通过三阶段优化在边缘设备上实现高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03284 2026-06-03 cs.CL 70%

SEA-NLI: Natural Language Inference as a Lens into Southeast Asian Cultural Understanding

SEA-NLI:将自然语言推理作为理解东南亚文化的透镜

Peerawat Chomphooyod, Jian Gang Ngui, Yosephine Susanto, Attapol T. Rutherford, Alham Fikri Aji, Sarana Nutanong, Can Udomcharoenchaikit, Peerat Limkonchotiwat

专题命中 推理评测 :reasoning(abstract);CoT(abstract);分类 cs.CL

AI总结 提出SEA-NLI基准,通过自然语言推理评估模型对东南亚文化的理解,发现现有模型表现不佳,文化适应和提示可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25902 2026-06-03 cs.LG 70%

Reading the Finetuning Prior: Verbatim Content Recovery via Contrastive Decoding Diffing

读取微调先验:通过对比解码差异进行逐字内容恢复

Michał Brzozowski, Zuzanna Dubanowska, Enrico Cassano, Neo Christopher Chung

机构 * Samsung AI Center(三星人工智能中心) University of Turin(都灵大学) University of Warsaw(华沙大学)

专题命中 推理评测 :CoT(abstract,abstract_cn);分类 cs.LG

AI总结 提出对比解码差异(CDD)方法,仅基于输出层logit分布,无需权重或内部访问,即可从微调模型中逐字恢复植入事实,并在多种架构和场景下优于白盒方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00931 2026-06-02 cs.CV cs.AI 70%

CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences

CV-Arena: 面向教学计算机视觉问题求解的开放基准与人类-AI协作偏好

Fangzhou Lin, Peiran Li, Lingyu Xu, Wenjing Chen, Qianwen Ge, Shuo Xing, Mingyang Wu, Xiangbo Gao, Siyuan Yang, Kazunori Yamada, Ziming Zhang, Haichong Zhang, Zhen Dong, Ming-Hsuan Yang, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯A&M大学) Worcester Polytechnic Institute(沃斯特理工大学) Tohoku University(东北大学) Georgia Institute of Technology(佐治亚理工学院) NVIDIA(英伟达) UCSB(加州大学圣塔芭芭拉分校) UC Merced(加州大学默塞德分校)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出CV-Arena基准,包含12K高分辨率真实图像指令对,覆盖16种任务类型,并采用Active Elo协议结合人类与AI偏好评估21个系统,揭示指令遵循、物理推理等方面的差距,同时开发CV-Agent代理模型展示闭环推理的潜力。

Comments 26 pages, 7 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00986 2026-06-02 cs.CL 70%

ADRA-Bank: A Modular Benchmark for Academic Deep Research Agents

ADRA-Bank:面向学术深度研究智能体的模块化基准

Zhihan Guo, Feiyang Xu, Yifan Li, Muzhi Li, Shuai Zou, Jiele Wu, Han Shi, Haoli Bai, Ho-fung Leung, Irwin King

机构 * The Chinese University of Hong Kong, Hong Kong SAR, China(香港中文大学) Hong Kong Polytechnic University, Hong Kong SAR, China(香港理工大学) National University of Singapore, Singapore, Singapore(新加坡国立大学) Huawei Technologies, Hong Kong SAR, China(华为技术有限公司) Independent(独立)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 针对现有基准侧重检索而忽视规划与推理、且缺乏学术领域覆盖的问题,提出ADRA-Bank模块化基准,包含10个学术领域的200个人工标注实例,并设计ADRA-Eval评估范式,通过端到端和隔离评估两种模式测试规划、检索和推理能力,揭示智能体在跨源检索和跨领域一致性上的不足,并指出提升高层规划能力是释放基础LLM推理潜力的关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30802 2026-06-01 cs.MA cs.AI 70%

Design and Evaluation of Multi-Agent AI Oracle Systems for Prediction Market Resolution

用于预测市场决议的多智能体AI预言机系统的设计与评估

Tarun Kota

机构 * Yale University(耶鲁大学)

专题命中 推理评测 :reasoning(abstract);self-correction(abstract);分类 cs.AI

AI总结 本研究设计并评估了多智能体LLM架构作为预测市场决议的预言机,通过独立聚合与协商共识两种机制,在KalshiBench数据集上对比单模型基线,发现置信度加权投票的独立聚合达到83.43%准确率,而协商共识因错误传播性能下降,并提出了混合AI-人类预言机的路由标准。

Comments 34 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30358 2026-06-01 cs.LG quant-ph 70%

QASM-Eval: A Dataset to Train and Evaluate LLMs on OpenQASM-3 Beyond Quantum Circuits

QASM-Eval:用于训练和评估LLM在超越量子电路的OpenQASM-3上的数据集

Zhenxiao Fu, Lei Jiang, Fan Chen

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 推理评测 :reasoning(abstract);verifier(abstract);分类 cs.LG

AI总结 针对LLM在OpenQASM-3硬件级编程上的训练与评估空白,构建了包含专家验证测试集和训练集的数据集,覆盖经典逻辑、时序调度、脉冲控制等,并通过扩展验证器自动验证,实验表明微调后LLM性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00349 2026-06-01 cs.AI 70%

Debate with Images: Detecting Deceptive Behaviors in Multimodal Large Language Models

图像辩论:检测多模态大语言模型中的欺骗行为

Sitong Fang, Shiyi Hou, Kaile Wang, Boyuan Chen, Donghai Hong, Jiayi Zhou, Josef Dai, Yaodong Yang, Jiaming Ji

机构 * Institute of Artificial Intelligence, Peking University(北京大学人工智能研究院)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出 MM-DeceptionBench 基准和基于图像辩论的多智能体监控框架,系统揭示并量化多模态大语言模型中的欺骗风险,有效提升欺骗行为检测能力。

Comments 39 pages, 16 figures, camera ready version for ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29800 2026-05-29 cs.CL 70%

Nine Judges, Two Effective Votes: Correlated Errors Undermine LLM Evaluation Panels

九位评委,两张有效选票:相关错误削弱了LLM评估小组

Guneet Kohli

机构 * Apple(苹果公司)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文通过分析9个前沿LLM在自然语言推理任务上的投票行为,发现由于模型间存在高度相关的错误,评估小组的有效信息仅相当于约2个独立投票,实际准确率比独立投票理想情况低8-22个百分点,且增加评委或改进聚合算法均无法弥补这一差距。

Comments 14 pages, 5 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29585 2026-05-29 cs.CL 70%

World Models in Words: Auditing Physical State-Transition Commitments in Vision-Language Models

语言中的世界模型:审计视觉语言模型中的物理状态转换承诺

Emmanuelle Bourigault

机构 * University of Oxford(牛津大学)

专题命中 推理评测 :reasoning(abstract);verifier(abstract);分类 cs.CL

AI总结 提出WMW框架,通过要求VLM输出结构化轨迹(初始状态、状态转换、结果状态和答案)并利用混合验证器检查模式有效性、状态基础、转换一致性和答案-轨迹兼容性,揭示仅评估最终答案所隐藏的物理推理失败。

Comments 8 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11723 2026-05-29 cs.CV cs.AI 70%

CaC: Advancing Video Reward Models via Hierarchical Spatiotemporal Concentrating

CaC:通过分层时空聚焦推进视频奖励模型

Jiyuan Wang, Huan Ouyang, Jiuzhou Lin, Chunyu Lin, Dewen Fan, Boheng Zhang, Haonan Fan, Fei Zuo, Jia Sun, Huaiqing Wang, Honglie Wang, Yiyang Fan, Zhenlong Yuan, Zijun Li, Yongrui Heng, Guosheng Lin, Fan Yang, Tingting Gao

机构 * BJTU(北京工业大学) NTU(国立台湾大学) BUPT(北京邮电大学) Kuaishou Technology(快手科技)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出基于视觉语言模型的粗到细异常奖励模型CaC,通过全局时间扫描、局部空间定位和结构化时空思维链推理,结合大规模生成视频异常数据集和三阶段渐进训练,显著提升细粒度异常检测精度并减少生成视频异常。

Comments 27 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28369 2026-05-28 cs.AI cs.SI 70%

CyberJurors: A Multi-Agent Simulation Task for E-Commerce Disputes Verdict

CyberJurors:电商纠纷裁决的多智能体模拟任务

Yanhui Sun, Wu Liu, Haifeng Ming, Xinru Wang, Hantao Yao, Yongdong Zhang

机构 * School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 针对电商纠纷裁决需要从冗余多轮多模态证据中提取关键线索并依据平台特定惯例决策的问题,提出多智能体框架CyberJurors,通过个体裁决链式思维和集体陪审共识裁决提升裁决质量,在包含6000真实案例的基准上超越现有方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28313 2026-05-28 cs.CL 70%

Argument Quality Assessment with Large Language Models: A Pairwise Bradley-Terry Approach

基于大语言模型的论证质量评估:一种成对Bradley-Terry方法

Nicolás Benjamín Ocampo, Agnes Paullate Nyiranziza, Davide Ceolin

机构 * Centrum Wiskunde & Informatica, The Netherlands(荷兰代尔夫特理工大学) Vrije Universiteit Amsterdam, The Netherlands(荷兰阿姆斯特丹自由大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本研究利用12种开源大语言模型,通过成对比较和Bradley-Terry模型评估论证质量,发现Llama-70B与人类专家判断具有中等一致性(Cohen's κ=0.493),其他模型表现各异但互补。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27210 2026-05-27 quant-ph cs.AI 70%

Qiskit QuantumKatas: Adapting Microsoft's Quantum Computing exercises for LLM evaluation

Qiskit QuantumKatas: 为LLM评估改编微软的量子计算练习

Juan Cruz-Benito, Ismael Faro

机构 * IBM Research(IBM研究院)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文将微软的QuantumKatas量子计算课程从Q#移植到Qiskit,并构建评估框架,用于系统评估大型语言模型在量子计算任务上的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14702 2026-05-27 cs.AI cs.CV cs.RO 70%

Drive-P2D: A Progressive Perception-to-Decision Benchmark for VLMs in Autonomous Driving

Drive-P2D:自动驾驶中视觉语言模型的渐进式感知到决策基准

Zecong Tang, Zixu Wang, Yifei Wang, Weitong Lian, Tianjian Gao, Haoran Li, Tengju Ru, Lingyi Meng, Zhejun Cui, Yichen Zhu, Qi Kang, Kaixuan Wang, Yu Zhang

机构 * Zhejiang University(浙江大学) The University of Hong Kong(香港大学)

专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 提出Drive-P2D基准,通过分离推理与答案的协议,在目标、场景和决策三个层级上评估视觉语言模型的感知到决策能力,并分析错误模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25052 2026-05-26 cs.CL 70%

Faithfulness Metrics Don't Measure Faithfulness: A Meta-Evaluation with Ground Truth

忠实性指标并不衡量忠实性:基于真实标签的元评估

Yoav Gur-Arieh, Ana Marasović, Mor Geva

机构 * Tel Aviv University(特拉维夫大学) University of Utah(犹他大学)

专题命中 推理评测 :CoT(abstract,abstract_cn);分类 cs.CL

AI总结 针对思维链忠实性度量缺乏真实标签验证的问题,构建了包含真实忠实性标签的数据集BonaFide,系统评估现有指标,发现多数指标表现接近随机、存在偏差且计算成本高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15777 2026-05-26 cs.AI 70%

SaaS-Bench: Can Computer-Use Agents Leverage Real-World SaaS to Solve Professional Workflows?

SaaS-Bench:计算机使用代理能否利用真实世界SaaS解决专业工作流程?

Kean Shi, Zihang Li, Tianyi Ma, Zengji Tu, Jialong Wu, Xinbo Xu, Qingyao Yang, Ruoyu Wu, Weichu Xie, Ming Wu, Jason Zeng, Michael Heinrich, Elvis Zhang, Liang Chen, Kuan Li, Baobao Chang

机构 * UniPat AI PKU(北京大学) HKU(香港大学) G Labs(0G实验室) Pipeline Lab(Pipeline实验室)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出SaaS-Bench基准,包含23个可部署SaaS系统和106个真实工作场景任务,评估计算机使用代理在长期规划、跨应用协调等能力上的表现,发现最强模型端到端任务完成率不足4%。

Comments 24 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24069 2026-05-26 cs.CR cs.AI 70%

When the Manual Lies: A Realistic Benchmark to Evaluate MCP Poisoning Attacks for LLM Agents

当手册撒谎:评估LLM智能体MCP投毒攻击的现实基准

Shi Liu, Xuehai Tang, Xikang Yang, Liang Lin, Biyu Zhou, Wenjie Xiao, Wantao Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学网络安全学院)

专题命中 推理评测 :planning(abstract);self-correction(abstract);分类 cs.AI

AI总结 针对LLM智能体通过模型上下文协议(MCP)集成外部工具时面临的工具描述投毒(TDP)攻击,提出MCP-TDP安全基准,包含32个真实测试用例,评估8种主流LLM发现严重漏洞,并提出反应性自我纠正防御机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23271 2026-05-25 cs.CV cs.AI 70%

EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video Generation

EvalVerse:面向专业电影级视频生成的流水线感知与专家校准基准测试

Songlin Yang, Haobin Zhong, Ruilin Zhang, Xiaotong Zhao, Shuai Li, Kai Zheng, Xuyi Yang, Zhe Wang, Zhenchen Tang, Yang Li, Bohai Gu, Zhengwei Peng, Yidan Huang, Mengzhou Luo, Yihang Bo, Dalu Feng, Yujia Zhang, Juntao Ma, Ruiqi Wang, Lvmin Zhang, Yuwei Guo, Frank Guan, Maneesh Agrawala, Hongbo Fu, Alan Zhao, Anyi Rao

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Tencent(腾讯) Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Film Academy(北京电影学院) Stanford University(斯坦福大学) The Chinese University of Hong Kong(香港中文大学) Singapore Institute of Technology(新加坡理工学院)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出EvalVerse框架,通过将电影制作专业知识系统化为评估分类法、构建专家标注数据集并微调视觉语言模型进行链式推理,解决了现有基准忽视电影质量、缺乏领域特异性指标的问题,实现了对生成视频“正确性”与“优良性”的全面评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16077 2026-05-22 cs.LG 70%

MDM-Prime-v2: Binary Encoding and Index Shuffling Enable Scaling of Diffusion Language Models

MDM-Prime-v2:二进制编码和索引洗牌使扩散语言模型能够扩展

Chen-Hao Chao, Wei-Fang Sun, Junwei Quan, Chun-Yi Lee, Rahul G. Krishnan

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) NVIDIA AI Technology Center(NVIDIA AI技术中心) National Taiwan University(国立台湾大学)

专题命中 推理评测 :reasoning(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出MDM-Prime-v2,通过二进制编码和索引洗牌技术改进扩散语言模型,解决了子分词器功能形式与BPE分词器结合导致的交叉熵损失增加以及子分词器粒度超参数选择缺乏工具的问题,从而提升了模型在常识推理基准上的零样本准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14102 2026-05-20 cs.AI 70%

ChromaFlow: A Negative Ablation Study of Orchestration Overhead in Tool-Augmented Agent Evaluation

ChromaFlow: 一种关于在工具增强代理评估中编排开销的负消融研究

Tarun Mittal

机构 * Octave-X

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 该研究通过ChromaFlow框架分析了在工具增强自主推理中编排开销的影响,发现更激进的编排并未提升整体性能,反而增加了操作噪声,并强调了编排升级、确定性提取、证据协调、提供者健康门控和显式运行门控等作为可靠自主代理评估的第一要求。

Comments 12 pages, 6 tables, 1 figure. Updated with follow-up strict-provider full-Level-1 diagnostic

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18825 2026-05-20 cs.LG cs.DC 70%

Not All Tokens Are Worth Caching: Learning Semantic-Aware Eviction for LLM Prefix Caches

并非所有标记都值得缓存:学习语义感知的淘汰策略用于LLM前缀缓存

Shaoke Fang, Ziang Li, Wenfei Wu, Jiatong Ji, Qingsong Liu, Ruizhi Pu

机构 * Peking University(北京大学) FirestAI Tsinghua University(清华大学) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) Southeast University(东南大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 本文提出了一种语义感知的前缀缓存淘汰策略SAECache,通过多队列架构、语义感知的标记加权机制和全适应的在线学习方案,提高了LLM服务中前缀缓存的效率,从而在不同工作负载下实现了显著的TTFT提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14504 2026-05-19 cs.AI 70%

When Robots Do the Chores: A Benchmark and Agent for Long-Horizon Household Task Execution

当机器人做家务:一个基准和代理用于长期家庭任务执行

Zilin Zhu, Longteng Guo, Yanghong Mei, Bowen Pang, Zongxun Zhang, Xingjian He, Ruyi Ji, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhongguancun Academy(中关村学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出LongAct基准和HoloMind代理,用于评估长期家庭任务执行中的高层自主能力,实验显示HoloMind在减少模型规模依赖的同时提升了长期性能,但目标完成率仍较低,凸显了长期规划的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15635 2026-05-18 cs.CL 70%

Evaluating Chinese Ambiguity Understanding in Large Language Models

评估大型语言模型中的中文歧义理解

Junwen Mo, Yuanzhi Lu, Yifang Xue, Ke Xu, Hideki Nakayama

机构 * Graduate School of Information Science and Technology, The University of Tokyo(东京大学信息科学与技术研究生院) School of Software Engineering, South China University of Technology(华南理工大学软件学院)

专题命中 推理评测 :CoT(abstract,abstract_cn);分类 cs.CL

AI总结 本文设计了首个基于潜在歧义理论的中文歧义数据集CHA-Gen,评估了LLM在歧义检测中的表现,揭示了模型在歧义识别中的常见失败模式及语义不确定性量化结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15333 2026-05-18 cs.AI 70%

Zero-Shot Goal Recognition with Large Language Models

基于大语言模型的零样本目标识别

Kin Max Piamolini Gusmão, Nathan Gavenski, Nir Oren, Felipe Meneguzzi

机构 * PUCRS Porto Alegre(圣路易斯-波尔图阿legre大学) King’s College London(伦敦国王学院) University of Aberdeen(阿伯丁大学) PUCRS(圣路易斯-波尔图阿legre大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文首次系统评估前沿大语言模型在经典PDDL基准上的零样本目标识别能力,发现其表现不均,部分模型随证据增加而提升精度,而另一些模型则依赖世界知识先验。

Comments 9 pages, 1 figure, 1 table; appendix with 8 figures and 2 code listings (29 pages total); submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15215 2026-05-18 cs.AI cs.SE 70%

SkillSmith: Compiling Agent Skills into Boundary-Guided Runtime Interfaces

SkillSmith:将技能编译为边界引导的运行时接口

Duling Xu, Zheng Chen, Zaifeng Pan, Jiawei Guan, Dong Dong, Jialin Li, Bangzheng Pu

机构 * AetherHeart Tech Co., Ltd.(AetherHeart科技有限公司) Renmin University of China(中国人民大学) University of California San Diego(加州大学圣地亚哥分校)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 SkillSmith通过将技能包编译为最小执行接口,减少运行时冗余,提升效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06139 2026-05-13 cs.CL 70%

GRP: Goal-Reversed Prompting for Zero-Shot Evaluation with LLMs

GRP:基于大语言模型的零样本评估中的目标反转提示

Mingyang Song, Mao Zheng, Xuan Luo

机构 * Tencent(腾讯)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出GRP方法,通过要求模型选择更差的答案来反转传统评估目标,从而提升判断准确性,实验表明其在多个基准测试中表现优异。

Comments Ongoing Work

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22944 2026-05-11 cs.CR cs.AI 70%

Is Your Prompt Poisoning Code? Defect Induction Rates and Security Mitigation Strategies

你的提示污染代码了吗?缺陷诱导率与安全缓解策略

Bin Wang, YiLu Zhong, MiDi Wan, WenJie Yu, YuanBing Ouyang, Yenan Huang, Hui Li

机构 * Organization(机构)

专题命中 推理评测 :chain-of-thought(abstract);self-correction(abstract);分类 cs.AI

AI总结 研究探讨了低质量提示对生成代码安全性的负面影响,提出评估框架和基准数据集,并展示高级提示技术可缓解安全风险。

Comments Accepted for publication in Empirical Software Engineering (EMSE) Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07268 2026-05-11 cs.CL 70%

From 0-Order Selection to 2-Order Judgment: Combinatorial Hardening Exposes Compositional Failures in Frontier LLMs

从零阶选择到二阶判断:组合硬化揭示前沿大语言模型的组成性失败

Hanmeng Liu, Shichao Weng, Xiulai Liu, Zhicai Zhang, Anli Yan, Xiaozhang Liu

机构 * Hainan University(海南大学) Fudan University(复旦大学)

专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL

AI总结 本文提出LogiHard框架,通过确定性转换零阶选择为二阶逻辑判断,显著增加推理难度,验证了大语言模型在组合硬化任务中的表现下降,揭示了训练诱导的完整性验证缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07123 2026-05-11 cs.LG 70%

Convergence and Emergence of In-Context Reinforcement Learning with Chain of Thought

基于思维链的上下文强化学习的收敛与涌现

Zixuan Xie, Xinyu Liu, Rohan Chandra, Shangtong Zhang

机构 * University of Virginia(弗吉尼亚大学)

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.LG

AI总结 本文探讨了思维链如何增强上下文强化学习的能力,通过线性Transformer分析证明思维链生成等同于时间差分学习更新,并展示策略评估误差随思维链长度减少而收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏