arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-09-01 至 2026-09-01 共收录 368 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 122 篇

2608.30910 2026-09-01 cs.LG cs.CL 新提交 62%

S3C-LLM: Skill-Code Guided Agentic Language Models for Spectrum-to-Structure Elucidation

S3C-LLM:用于谱图到结构解析的技能-代码引导型智能体语言模型

Xuanle Zhao, Xinyuan Cai, Xiang Cheng, Bo Xu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 S3C-LLM是一种技能-代码引导型智能体LLM,通过检索光谱学技能、执行分析代码整合证据与约束来解析分子结构,性能优于同类模型且训练语料更少。

Comments Accepted by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30653 2026-09-01 cs.CV cs.AI cs.LG 新提交 62%

Fine-Grained Multi Image Object Hallucination Benchmark

细粒度多图像物体幻觉基准测试

Joonki Min, Chaeyun Kim, Hyungwook Choi, Yejin Kim, Kihyun Kim, Yohan Jo, Joonseok Lee

机构 * Seoul National University(首尔大学) AIM Intelligence(AIM智能公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对多模态大语言模型的物体幻觉问题,推出细粒度多图像物体幻觉基准测试MIOH,评估29个模型后发现顶尖模型仍存在明显失败模式,为开发可靠多模态AI提供关键评估工具。

Comments Accepted at CVPR 2026

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 18295-18305

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30517 2026-09-01 cs.AI cs.CL 新提交 62%

ScienceArena: Benchmarking LLMs on Latest Scientific Olympiad Competitions

ScienceArena:在最新科学奥林匹克竞赛上对大语言模型(LLM)进行基准测试

Guangxiang Zhao, Qilong Shi, Xusen Xiao, Wenpu Liu, Yaoming Li, Linfeng Hao, Shuyang Hou, Zijian Guo, Xinrui Zhang, Yuntian Zhao, Zhengyang Wang, Wenrui Liu, Yuhan Wu, Tong Yang, Lin Sun, Xiangzheng Zhang

机构 * Qiyuan Tech(奇安信科技) Tsinghua University(清华大学) The University of Hong Kong(香港大学) Peking University(北京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究推出ScienceArena基准,涵盖多类科学竞赛,经专家审核构建并校准LLM评判者,评估14个LLM发现顶尖模型获奖牌级分数,化学与长程一致性仍为瓶颈。

Comments 18 pages, EMNLP 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30475 2026-09-01 cs.CL cs.AI 新提交 62%

ImageEval 2026: Culturally Grounded Arabic Multimodal Evaluation

ImageEval 2026:基于文化语境的阿拉伯语多模态评估

Samir Abdaljalil, Hunzalah Hassan Bhatti, Ahlam Bashiti, Farina Amir, Md Arid Hasan, Basel Mousi, Nadir Durrani, Fahim Dalvi, Zien Sheikh Ali, Erchin Serpedin, Hasan Kurban, Mustafa Jarrar, Shammur Absar Chowdhury, Firoj Alam

机构 * Texas A&M University(德克萨斯农工大学) Qatar Computing Research Institute(卡塔尔计算研究所) Birzeit University(比尔宰特大学) Hamad Bin Khalifa University(哈马德·本·哈利法大学) University of Toronto(多伦多大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 ImageEval 2026共享任务含AynVQA和CRAI-Bench两项阿拉伯语多模态评估任务,14支团队参与,相关资源已发布,凸显文化语境多模态评估的挑战。

Comments Arabic LLMs, Multilingual, Multimodal, Shared Task

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30429 2026-09-01 cs.AI cs.CL 新提交 62%

EvoSkill Injection: Red-Teaming Autonomous Skill Generation and Evolution in Self-Evolving Agents

EvoSkill注入:针对自进化智能体中自主技能生成与进化的红队测试

Doyun Kim, Chanwoo Kim, Sugyeong Eo, Yeo-Chan Yoon, Chanjun Park

机构 * Soongsil University(崇实大学) Yonsei University(延世大学) Jeju National University(济州国立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文定义了针对自进化智能体自主技能进化流程的EvoSkill注入威胁模型,提出SARGE红队测试框架,构建相关基准并验证其可诱导恶意技能形成与持久激活,凸显能力损坏风险。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30386 2026-09-01 cs.LG cs.AI 新提交 62%

DASC: Decay-Aware State Compression for Hybrid Linear-Attention Serving

DASC:面向混合线性注意力服务的感知衰减状态压缩

Yanqi Yu, Pingwei Sun, Jianchao Tan, Tao Zhang, Yuchen Xie, Xunliang Cai, Yao Liu

机构 * East China Normal University(华东师范大学) Meituan(美团) South China University of Technology(华南理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对混合线性注意力服务的缓存管理问题,提出DASC方法,通过感知衰减压缩状态检查点,在保持接近全缓存质量的同时,降低内存占用并提升推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29996 2026-09-01 cs.CV cs.AI cs.LG 新提交 62%

Partition-Aware Unlearning for Removing Spurious Correlations in Large Vision-Language Models

用于移除大型视觉语言模型中虚假关联的感知分区式遗忘

Aditi Sarker, Nazreen Shah, Rafi Ibn Sultan, Rhongho Jang, Dongxiao Zhu, Prashant Khanduri

机构 * Wayne State University(韦恩州立大学) IIIT Delhi(德里印度信息技术学院) Institute for AI and Data Science (AIDaS), Wayne State University(韦恩州立大学人工智能与数据科学研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出PURGE框架,通过结构化数据集构建和感知分区式遗忘,减少大型视觉语言模型的虚假关联诱导错误,同时保持或提升整体性能。

Comments 35 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29971 2026-09-01 cs.AI cs.LG 新提交 62%

EDGE: Engine for Deterministic Graph Evaluation through Conversation Simulation from Graph Structured DSL Configuration

EDGE:基于图结构DSL配置的对话模拟实现确定性图评估的引擎

Ram Kulathumani, Regunathan Radhakrishnan, Anupam Tripathi, Xiangbo Mao, Roshanak Omrani, Keshav Somani, Shwet Kamal Mishra, Shayna Lurya

机构 * Salesforce

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 EDGE基于AgentGraph等框架,通过图遍历生成对话路径评估集,定义新指标量化智能体确定性,证实带受控节点转换的智能体确定性更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29899 2026-09-01 cs.CL cs.AI cs.IR 新提交 62%

REIGN: Refurbished Embeddings with Integrated Guidance Networks for Efficient Context-Length Scaling

REIGN:采用集成引导网络的翻新嵌入用于高效上下文长度扩展

Devrim Çavuşoğlu, Emre Akbaş

机构 * Middle East Technical University(中东科技大学) OBSS AI

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出REIGN模型,通过解耦处理与缓存嵌入降低训练成本,在多场景长文档检索中以更小参数规模达到与更大模型相当的性能

Comments Accepted to Findings of EMNLP 2026. URL: https://devrimcavusoglu.github.io/reign/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29617 2026-09-01 cs.CL cs.AI 新提交 62%

Memory-First Fact-Checking: A Knowledge-Graph-Grounded Multi-Agent System for Misinformation Detection

优先记忆的事实核查:一种基于知识图谱的多智能体虚假信息检测系统

Amelia Petrenciuc, Alexandru Lecu, Adrian Groza

机构 * Technical University of Cluj-Napoca(克卢日-纳波卡技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出一种基于知识图谱与对抗多智能体的优先记忆式虚假信息检测框架,在COVID-19虚假信息基准上准确率达97.4%,优于Llama 3.3 70B基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29596 2026-09-01 cs.AI cs.LG cs.MA 新提交 62%

Towards a Systems Foundation for Agentic Skills: Architecture, Lifecycle, and Security

面向智能体技能的系统基础:架构、生命周期与安全性

Sanket Badhe, Deep Shah, Priyanka Tiwari, Nehal Kathrotia

机构 * Google LLC(谷歌有限责任公司) Purdue University(普渡大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文为智能体技能生态建立统一系统基础与参考架构,界定其九阶段生命周期,探讨安全威胁与防御机制,分类多领域系统实现,确立智能体技能为自主语言智能体的基础范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29588 2026-09-01 cs.AI cs.CL 新提交 62%

Call Neighbours Yourself: Graph Walks with Destination-Conditioned On-Policy Self-Distillation

自行调用邻居:带目标条件的同策略自蒸馏图游走

Yilun Liu, Boyu Luo, Yanran Tang, Ruihong Qiu, Zi Huang

机构 * School of Electrical Engineering and Computer Science(电气工程与计算机科学学院) The University of Queensland(昆士兰大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对文本属性图推理中邻居固定的问题,提出CNY框架,结合目标条件同策略自蒸馏,使LLMs主动探索邻居,在基准实验中表现优于基线且策略可迁移。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29582 2026-09-01 cs.CL cs.AI 新提交 62%

SUP-MIMIC: A Multi-Task Clinical Diagnosis Benchmark for Evaluating LLMs' Robustness to Contradictory Evidence

SUP-MIMIC:用于评估大型语言模型对矛盾证据鲁棒性的多任务临床诊断基准

Yi Yu, Bo Wang, Chong Feng, Ge Shi, Xia Liu, Ziyi Yang, Xuewen Shi

机构 * Beijing University of Technology(北京工业大学) Beijing Institute of Technology(北京理工大学) China-Japan Friendship Hospital(中日友好医院) Dongbei University of Finance and Economics(东北财经大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出多任务临床诊断基准SUP-MIMIC,评估发现当前先进LLMs在诊断分歧与聚合任务上性能大幅下降,存在漏诊风险,为提升医疗场景下LLMs安全性提供了方法与路线图。

Comments 18 pages, 13 figures, 3 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29035 2026-09-01 cs.AI cs.CL 新提交 62%

EmoLASP: Emotion Recognition with Language Models and Answer Set Programming

EmoLASP:结合语言模型与回答集编程的情感识别框架

Thao Le, Michael Thielscher

机构 * School of Computer Science and Engineering, University of New South Wales(新南威尔士大学计算机科学与工程学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 EmoLASP结合语言模型与回答集编程,在IEMOCAP数据集上提升了情感预测性能,尤其对无微调的仅提示式大语言模型效果显著,可降低相关成本并保证预测一致性。

Comments 13 pages. Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28649 2026-09-01 cs.CL cs.AI cs.IR 新提交 62%

Can Large Language Models Identify Meaningful Touchpoints in Conversion Attribution?

大型语言模型能否识别转化归因中有意义的接触点?

Jinqi Wu, Sishuo Chen, Zhangming Chan, Yong Bai, Chao Yi, Han Zhu, Shuodian Yu, Lei Zhang, Sheng Chen, Chenghuan Hou, Jian Xu, Chaoyou Fu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) Taobao & Tmall Group of Alibaba(阿里巴巴淘宝天猫集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对转化归因接触点选择的语义差距问题,评估LLMs识别隐藏关联的能力,分析提示策略与模型选择的影响,还将LLM归因标签用于提升CVR模型性能。

Comments 6 pages, 4 figures, 3 tables; accepted as a short paper at CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10829 2026-09-01 cs.CL cs.AI 版本更新 62%

Attention-Discounted Adaptive Sampler for Masked Diffusion Language Models

注意力折扣自适应采样器用于掩码扩散语言模型

Yusuf Sahin, Ahmed Rockey Saikia, Volkan Cevher, Paolo Favaro

机构 * University of Bern(伯尔尼大学) EPFL(瑞士联邦理工学院洛桑分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对掩码扩散语言模型并行解码中候选词交互导致的不安全问题,提出训练无关的重排序规则ADAS,通过注意力折扣软惩罚改进子集构建,在多个基准上提升低NFE性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08000 2026-09-01 cs.CL cs.AI 版本更新 62%

Summarization is Not Dead Yet

摘要生成尚未消亡

Dongqi Liu, Chenxi Whitehouse, Zheng Zhao, Zhuchen Cao, Jian Li, Yabiao Wang

机构 * Saarland University(萨尔大学) Max Planck Institute for Informatics(马克斯·普朗克信息学研究所) University of Cambridge(剑桥大学) University of Edinburgh(爱丁堡大学) Zhejiang University(浙江大学) Tencent YouTu Lab(腾讯优图实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 通过多维度评估,发现人类参考摘要在信息量和忠实度上仍优于大语言模型,后者仅在表面连贯性和流畅性上占优,表明摘要生成研究仍有挑战。

Comments EMNLP 2026 Main & Long Conference Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06526 2026-09-01 cs.AI cs.LG 版本更新 62%

CrowdMath: A Dataset of Crowdsourced Mathematical Research Discussions

CrowdMath: 众包数学研究讨论数据集

Sherin Muckatira, Jesse Geneson, Slava Gerovitch, Pavel Etingof, Mikhail Gronas, Anna Rumshisky

机构 * University of Massachusetts Lowell(马萨诸塞大学洛文分校) San Jose State University(圣何塞州立大学) Massachusetts Institute of Technology(麻省理工学院) Dartmouth College(达特茅斯学院) Amazon AGI(亚马逊人工智能研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出CrowdMath数据集,包含164条专家标注的进展链,用于评估大语言模型在协作开放问题求解中的能力,发现模型在局部预测上表现良好但在角色分类上存在不足。

Comments 16 pages, 4 figures; Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01456 2026-09-01 cs.LG cs.CL cs.GT 版本更新 62%

Truthful AI Advisors: A Pre-Specified Benchmark for Large Language Model Honesty Under Preference Misalignment

诚实的人工智能顾问:偏好错位下大语言模型诚实性的预设基准

Hamidreza Hasani Balyani, Seyed Pouyan Mousavi Davoudi, Alireza Amiri-Margavi, Amin Gholami Davodi, Arshia Gharagozlou

机构 * Amazon Lab126, HW Tech Org.(亚马逊实验室126,硬件技术组织) Computational Modeling and Simulation University of Pittsburgh(计算建模与仿真大学匹兹堡分校) Mathematics & Statistics Department University of Minnesota Duluth(数学与统计学系明尼苏达大学 Duluth 分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 通过Crawford-Sobel廉价谈话模型构建基准,评估大语言模型在偏好冲突时是否诚实,发现模型过度揭示信息,偏离策略最优。

Comments 24 pages, 6 figures. Code and data: https://github.com/iHamidHasani/cheap-talk-llm-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31349 2026-09-01 cs.CL cs.AI cs.CV cs.MM 版本更新 62%

FBHM: Functional Benchmarking and Steering of VLMs for Hateful Meme Detection

FBHM:用于仇恨模因检测的功能性基准测试与视觉语言模型引导

Paramananda Bhaskar, Naquee Rizwan, Daksh Jogchand, Saurabh Kumar Pandey, Animesh Mukherjee

机构 * Indian Institute of Technology (IIT), Kharagpur(印度理工学院(IIT)卡拉格浦尔) Microsoft(微软)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对现有基准无法因果评估视觉语言模型漏洞的问题,提出基于25种修辞功能和10个目标社区构建的FBHM基准,并采用可学习引导向量(LSV)在极低数据量下提升模型性能约30个Macro-F1点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29888 2026-09-01 cs.LG cs.AI 版本更新 62%

LaRA: Layer-wise Representation Analysis for Detecting Data Contamination in RL Post-Training

LaRA: 面向RL后训练中数据污染的逐层表示分析

Minju Gwak, Minseo Kwak, Dongseok Lee, Guijin Son, Alan Ritter, Jaehyung Kim

机构 * Yonsei University(延世大学) Seoul National University(首尔国立大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出LaRA框架,通过逐层表示分析检测强化学习后训练中的污染数据,利用扰动敏感性、方向坍缩和局部表示刚性三个指标,优于现有输出级方法。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18007 2026-09-01 cs.CL cs.AI 版本更新 62%

Do Large Language Models Possess a Theory of Mind? A Comparative Evaluation Using the Strange Stories Paradigm

大型语言模型具备心智理论吗?使用奇怪故事范式进行比较评估

Anna Babarczy, Andras Lukacs, Peter Vedres, Zeteny Bujka

机构 * ELTE Research Centre for Linguistics(ELTE语言学研究中心) Department of Cognitive Science, Faculty of Natural Sciences, Budapest University of Technology and Economics(布达佩斯技术与经济大学自然科学学院认知科学系) Institute of Mathematics, Eötvös Lóránd University(欧多布雷尼大学数学研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过奇怪故事范式评估了大型语言模型是否具备心智理论能力,发现GPT-4o在复杂条件下表现接近人类,而早期小型模型易受相关线索影响且易受无关信息干扰。

Comments 19 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23765 2026-09-01 cs.CL cs.AI 版本更新 62%

Entropy-Aware Token Rejection for Improving Speculative Decoding

基于熵的推测解码:改进大语言模型推理

Tiancheng Su, Meicong Zhang, Guoxiu He

机构 * School of Economics and Management(经济管理学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 基于熵的推测解码通过动态熵惩罚提升大语言模型推理性能,实验表明其在多数情况下优于目标模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13186 2026-09-01 cs.CL cs.AI cs.CV 版本更新 62%

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents

MM-BrowseComp:多模态浏览智能体的综合基准

Shilong Li, Xingyuan Bu, Wenjie Wang, Jiaheng Liu, Jun Dong, Haoyang He, Hao Lu, Haozhe Zhang, Chenchen Jing, Zhen Li, Chuanhao Li, Jiayi Tian, Chenchen Zhang, Tianhao Peng, Yancheng He, Jihao Gu, Hui Huang, Donghao Zhou, Yuanxing Zhang, Jian Yang, Ge Zhang, Wenhao Huang, Zhaoxiang Zhang, Qiangpeng Yang, Shilei Wen

机构 * Nanjing University(南京大学) Zhejiang University(浙江大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对现有浏览基准忽略多模态内容的问题,推出多模态浏览智能体基准MM-BrowseComp,含400道需从网页图像视频提取证据的问题,评估显示领先模型准确率仅24.25%,该基准成领域新标准。

Comments EMNLP 2026. The first two authors contribute equally, 20 pages, repo at https://github.com/MMBrowseComp/MM-BrowseComp

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30165 2026-09-01 q-bio.QM cs.AI 新提交 57%

Science sandboxes measure the scientific capability of AI agents

科学沙箱可衡量AI智能体的科学能力

Arya S. Rao, Rodrigo I. Castro, Sager J. Gosai, Kenneth B. Hsu, Yasha Ektefaie, Shantanu Singh, Sangeeta N. Bhatia, Steven K. Reilly, Ryan Tewhey, Eric S. Lander, Pardis C. Sabeti

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究人员提出科学沙箱框架,在调控基因组学和蛋白质适应性预测场景中评估前沿AI智能体的科学能力,发现其常不理解系统规则却能优化指标,该框架可衡量科学能力前沿并提供研究环境。

Comments 72 pages, 5 main figures, 3 tables, and 5 supplementary figures; includes supplementary agent instructions and harness

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29843 2026-09-01 econ.GN cs.LG q-fin.EC 新提交 57%

The Price of Intelligence: A Quality-Adjusted Price Index for AI Services

智能的代价:面向AI服务的质量调整价格指数

Louis Yiven Zhu

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文构建AI推理市场质量调整价格指数,发现当前方法漏测87%的价格降幅,买方价格按任务计算已停止下降,且AI评估的排行榜稳定性论点无法为相关经济统计辩护。

Comments 38 pages, 3 figures. Data, code and provenance archived at https://doi.org/10.5281/zenodo.22177190; pre-registration at https://doi.org/10.17605/OSF.IO/5UQJ2

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31119 2026-09-01 cs.CL 新提交 57%

PaperGym: Rubric-Centered Evolution for Research-Plan Generation

PaperGym:以评分标准为中心的研究计划生成演化框架

Yuhan Wang, Zhengxi Lu, Yuchen Yan, Kaitao Song, Wenqi Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

机构 * Zhejiang University(浙江大学) Apple(苹果公司)

专题命中 推理评测 :planning(abstract);分类 cs.CL

AI总结 本文提出PaperGym框架,将论文转化为研究计划生成的训练环境,采用评分标准分阶段训练Qwen3系列模型,显著提升了研究规划能力,在多项基准上优于现有方法。

Comments 34 pages, 6 figures, 6 tables. Code: https://github.com/ZJU-REAL/PaperGym. Project page: https://zju-real.github.io/PaperGym. Dataset: https://huggingface.co/datasets/CabbageWyh/PaperGym-Data. Model: https://huggingface.co/CabbageWyh/PaperGym-Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31108 2026-09-01 cs.LG 新提交 57%

Stress-Testing Efficient Responsible-AI Evaluation: When Compute Savings Change Benchmark Conclusions

对高效负责任AI评估的压力测试:当计算节省改变基准结论时

Ahmed El Kady, Aravind Narayanan, Rehana Noorani, Yani Ioannou, Shaina Raza

机构 * Vector Institute(向量研究所) University of Calgary(卡尔加里大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 该研究通过在BBQ和BBQ-V上对3种模型开展7种条件下的测试,验证高效负责任AI评估的结论稳健性,发现不同高效评估方式对性能、能耗等的影响,提出需检查高效评估的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31058 2026-09-01 cs.CL 新提交 57%

Improving Information Extraction with Learned Queries

利用学习到的查询改进信息抽取

Omar Sharif, Soroush Vosoughi, Nikhil Singh

机构 * Dartmouth College(达特茅斯学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 该研究针对信息抽取问题,提出LoQ生成文档特定问题集、FeedQ反馈驱动优化方法,优化问题可训练轻量级模型,4B参数模型性能超未调大模型,发布12820个优化问题数据集。

Comments Accepted in EMNLP-2026, 21 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30903 2026-09-01 cs.CL 新提交 57%

MMDS-Bench: Benchmarking Multimodal Large Language Models on Dynamic Stance in Social Media Interactions

MMDS-Bench:面向社交媒体互动中动态立场的多模态大语言模型基准测试

Yuzhe Ding, Kang He, Li Zheng, Shengwu Zheng, Teng Shi, Fei Li, Chong Teng, Donghong Ji

机构 * School of Cyber Science and Engineering, Wuhan University(武汉大学网络安全学院) Shanghai Innovation Institute(上海创新研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究构建多模态动态立场分类基准MMDS-Bench,评估12个多模态大语言模型,发现其在关系推理类多模态动态立场理解上仍存在不足。

Comments Accepted by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏