arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10507 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10507 篇

2606.25491 2026-06-25 cs.CV cs.AI 新提交 57%

HG-Bench: A Benchmark for Multi-Page Handwritten Answer-Region Grounding in Automated Homework Assessment

HG-Bench: 自动作业批改中多页手写答案区域定位的基准

Chuangxin Zhao, Boyan Shi, Yanling Wang, Yijian LU, Canran Xiao, Jiali Chen, Jun Xia, Yan Wang, Ji Qi, Juanzi Li

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对自动作业批改中多页手写答案区域定位的缺失评估,提出HG-Bench基准,包含500个带层级标注的样本,并设计页面感知评估协议,揭示现有模型在步骤级定位上的能力差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25402 2026-06-25 cs.SE cs.AI 新提交 57%

LibEvoBench: Probing Temporal Knowledge Stratification in Code Generation Models

LibEvoBench:探测代码生成模型中的时间知识分层

Daniele Cipollone, Sergey Titov, Maliheh Izadi, Egor Bogomolov, Arie van Deursen

机构 * Faculty of EEMCS, Delft University of Technology, Delft, Netherlands(代尔夫特理工大学电子工程与信息科学学院) JetBrains Research, Amsterdam, Netherlands(JetBrains研究)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对LLM在代码生成中因训练数据时间混合导致API版本混淆的问题,提出多版本基准LibEvoBench和新指标SEUS,揭示模型对版本不敏感且仅靠文档可提升准确性。

Comments Accepted at the DL4Code workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25007 2026-06-25 cs.LG q-fin.ST 新提交 57%

Multi-Stream Temporal Fusion for Financial Fraud Detection

面向金融欺诈检测的多流时序融合

Mohammadamin Dashti Moghaddam, Nick Sciarrilli

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 提出多流欺诈Transformer(MSFT),通过独立编码交易、登录、风险等多事件流并融合表示,在千万用户数据集上AUROC达0.996,优于单流Transformer和XGBoost。

Comments 10 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18936 2026-06-25 cs.AI cs.CY 新提交 57%

SciRisk-Bench: A Risk-Dimension-Aware Benchmark for AI4Science Safety

SciRisk-Bench:面向AI4Science安全的风险维度感知基准

Linghao Feng, Yinqian Sun, Dongqi Liang, Sicheng Shen, Chenfei Yan, Yuxuan Peng, Yilin Zhao, Haibo Tong, Kai Li, FeiFei Zhao, Yi Zeng

机构 * Brain-inspired Cognitive Intelligence Lab, Institute of Automation, Chinese Academy of Sciences, Beijing, China(脑启发认知智能实验室,自动化研究所,中国科学院,北京,中国) School of Future Technology, University of Chinese Academy of Sciences, China(未来技术学院,中国科学院大学,中国) School of Artificial Intelligence, University of Chinese Academy of Sciences, China(人工智能学院,中国科学院大学,中国) Zhongguancun Academy, China(中关村学院,中国) Beijing Key Laboratory of Safe AI and Superalignment(北京安全人工智能与超对齐重点实验室) Gaoling School of AI, Renmin University of China(甘露人工智能学院,中国人民大学) Beijing Institute of AI Safety and Governance (Beijing-AISI)(北京人工智能安全与治理研究院(北京-AISI)) School of Humanities, University of Chinese Academy of Sciences, China(人文学院,中国科学院大学,中国)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 提出SciRisk-Bench基准,从显式风险维度和科学学科两个角度评估AI4Science安全,覆盖7个学科、31个子学科和10个风险维度,实验揭示主流及科学大模型的安全薄弱环节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25345 2026-06-25 cs.AI astro-ph.IM 版本更新 57%

Plausible but Wrong: A case study on Agentic Failures in Astrophysical Workflows

可能但错误:天体物理工作流中代理失败的案例研究

Shivam Rawat, Lucie Flek

机构 * Bonn-Aachen International Center for Information Technology, University of Bonn, Germany(波恩-阿森国际信息科技中心,波恩大学,德国) Lamarr Institute for Machine Learning and Artificial Intelligence, Germany(拉马尔机器学习与人工智能研究所,德国)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究评估了CMBAgent在两种工作流范式和十八个天体物理任务中的表现,发现代理在缺乏上下文时性能提升显著,但常出现静默错误,产生看似合理却不准确的结果,揭示了代理科学工作流中最危险的失败模式是自信生成错误结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02156 2026-06-25 cs.NI cs.AI 版本更新 57%

How Small Can 6G Reason? Scaling Tiny-to-Small Language Models for AI-Native Networks

6G 推理能有多小?面向 AI 原生网络的微小型语言模型缩放

Mohamed Amine Ferrag, Abderrahmane Lakas, Merouane Debbah

机构 * Department of Computer and Network Engineering, United Arab Emirates University, UAE(计算机与网络工程系,阿联酋大学) Research Institute for Digital Future, Khalifa University, UAE(未来数字研究院,哈利法大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文系统研究小型语言模型在 6G 网络语义推理中的缩放行为与部署效率,发现 1.5B-3B 参数的中等模型在确定性稳定性和计算效率间取得最佳平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05143 2026-06-25 cs.AI cs.IR 版本更新 57%

CausalRAG2: Hierarchical Causal Knowledge Graph Design for RAG

CausalRAG2: 面向RAG的分层因果知识图谱设计

Nengbo Wang, Tuo Liang, Vikash Singh, Chaoda Song, Van Yang, Yu Yin, Jing Ma, Jagdip Singh, Vipin Chaudhary

机构 * Department of Computer and Data Sciences, Case Western Reserve University, Cleveland, OH, USA(计算机与数据科学系,凯斯西储大学,克利夫兰,OH,USA) Design and Innovation Department, Case Western Reserve University, Cleveland, OH, USA(设计与创新部门,凯斯西储大学,克利夫兰,OH,USA)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出CausalRAG2框架,通过分层模块间的因果门控机制显式建模因果关系,抑制虚假相关,实现大规模知识图谱上的可扩展推理,并引入HolisQA基准,实验表明其优于现有图基RAG方法。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17037 2026-06-25 cs.CV cs.AI 版本更新 57%

AMVICC: A Novel Benchmark for Cross-Modal Failure Mode Profiling for VLMs and IGMs

AMVICC: 一种用于VLM和IGM跨模态故障模式分析的新型基准

Aahana Basappa, Pranay Goel, Anusri Karra, Anish Karra, Asa Gilmore, Kevin Zhu

机构 * Centennial High School, Frisco, Texas, USA(Centennial High School, Texas, USA) Lebanon Trail High School, Frisco, Texas, USA(Lebanon Trail High School, Texas, USA) West Windsor-Plainsboro High School, Princeton Junction, New Jersey, USA(West Windsor-Plainsboro High School, New Jersey, USA) Algoverse AI Research, Palo Alto, California, USA(Algoververse AI Research, California, USA)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出AMVICC基准,通过图像到文本和文本到图像任务系统比较多模态大模型和图像生成模型的视觉推理失败模式,发现故障模式在模型和模态间共享,但存在特定于模型和模态的失败。

Comments 14 pages, 4 figures, 8 tables. Presented at the 39th Conference on Neural Information Processing Systems Workshop: VLM4RWD. Presented at the 43th International Conference on Machine Learning Workshops: ICML 2026 CTB, ICML 2026 FAGEN, ICML 2026 EMM-QA. Authors Aahana Basappa and Pranay Goel contributed equally. Code: https://github.com/AahanaB24/AMVICC, Data: https://doi.org/10.5281/zenodo.17646068

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24834 2026-06-24 cs.AI 新提交 57%

Accuracy and Satisfaction in Multi-Turn LLM Dialogues for NFR Assessment

多轮LLM对话中NFR评估的准确性与满意度

Ali Pourghasemi Fatideh, Wilder Baldwin, Maria Dhakal, Collin McMillan, Sepideh Ghanavati

机构 * University of Maine(缅因大学) University of Notre Dame(圣母大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究开发者在与LLM对话助手评估非功能需求(NFR)时的准确性和满意度,发现开发者倾向于同意LLM评估但准确性低,且长回复和过多信息提供轮次降低满意度,而主动交互提升满意度。

Comments 9 pages, 5 figures. Accepted to SIGDIAL 2026 (27th Annual Meeting of the Special Interest Group on Discourse and Dialogue)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24820 2026-06-24 cs.CL 新提交 57%

SHERLOC: Structured Diagnostic Localization for Code Repair Agents

SHERLOC: 代码修复智能体的结构化诊断定位

Hovhannes Tamoyan, Sean Narenthiran, Erik Arakelyan, Mira Mezini, Boris Ginsburg

机构 * NVIDIA(英伟达) Santa Clara, CA 95051, USA(美国加利福尼亚州圣克拉拉) TU Darmstadt(达姆施塔特工业大学) National Research Center for Applied Cybersecurity ATHENE(国家应用网络安全研究中心 ATHENE)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出SHERLOC框架,通过推理LLM与紧凑仓库工具及自恢复机制,实现无需微调的结构化诊断定位,在SWE-Bench上达到最优定位精度,并提升修复率、降低令牌消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24797 2026-06-24 cs.CV cs.AI 新提交 57%

EG-VQA: Benchmarking Verifiable Video Question Answering with Grounded Temporal Evidence

EG-VQA: 基于接地时间证据的可验证视频问答基准

Linpeng Huang, Weixing Chen, Zexin Chen, Yang Liu, Liang Lin

机构 * Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) Shenzhen University(深圳大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出EG-VQA基准,通过细粒度时间证据标注和EG-F1指标,揭示视频大模型在答案正确性与证据定位之间的差距,并引入EG-Reasoner模型弥合这一差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24346 2026-06-24 cs.IR cs.CL 新提交 57%

PETRA: Transforming Web Text for Petroleum-Engineering Domain Adaptation

PETRA: 将网络文本转化为石油工程领域适应的数据集

Kirill Dubovikov, Omar El Mansouri, Hachem Madmoun, Yanda Li, Sandeep Kumar, Aya El Mir, Supriyo Ghosh, Writabrata Bhattacharya, Adrian Garcia-Garcia, Onkar Pandit, Sunil Kumar Sahu, Federico Castanedo, Larry Murray, Martin Takac, Salem Lahlou

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎伊德大学人工智能学院) Inception AI

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 针对石油工程检索中领域标签稀缺的问题,提出PETRA数据集和流程,通过噪声网络数据构建领域语料和合成监督信号,显著提升检索与重排序性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24145 2026-06-24 cs.AI 新提交 57%

T2D-Bench: Evidence-Gated Evaluation of LLM Outputs for Type 2 Diabetes Using a Multi-Layer Clinical-Lifestyle Knowledge Graph

T2D-Bench:基于多层临床-生活方式知识图谱的2型糖尿病LLM输出证据门控评估

Saba A. Farahani, Hung Cao, Ramesh Jain, Amir M. Rahmani

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 推理评测 :verifier(abstract);分类 cs.AI

AI总结 提出T2D-Bench基准,通过多层知识图谱和证据门控机制,检测LLM输出中未满足指南约束的临床遗漏,并在2型糖尿病诊断、用药安全等场景中实现可测量纠正。

Comments 7 pages, 2 figures, 2 tables. Accepted as a poster at AMIA 2026 Annual Symposium

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24066 2026-06-24 cs.SD cs.CL eess.AS 新提交 57%

VieSpeaker: A Large-Scale Vietnamese Speaker Recognition Dataset Beyond Visual Dependency

VieSpeaker:超越视觉依赖的大规模越南语说话人识别数据集

Viet Hoang Pham, Tran Trung Nguyen, Bao Thu Ho, Phuong Tuan Dat, Thi Thu Trang Nguyen

机构 * Hanoi University of Science and Technology(河内科技大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出无需面部线索的数据集构建流程,利用文本元数据和大型语言模型推理说话人身份,构建包含4715名说话人约902小时语音的越南语数据集VieSpeaker,实验证明其提升模型鲁棒性和泛化能力。

Comments 5 pages, 1 figure, 6 tables, Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13189 2026-06-24 cs.CL 新提交 57%

SICI: A Semantic-Pragmatic Complexity Index Reveals Regime Shifts in LLM Stance Detection

SICI:一种揭示LLM立场检测中相变的语义-语用复杂度指数

Fuqiang Niu, Bowen Zhang

机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络空间安全学院) School of Artificial Intelligence, Shenzhen Technology University(深圳技术大学人工智能学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出SICI指数,从七维语义-语用复杂度诊断立场检测难度,揭示LLM错误随复杂度增加从过度归因到集中弃权的相变规律,且干预方法仅沿归因-弃权轴移动而非消除瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18542 2026-06-24 cs.CL 版本更新 57%

Business as Rulesual: A Benchmark and Framework for Business Rule Flow Modeling with LLMs

业务即规则:面向LLM的业务规则流建模基准与框架

Chen Yang, Ruping Xu, Ruizhe Li, Bin Cao, Jing Fan

机构 * Zhejiang University of Technology(浙江工业大学) Zhejiang Key Laboratory of Visual Information Intelligent Processing(浙江省视觉信息智能处理重点实验室) University of Aberdeen(阿伯丁大学) University of Birmingham(伯明翰大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出BREX基准(409份真实业务文档与2855条专家标注规则)和ExIde框架,通过可执行伪代码生成显式建模规则依赖,在13个LLM上验证了可执行接地作为归纳偏置的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24295 2026-06-24 cs.CL 版本更新 57%

MERGE: Minimal Expression-Replacement GEneralization Test for Natural Language Inference

MERGE: 自然语言推理的最小表达式替换泛化测试

Mădălina Zgreabăn, Tejaswini Deoskar, Lasha Abzianidze

机构 * Utrecht Institute of Linguistics OTS(乌得勒支语言研究所OTS)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出MERGE测试,通过最小表达式替换(MERE)生成高质量变体,评估NLI模型在非对抗性变体上的泛化能力,发现LLM和微调模型泛化较差。

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14167 2026-06-24 cs.CL 57%

Synthetic Clarification and Correction Dialogues about Data-Centric Tasks -- A Teacher-Student Approach

数据导向任务的合成澄清与纠正对话——一种教师-学生方法

Christian Poelitz, Nick McKenna

机构 * Microsoft Research(微软研究院) Cambridge UK(剑桥英国)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一种教师-学生框架,用于合成多轮对话以解决基于表格的问题回答任务,通过强教师模型验证生成对话质量,验证了其在前沿LLM基准中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23459 2026-06-23 cs.CL 新提交 57%

TriggerBench: Investigating Prospective Memory for Large Language Models

TriggerBench: 探究大型语言模型的前瞻记忆

Tianhua Zhang, Xinjiang Wang, Qianxi Zhang, Qi Chen, Kun Li, Yaoqi Chen, Dingdong Wang, Helen Meng, Yan Lu

机构 * The Chinese University of Hong Kong(香港中文大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出TriggerBench基准,系统评估LLM的前瞻记忆能力,发现其存在精度-召回权衡、注意力脆弱性,且比回溯记忆更难,可作为推理能力的指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23243 2026-06-23 cs.LG cs.SD 新提交 57%

Unlocking In-Context Learning in Audio-Language Models from Decentralized Medical Audio

从分散的医疗音频中解锁音频-语言模型的上下文学习

Ran Piao, Tsai-Ning Wang, Martijn den Dekker, Linda Moonen, Hareld Kemps, Yuan Lu, Aaqib Saeed

机构 * Eindhoven University of Technology(埃因霍温理工大学) Erasmus MC(伊拉斯姆斯医学中心) Rijnstate Hospital(莱茵州医院)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 提出联邦自上下文学习(FSC)框架,通过无监督聚类构建伪标签片段,结合渐进式三阶段流水线,在联邦医院客户端实现少样本临床音频诊断,准确率达71.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23205 2026-06-23 cs.CY cs.AI cs.IR 新提交 57%

The Correct Answer Trap: Pedagogically-Grounded Detection and Feedback for Hidden Misconceptions

正确答案陷阱:基于教学法的隐藏误解检测与反馈

Moiz Imran, Sahan Bulathwela

机构 * Department of Computer Science, University College London, The United Kingdom(伦敦大学学院计算机科学系,英国) Centre for Artificial Intelligence, University College London, The United Kingdom(伦敦大学学院人工智能中心,英国)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对学生通过错误推理得到正确答案时隐藏的误解,提出检测与反馈方法,利用分类器和推理模型检测,并设计分级评估与检测-验证-升级流程以减少误报。

Comments Accepted at the AIED PEAF 2026: Workshop on Pedagogical Evaluation of Automated Feedback, June 28, 2026, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23175 2026-06-23 cs.LG 新提交 57%

Position: Correct Answer, Wrong Mechanism -- When AI Scientists Defend General Claims Their Own Data Contradicts

立场:正确答案,错误机制——当AI科学家用自身数据反驳其通用主张时

Steven Young Eulig

机构 * Department of Physics and Laboratory for Particle Physics and Cosmology (LPPC), Harvard University(哈佛大学物理系与粒子物理与宇宙学实验室(LPPC))

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文通过编码代理在Geant4模拟中重新发现已知粒子识别可观测量的实验,指出仅以最终结果评估AI科学家系统不足,提出需分别衡量任务结果、机制保真度和认知诚实性,并发现正确答案但错误机制(CAWM)现象。

Comments 8 pages body plus 12 pages references and appendix, non-archival upload for ICML 2026 AI for Science workshop, selected as spotlight paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22936 2026-06-23 cs.AI 新提交 57%

When Agents Commit Too Soon: Diagnosing Premature Commitment in LLM Agents

当智能体过早承诺:诊断LLM智能体中的过早承诺问题

Aman Mehta

机构 * Snowflake AI Research

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出表征承诺作为跨运行隐藏状态收敛的指标,用于诊断长程LLM智能体过早承诺问题,并在多个模型和数据集上验证其预测轨迹一致性的能力。

Comments 22 pages, 16 figures Primary: cs.AI Secondary: cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22792 2026-06-23 cs.AI 新提交 57%

The Origins of Stochasticity: Comprehensive Investigations on Uncertainty Quantification for Large Language Models

随机性的起源:大型语言模型不确定性量化的综合研究

Xiang-Jun Ou, Shuang Liang, Xin-Yu Hu, Rong-Hao Huang, Jing Wang, Shao-Qun Zhang

机构 * National Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) School of Intelligent Science and Technology(智能科学与技术学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出细粒度不确定性分类法,将LLM不确定性归因于输入、参数、标记和解码过程,并评估21种UQ方法,发现基于共识的方法(Deg和EigV)表现最佳,且模型规模与不确定性负相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22470 2026-06-23 cs.AI 新提交 57%

PRIME: Evaluating Prompt Resolution Under Incompatible Instructions in LLMs

PRIME: 评估大语言模型在不兼容指令下的提示解决能力

Tehreem Javed, Shumaim Fatimah, Masooma Bakhtiari, Gibrail Islam, Mehwish Fatima

机构 * School of Electrical Engineering Computer Science (SEECS), National University of Sciences

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出PRIME框架,通过生成校准冲突(响应长度、输出格式、推理)并采用确定性行为分类法,分析大语言模型处理冲突指令的行为,发现冲突类型比模型规模对行为影响更大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21147 2026-06-23 cs.SD cs.AI 新提交 57%

AOR-Bench: Do Large Audio Language Models Over-Refuse Pseudo-Harmful Queries?

AOR-Bench: 大型音频语言模型是否会过度拒绝伪有害查询?

Jiaxi Yang, Chaewan Chun, Jason Lucas, Yuchen Yang, Dongwon Lee

机构 * Penn State University(宾夕法尼亚州立大学)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI

AI总结 提出首个针对大型音频语言模型过度拒绝问题的基准AOR-Bench,包含3000个伪有害音频样本,评估12个模型发现过度拒绝普遍存在,并探索了两种轻量缓解策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20570 2026-06-23 cs.NI cs.AI cs.DC cs.MA 新提交 57%

Infrastructure for the Agentic Web: Gap Analysis and Architecture from the Agentverse Platform

代理网络的基础设施:来自Agentverse平台的差距分析与架构

Robin Dey, Panyanon Viradecha

机构 * OpenHub Research(开放 hub 研究)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文通过实证审计Agentverse平台,识别出8类62项缺失能力,提出七层代理云栈参考架构,并规划了从存储到经济原语的五条关键演进路径,为2030年实现Web4代理云提供技术路线。

Comments 28 pages, 11 tables, 1 figure. Preprint, not peer-reviewed

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09013 2026-06-23 cs.CL 新提交 57%

Beyond Averages: Evaluating LLMs on Human Survey Replication at the Distributional Level

超越平均值:在分布层面评估LLM对人类调查的复现能力

Jeonghyeon Moon, Jiwon Kim, Yeheum Lah, Yoonju Han, Yuncheol Kang

机构 * Ewha Womans University(梨花女子大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究通过非公开的韩国方便面购买实验,在分布层面评估LLM复现人类调查响应的能力,发现均值匹配的模型可能产生更偏离人类的分布,且结构化角色和多模态输入提升对齐度,而推理提示则降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01152 2026-06-23 cs.AI 版本更新 57%

DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent

DeepResearch-9K:一个具有挑战性的深度研究智能体基准数据集

Tongzhou Wu, Yuhao Wang, Xinyu Ma, Xiuqiang He, Shuaiqiang Wang, Dawei Yin, Xiangyu Zhao

机构 * Shenzhen Technology University(深圳技术大学) City University of Hong Kong(香港城市大学) Baidu Inc.(百度公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 为解决深度研究智能体缺乏大规模挑战性数据集和开源训练框架的问题,构建了DeepResearch-9K数据集,包含9000个多难度问题、搜索轨迹和可验证答案,并开发了开源训练框架DeepResearch-R1,实验表明训练后的智能体在基准测试上达到最优。

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00710 2026-06-23 cs.AI 版本更新 57%

Learning More from Less: Unlocking Internal Representations for Benchmark Compression

从更少中学习更多:解锁内部表示以实现基准压缩

Yueqi Zhang, Jin Hu, Shaoxiong Feng, Peiwen Yuan, Xinglin Wang, Yiwei Li, Jiayi Shi, Chuyi Tan, Ji Zhang, Boyuan Pan, Yao Hu, Kan Li

机构 * School of Computer Science, Beijing Institute of Technology(北京理工大学计算机科学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出RepCore方法,通过对齐异构隐藏状态构建代表性核心集,仅需少量源模型即可精确估计大语言模型在完整基准上的性能,显著优于基于输出的基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏