arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5021 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 5021 篇

2607.02118 2026-07-03 cs.AI 新提交 57%

Enhancing Fitness Intelligence through Domain-Specific LLM Post-Training

通过领域特定的大语言模型后训练增强健身智能

Xingtao Zhao, Tian Yang, Han Jiang

机构 * School of Cyber Science and Technology(网络科学与技术学院) Beihang University(北京航空航天大学) School of Information(信息学院) Renmin University of China(中国人民大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 针对通用大语言模型在科学健身教练中领域知识不足的问题,提出FitOne系列模型,通过三阶段后训练(持续预训练、监督微调、强化学习)提升专业能力,在ACSM-EP和NSCA-CSCS考试中平均提升最高12.73%。

Comments 8 pages, 6 tables, 2 figures. Accepted by the 12th International Conference on Big Data Computing and Communications (BigCom 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01661 2026-07-03 cs.AI 新提交 57%

Diverse Evidence, Better Forecasts: Multi-Agent Deliberation Under Information Asymmetry

多样证据,更好预测:信息不对称下的多智能体商议

Yuante Li, Yicheng Tao, Kate Zhang, Taozhi Wang, Gefei Gu, Yaxin Zhou

机构 * School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院) College of Engineering, Carnegie Mellon University(卡内基梅隆大学工程学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 针对多智能体系统中信息同质化导致商议效果不佳的问题,提出通过设计信息不对称(共享公开证据与私有证据)降低智能体间误差相关性,并构建InfoDelphi框架,在预测任务上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01152 2026-07-03 cs.CL 新提交 57%

AGC-Bench: Measuring Artificial General Creativity

AGC-Bench:衡量人工通用创造力

Roger Beaty, Vijeta Deshpande, Clin K. Y. Lai, Anna Attuch, Namrata Shivagunde, Swastik Roy, Rajkumar Pujari, Paul V. DiStefano, Sherin Muckatira, Claire E. Stevenson, Mikhail Gronas, Anna Rumshisky

机构 * Pennsylvania State University(宾夕法尼亚州立大学) University of Massachusetts Lowell(马萨诸塞大学洛厄尔分校) University of Amsterdam(阿姆斯特丹大学) Amazon AGI(亚马逊AGI) Dartmouth College(达特茅斯学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 提出AGC-Bench基准,通过系统文献综述和标准化框架评估LLM创造力,发现单一创造力因子'c',并验证提示'要有创造力'比推理更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12198 2026-07-03 physics.comp-ph cond-mat.mtrl-sci cs.AI 版本更新 57%

Grounded autonomous scrutiny at scale: emergent critique from reproduction of published computational physics papers

迈向有根的自主研究:一个端到端的LLM微型研究循环在已发表的计算物理学中的应用

Haonan Huang

机构 * Department of Physics, Princeton University(普林斯顿大学物理系)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一个端到端的LLM微型研究循环,用于在已发表的计算物理学中进行自主研究,通过大规模和深度测试展示其在复现、批评和扩展研究中的能力。

Comments v2: camera-ready version, accepted at ICML 2026 AI for Science Workshop. Corrects the phase-classification statistics and adds a coding-sensitivity analysis (Methods M6); the agent-produced six-page Comment is reproduced as-is in the final appendix. 24 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13191 2026-07-03 physics.comp-ph cond-mat.mtrl-sci cs.AI 版本更新 57%

From Experiments to Expertise: Scientific Knowledge Consolidation for AI-Driven Computational Physics

从实验到专长:面向AI驱动计算物理的科学知识巩固

Haonan Huang

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出QMatSuite平台,通过记录、检索和反思机制巩固计算材料科学中的知识,减少推理开销并提高模拟准确性。

Comments v2: camera-ready version, accepted at the ICML 2026 Workshop on AI for Physics (AI4Physics@ICML 2026). 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02327 2026-07-03 cs.CL 版本更新 57%

LearNAT: Learning NL2SQL with AST-guided Task Decomposition for Large Language Models

LearNAT: 基于AST引导任务分解的NL2SQL大语言模型学习

Weibin Liao, Xin Gao, Tianyu Jia, Rihong Qiu, Yifan Zhu, Yang Lin, Xinyu Ma, Junfeng Zhao, Yasha Wang

机构 * School of Computer Science, Peking University(北京大学计算机科学系) Key Laboratory of High Confidence Software Technologies, Ministry of Education(教育部高可信软件技术重点实验室) Big Data Technology Research Center, Nanhu Laboratory(纳米实验室大数据技术研究中心) National Engineering Research Center For Software Engineering, Peking University(北京大学软件工程国家工程研究中心) Peking University Information Technology Institute (Tianjin Binhai)(北京大学信息技术研究院(天津滨海)) School of Computer Sciences, Beijing University of Posts and Telecommunications(北京邮电大学计算机科学系) Huawei Technologies Co., Ltd(华为技术有限公司) Seed, ByteDance Inc.(字节跳动公司)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 提出LearNAT框架,通过AST引导的分解合成过程和边际感知强化学习,增强小规模LLM的NL2SQL任务分解能力,以7B参数模型达到GPT-4可比性能。

Comments Accepted by ICLR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01131 2026-07-02 cs.CV cs.AI 新提交 57%

Autonomous Scientific Discovery via Iterative Meta-Reflection

通过迭代元反射实现自主科学发现

Bingchen Zhao, Sara Beery, Oisin Mac Aodha

机构 * University of Edinburgh(爱丁堡大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出DiscoPER框架,利用大语言模型进行开放式的自主科学发现,通过动态代码生成、统计检验和二阶推理机制,在iNatDisco基准上以72.7%假设支持率恢复8/9已知模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00908 2026-07-02 cs.LG 新提交 57%

Beyond Activation Alignment:The Alignment-Diversity Tradeoff in Task-Aware LLM Quantization

超越激活对齐:任务感知的大语言模型量化中的对齐-多样性权衡

Fei Wang, Chao Xue, Taoran Liu, Li Shen, Ye Liu, ChangXing Ding

机构 * South China University of Technology(华南理工大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Ocean University of China(中国海洋大学) Center for AI Theoretical Foundation and Systems, Shenzhen Loop Area Institute(深圳环区研究所人工智能理论基础与系统中心)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 本文揭示混合精度量化中的困惑度幻觉和对齐-多样性权衡,提出TASA框架联合优化校准数据组成和比特分配,在3.5比特平均精度下匹配或超越4比特基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00767 2026-07-02 cs.LG 版本更新 57%

ActivityNarrated: An Open-Ended Narrative Paradigm for Wearable Human Activity Understanding

ActivityNarrated: 一种面向可穿戴人类活动理解的开放性叙事范式

Lala Shakti Swarup Ray, Mengxi Liu, Alcina Pinto, Deepika Gurung, Daniel Geissler, Paul Lukowoicz, Bo Zhou

机构 * DFKI Kaiserslautern(德国人工智能研究中心凯泽斯劳滕) RPTU(莱茵兰-普法尔茨州凯泽斯劳滕-兰道工业大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 本文提出一种开放性叙事范式,通过将可穿戴传感器数据与自然语言描述对齐,实现开放词汇环境下的人类活动理解,实验表明其在跨参与者评估中表现优于传统闭合集方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31158 2026-07-01 cs.RO cs.AI 新提交 57%

LLM-Powered Interactive Robotic Action Synthesis from Multimodal Speech, Gestures, and Music

基于多模态语音、手势和音乐的LLM驱动交互式机器人动作合成

Snehasis Banerjee, Ranjan Dasgupta

机构 * TCS Research, Tata Consultancy Services(塔塔咨询服务公司TCS研究院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出利用大语言模型融合语音、手势和音乐节拍等多模态输入,合成复杂机器人动作序列的框架,实现更自然的人机交互。

Comments IROS 2025 Workshop on Action and Interaction: Humans and Robots in Collaboration

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30840 2026-07-01 cs.AI 新提交 57%

Contrastive Reflection for Iterative Prompt Optimization

对比反思:迭代提示优化

Derek Koh, Jinghui Mo, Benjamin H. Le, Jiening Zhan, Baofen Zheng, Kevin Bevis, Nathaniel C. Owen, Lauren Elizabeth Charney, Wenqiong Liu, Jingwei Wu

机构 * LinkedIn(领英)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出对比反思框架,通过对比失败与成功行为,迭代优化检索增强生成代理的提示,在HotpotQA上准确率从51.4%提升至60.4%。

Comments 6 pages, 1 figure. To appear at Agent4IR @ KDD 2026 (KDD 2026 Workshop on AI Agents for Information Retrieval)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30682 2026-07-01 cs.SD cs.AI eess.AS 新提交 57%

ALM2Vec: Learning Audio Embeddings for Universal Audio Retrieval with Large Audio-Language Models

ALM2Vec: 利用大型音频语言模型学习通用音频检索的音频嵌入

Fengjie Lu, Chenang Jiang, Jiarui Hai, Helin Wang, Aaron Yee

机构 * Zhejiang University(浙江大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出ALM2Vec框架,利用预训练大型音频语言模型学习统一嵌入空间,实现跨域、任务感知的音频检索,支持指令感知检索,在标准基准上表现优异。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29773 2026-06-30 cs.LG 57%

GLIP: Graph and LLM Joint Pretraining for Graph-Level Tasks

GLIP:面向图级任务的图与大型语言模型联合预训练

Haoxin Sun, Yiqing Lin, Yajun Huang, Chenhui Dong, Mingjun Li, Zhongzhi Zhang

机构 * Fudan University(复旦大学) ByteDance(字节跳动)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 提出GLIP框架,通过图增强、多令牌选择策略和扩散投影器,联合预训练图神经网络和大型语言模型,在图级分类与推理任务上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29265 2026-06-30 cs.CL 57%

MIThinker: A Plug-and-Play Policy-Optimized Thinker For Motivational Interviewing Counseling

MIThinker:一种用于动机性访谈咨询的即插即用策略优化思考器

Yizhe Yang, Palakorn Achananuparp, Heyan Huang, Jing Jiang, Ee-Peng Lim

机构 * Beijing Institute of Technology(北京理工大学) Singapore Management University(新加坡国立大学) Australian National University(澳大利亚国立大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 提出轻量级思考模型MIThinker,通过逆向工程从咨询师回应中生成治疗性思考,结合监督微调和强化学习训练,以显式对齐咨询策略,提升动机性访谈咨询效果,计算量降低一个数量级。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28361 2026-06-30 cs.IR cs.AI cs.IT math.IT 57%

ConCise: Training-Free Conclusion-Chain State Compression for Cost-Efficient Multi-Step RAG Services

ConCise: 免训练结论链状态压缩用于经济高效的多步RAG服务

Kuan Yan, Zhiqing Tang, Tian Wang, Weijia Jia

机构 * National Natural Science Foundation of China(国家自然科学基金委员会) Guangdong Higher Education Association(广东省高等教育协会) Guangdong Provincial Higher Education Institutions(广东省高等教育机构) Beijing Normal University at Zhuhai Education Reform Project(珠海市北京师范大学教育改革项目)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 针对多步RAG中累积输入令牌呈O(N²)增长导致成本高的问题,提出免训练状态层协议ConCise,通过结构化结论链将增长压缩至O(N),并引入融合生成机制减少API调用,平均节省64.63%令牌且保持可接受精度。

Comments to be published in IEEE ICWS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15044 2026-06-30 cs.AI cs.NI 57%

Agentic AI for ISAC: Analysis, Framework, and Case Study

面向ISAC的代理AI:分析、框架与案例研究

Wenwen Xie, Geng Sun, Chuang Zhang, Xuejie Liu, Dong In Kim

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨代理AI在ISAC系统中的应用价值,提出新型框架并验证其优化性能,分析代理AI在动态环境中的感知-推理-行动循环优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25034 2026-06-29 cs.CV cs.AI 新提交 57%

Yuvion VL: A Multimodal Foundation Model for Adversarial Content and AI Safety

Yuvion VL:面向对抗性内容和AI安全的多模态基础模型

Shikai Qiu, Xiaowen Xu, Benlei Cui, Ting Ma, Xiufeng Huang, Wenjing Jiang, Shaoxuan He, Haolei Xu, Chunyang Chai, Yujian Li, Yiliang Zhang, Guanghui Wang, Ziheng Wang, Ziwen Xu, Zhaoyu Fan, Jinhao Chen, Ruijie Jian, Hongxing Li, Chuxi Xiao, Xinyue Chen, Wenxuan Liu, Libin Dong, Yupeng Cao, Xiaoqian Xia, Jing Wang, Zhe Jiang, Zhenan Ye, Guang Yang, Bin Liu, Wei Peng, Ziqiang Zhu, Meihui Lian, Kaiwen Lv Kacuila, Haidong Ding, Dongjie Zhang, Yangfan Zhou, Bingyu Zhu, Yan Wang, Hai Zhao, Xuan Jin, Wei Zhao, Pengfei Sun, Huiming Zhang, Wei Wang, Xipeng Cao, Jialun Chen, Xiao Chen, Shaola Ren, Yunqing Hu, Bin Li, Chengwen Yao, Meng Huang, Xianfeng Li, Bin Tang, Chao Liu, Hui Xue, Longtao Huang, Haiwen Hong

机构 * Alibaba Security AGI Lab(阿里巴巴安全AGI实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出Yuvion VL系列多模态大语言模型,通过对抗性感知数据合成、三阶段训练和混淆对比微调,在内容和AI安全任务上达到行业领先性能,同时保持通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04996 2026-06-29 cs.CY cs.CE cs.CL cs.HC cs.RO 57%

Agentic Vehicles for Human-Centered Mobility: Definition, Prospects, and Synergistic Co-Development with Vehicle Autonomy

面向人类中心的移动性:定义、前景以及与车辆自主性的协同发展

Jiangbo Yu, Raphael Frank, Luis Miranda-Moreno, Sasan Jafarnejad, Jonatas Augusto Manzolli, Fuqiang Liu, Jiyao Wang, Pavel Chernakov, Ali Eslami

机构 * Interdisciplinary Centre for Security, Reliability and Trust(跨学科安全、可靠与信任中心) University of Luxembourg(卢森堡大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文探讨了面向人类中心的移动性,提出了代理车辆的概念,指出自主性和代理性是相互关联但概念上不同的维度,并强调了协同发展的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26488 2026-06-26 cs.LG 新提交 57%

What Survives When You Compress a Recursive Reasoner for the Edge?

当压缩边缘端递归推理器时,什么得以幸存?

Pearse Jim, Steven Kolawole, Opegbemi Matthias Busoye, Glory Bagai, Virginia Smith

机构 * ML Collective Carnegie Mellon University(卡内基梅隆大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 研究递归推理模型在边缘设备压缩中的表现,发现激进压缩破坏全局推理但保留局部预测,提出每通道校准INT4和轨迹保真度指标实现无损部署。

Comments Preprint; in review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01969 2026-06-26 cs.CL cs.IR 版本更新 57%

Orthogonal Hierarchical Decomposition for Structure-Aware Table Understanding with Large Language Models

正交层次分解:面向结构感知的大语言模型表格理解

Bin Cao, Huixian Lu, Chenwen Ma, Ting Wang, Ruizhe Li, Jing Fan

机构 * Zhejiang University of Technology, China(浙江工业大学,中国) Zhejiang Key Laboratory of Visual Information Intelligent Processing, China(浙江视觉信息智能处理重点实验室,中国) University of Aberdeen, UK(爱丁堡大学,英国)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 针对复杂表格中多级表头、合并单元格等结构导致大语言模型理解困难的问题,提出正交层次分解(OHD)框架,通过空间-语义联合约束的正交树归纳方法将不规则表格分解为列树和行树,并设计双路径关联协议重构单元格语义,在AITQA和HiTab基准上优于现有方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23129 2026-06-25 cs.LG 版本更新 57%

Polaris: A Gödel Agent Framework for Small Language Models through Experience-Abstracted Policy Repair

Polaris:通过经验抽象策略修复实现小型语言模型的Gödel代理框架

Aditya Kakade, Vivek Srivastava, Shirish Karande

机构 * TCS Research, India(印度TCS研究)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 Polaris通过经验抽象策略修复实现小型语言模型的Gödel代理框架,通过分析、策略形成、抽象和最小代码修补实现策略更新,提升模型在多个基准测试中的表现。

Comments Accepted to ACL 2026 (Findings). 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24626 2026-06-24 cs.AI 新提交 57%

SAFARI: Scaling Long Horizon Agentic Fault Attribution via Active Investigation

SAFARI: 通过主动调查扩展长时域智能体故障归因

Chenyang Zhu, Jiayu Yao, Kushal Chawla, Youbing Yin, Nathan Wolfe, Pengshan Cai, Jingyu Wu, Spencer Hong, Sangwoo Cho, Shi-Xiong Zhang, Daben Liu, Sambit Sahu, Erin Babinsky

机构 * Department of Engineering Sciences(工程科学系) Applied Mathematics, Northwestern University(应用数学,西北大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出SAFARI框架,用工具增强的诊断循环替代线性上下文加载,结合短期记忆解耦诊断准确性与上下文限制,在Who&When和TRAIL GAIA数据集上分别提升20%和19%,并在超出上下文窗口5倍时保持0.58精度。

Comments Published at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23759 2026-06-24 cs.AR cs.AI cs.SE 新提交 57%

VeriPilot: An LLM-Powered Verilog Debugging Framework

VeriPilot:一个基于LLM的Verilog调试框架

Yihan Wang, Cheng Liu, Jiazheng Zhang, Lei Zhang, Long Cheng, Xiaowei Li, Huawei Li

机构 * State Key Lab of Processors, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所国家专用集成电路设计实验室) University of Chinese Academy of Sciences(中国科学院大学) North China Electric Power University(华北电力大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出VeriPilot框架,利用黄金参考模型和LLM实现细粒度Verilog调试,通过内部变量语义对齐和CDFG信号追踪定位并修复错误,在CVDP基准上将GPT-4o修复成功率从54.3%提升至85.71%。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03742 2026-06-24 cs.CL cs.DB 版本更新 57%

ErrorLLM: Modeling SQL Errors for Text-to-SQL Refinement

ErrorLLM: 为文本到SQL精炼建模SQL错误

Zijin Hong, Hao Chen, Zheng Yuan, Qinggang Zhang, Luyao Zhuang, Qing Liao, Feiran Huang, Yangqiu Song, Xiao Huang

机构 * The Hong Kong Polytechnic University(香港理工大学) City University of Macau(澳门城市大学) Jilin University(吉林大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Beihang University(北航大学)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.CL

AI总结 提出ErrorLLM框架,通过专用错误令牌和结构特征显式建模SQL错误,结合静态检测与错误引导精炼,显著提升文本到SQL生成质量。

Comments Accepted to SIGKDD2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06138 2026-06-24 cs.MM cs.AI cs.HC 版本更新 57%

Multimedia and Visual Analytics in the Agentic Era

代理时代的多媒体与可视化分析

Marcel Worring, Jan Zahálka, Stef van den Elzen, Maximilian T. Fischer, Daniel A. Keim

机构 * University of Amsterdam(阿姆斯特丹大学) Czech Technical University in Prague(布拉格捷克技术大学) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一个框架,将多媒体与可视化分析结合,以支持专业用户从大规模多媒体集合中获取可操作见解,实现人类与AI的真正协作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23107 2026-06-23 cs.CL 新提交 57%

A Dual-Track Framework for Template-Constrained LaTeX Conversion

双轨框架:模板约束下的LaTeX转换

Chung Cheuk Hei, Liu Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 提出双轨框架,通过离线提取模板约束与在线混合执行,将LLM用于推理密集型任务、规则引擎处理确定性任务,在7个模板和56篇论文上实现更高结构保真度和编译成功率。

Comments 6 pages (excluding references), 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21579 2026-06-23 cs.CV cs.AI 新提交 57%

The Unreasonable Effectiveness of VLMs for Zero-shot Procedural Mistake Detection

VLM在零样本程序性错误检测中的惊人有效性

Serdar Ozsoy, Lars Doorenbos, Federico Spurio, Gianpiero Francesca, Juergen Gall

机构 * University of Bonn(波恩大学) Toyota Motor Europe(丰田欧洲公司) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习和人工智能研究所)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出ZeProM框架,利用单个预训练VLM同时解决零样本程序性错误检测和时间动作分割,在EgoPER和CaptainCook4D基准上接近或超越全监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21553 2026-06-23 cs.CL cs.IR 新提交 57%

Dissecting Agentic RAG: A Component Ablation for Multi-Hop QA with a Local 7B Model

解析智能体RAG:基于本地7B模型的多跳问答组件消融研究

Sheroz Shaikh

机构 * Independent Researcher(独立研究员)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 通过消融实验,发现固定混合检索和短检索循环对多跳问答贡献最大,自适应路由和深度循环并非必要。

Comments 8 pages, 4 figures, 4 tables. Code: https://github.com/sherozshaikh/agentic-rag-eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20580 2026-06-23 cs.NI cs.AI 新提交 57%

Role-Based Agentic AI for Intent-Driven Network and Service Orchestration

基于角色的自主AI用于意图驱动的网络与服务编排

Juan Parra-Ullauri, Talha Ahmed Khan, Daniel McHugh, Shipra Kapoor, Alistair Duke, Alicia Hey, Andy Corston-Petrie

机构 * Research & Commercialisation, BT Group(BT集团研究与商业化部)

专题命中 复杂问题求解 :planning(abstract);分类 cs.AI

AI总结 提出一种基于角色的多智能体架构,通过分层代理系统实现从业务到网络的端到端意图编排,弥合BSS与OSS的鸿沟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20574 2026-06-23 cs.NI cs.AI 新提交 57%

LLM-assisted gNB Parameter Configuration for Radio Access Network

LLM辅助的无线接入网gNB参数配置

Yao-Cong Dong, Maria Amparo Canaveras Galdon, Ari Uskudar, Kuntal Chowdhury, Edwin K. P. Chong, Ray-Guang Cheng

机构 * Dept. of Electronic and Computer Engineering, National Taiwan University of Science and Technology, Taiwan(电子与计算机工程系,台湾科技大学) NVIDIA, USA(NVIDIA公司) Colorado State University, USA(科罗拉多州立大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出LLM辅助框架,通过合成数据生成和微调,自动从错误日志中生成正确的gNB参数配置,在OAI测试中准确率达92.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏