arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1676 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 1676 篇

2606.08357 2026-06-09 cs.CL 新提交 79%

Forward-Free Diffusion Language Models

无前向过程的扩散语言模型

Haotian Sun, Rushi Qiang, Yuqian Zheng, Bo Dai

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

AI总结 提出FReDA,一种无需人工设计前向过程的扩散语言模型,通过递归分布细化利用模型生成草稿作为隐式中间状态,在推理和编码任务上超越更大模型,并实现1.5-1.8倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07808 2026-06-09 cs.AI 新提交 79%

Where Instruction Hierarchy Breaks: Diagnosing and Repairing Failures in Reasoning Language Models

指令层级失效之处:诊断与修复推理语言模型的故障

Sanjay Kariyappa, G. Edward Suh

机构 * NVIDIA(英伟达)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 提出白盒诊断框架,将指令层级失效定位为指令识别、冲突解决和响应实现三个环节,并设计两种免训练自监控机制,将违规率降低81-99%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16627 2026-08-18 cs.CL cs.AI 新提交 79%

When Do Explanations Help In-Context Learning? A Comparative Study of Natural Language Explanation Types and Faithfulness

解释何时能帮助上下文学习?自然语言解释类型与忠实度的比较研究

Mahdi Dhaini, Adam Dejl, Juraj Vladika, Volkan Özer, Barbara Plank, Gjergji Kasneci

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Imperial College London(伦敦帝国学院) Technical University of Munich(慕尼黑工业大学) MaiNLP lab, CIS, LMU Munich(慕尼黑大学CIS研究所MaiNLP实验室)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.CL、cs.AI

AI总结 该研究通过在6个基准和4个指令调优模型上的比较评估,探究不同来源与选择方式的自然语言解释对上下文学习下游性能的影响,为实际提示流程中解释的选择和报告提供了见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16224 2026-08-18 cs.CL cs.AI 新提交 79%

STAIR: Semantic-Temporal Automaton for Interpretable Reasoning in Temporal Question Answering

STAIR:用于时间问答中可解释推理的语义-时间自动机

Xinlong Dai, Jinchuan Zhang, Lei Gao, Xinzhe Hu, Yuefeng He, Hui Gao

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本文提出STAIR语义-时间自动机,将语义解读与时间推理分离,规则优先设计减少自由推理,在多个时间问答数据集上优于基线,提升了F1值且可解释性更强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11994 2026-08-13 cs.AI cs.CL 新提交 79%

Claim-Level Reliability Assessment for Efficient Test-Time Reasoning

面向高效测试时推理的声明级可靠性评估

Sen Xu, Wei Wang, Shixi Liu, Jixin Min, Yingwei Dai, Zhibin Yin, Yirong Chen, Junlin Zhang

机构 * Sina Weibo Inc.(新浪微博公司)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究提出无需训练的CLR框架,将测试时计算从解决方案采样重分配至声明级语义证伪,在匹配预算下于四个LLM及四个推理基准上提升了推理性能,减少了标记使用量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09351 2026-08-11 cs.LG cs.AI stat.ML 新提交 79%

Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute

大语言模型的测试时增强:在计算资源匹配时输入多样性优于输出多样性

Nikita Kozodoi, Zainab Afolabi, Jack Butler

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出测试时增强(TTA),经匹配计算对比发现,中端大语言模型采用语义复述的TTA策略,比自洽性更高效地将计算转化为准确率,每美元准确率约为自洽性的1.8倍。

Comments Published at the COLM 2026 Workshop on Efficient Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06735 2026-08-10 cs.AI cs.CL 新提交 79%

IB-RL: Isolated Bilateral Reinforcement Learning for Strategic Dialogue Agents

IB-RL:用于策略性对话智能体的孤立双边强化学习

Senhao Wang, Chenghao Cai, Haitao Hu, Mingxing Huang, Xingguang Wang, Wenhao Li, Zecheng Lin

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对现有RL训练范式的静态对应智能体不匹配问题,提出IB-RL方法,在Vehicle TeleSales和Deal-or-NoDeal任务上较单边RL基线显著提升了策略对未见过对应智能体的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05802 2026-08-07 cs.CL cs.LG 新提交 79%

On-Policy Delta Distillation for Multilingual Math Reasoning

面向多语言数学推理的在线策略增量蒸馏

Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon Han

机构 * NAVER AI Lab(NAVER AI实验室)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.CL、cs.LG

AI总结 本研究针对多语言数学推理任务,提出OPD²方法,实验表明其在韩语、日语上性能提升显著,且能缩小英语与韩语的性能差距,凸显多语言数据的重要性。

Comments 9 pages, 3 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05139 2026-08-06 cs.CL cs.LG 新提交 79%

Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning

面向技能原生的大语言模型:用于基准测试和训练长程推理的技能熵

Yinghui He, Ling Yang, Jiarui Liu, Yongjin Yang, Lechen Zhang, Yingcheng Wu, Zhenfei Yin, Mengdi Wang, Sanjeev Arora

机构 * Princeton University(普林斯顿大学) Carnegie Mellon University(卡内基梅隆大学) University of Toronto(多伦多大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学) University of Oxford(牛津大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.LG

AI总结 该研究针对现有基准无法评估LLM跨技能长程推理能力的问题,提出Skill Entropy(技能熵)并构建Skill²-Bench基准,还开发Skill-Entropy RL训练框架,显著提升了Qwen3模型在该基准上的表现。

Comments https://github.com/Gen-Verse/Skill-Entropy-RL

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02833 2026-08-05 cs.CV cs.AI cs.CL 新提交 79%

CURV: Enhancing Chart Understanding Through Curriculum Visual Grounded Reasoning

CURV:通过课程可视化接地推理增强图表理解

Xuehang Guo, Pingyue Zhang, Ruiyi Zhang, Zhenhailong Wang, Hanrui Lyu, Heng Ji, Tong Sun, Qingyun Wang, Manling Li

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 针对多模态大语言模型视觉接地与推理不足的问题,提出CURV课程学习框架,结合CCQA数据集,在图表问答任务中实现显著性能提升并具备良好泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21552 2026-07-24 cs.AI cs.LG 新提交 79%

MIRROR: Learning from the Other View for Multi-Modal Reasoning

MIRROR:从其他视角学习以进行多模态推理

Wen Ye, Yuxiao Qu, Aviral Kumar, Xuezhe Ma

机构 * University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 研究视觉语言模型在几何问题多模态推理上的不足,构建ODA-Data数据集,提出模态感知互惠推理优化(MIRROR)方法,通过强化学习自我监督,提升多模态推理能力,在相关基准测试中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20268 2026-07-23 cs.AI cs.CL 新提交 79%

PoTRE: Test-Time Reasoning inspired by Cognitive Heterogeneity

PoTRE:受认知异质性启发的测试时推理

Anmol Kankariya, Sercan Ö. Arık

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型复杂推理难题,提出PoTRE异构框架,将推理解耦为四个智能体,经任务自适应聚合层协调,在三个前沿基准测试中评估,在HLE上达最优准确率,以相似或更少令牌提升推理性能。

Comments Accepted at Transactions on Machine Learning Research (TMLR 2026)

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19398 2026-07-23 cs.AI cs.CL 新提交 79%

HyGRL: Adaptive Hybrid Graph Reasoning for Multi-Entity Questions

HyGRL:用于多实体问题的自适应混合图推理

Junyi Wang

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对多实体组合问题,传统方法有局限。本文提出HyGRL框架,将文本嵌入知识图谱创建异构网络,通过模仿学习和强化学习进行自适应结构归纳推理,实验证明其在答案准确性、推理保真度等方面表现出色,成本低且推理快。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11892 2026-07-15 cs.CL cs.AI 新提交 79%

G-SHARE: A Guideline-Based Structured Reasoning Framework for Human-Factor Event Diagnosis

G-SHARE:一种基于指南的人为因素事件诊断结构化推理框架

Xingyu Xiao, Mao Du, Jiejuan Tong, Jingang Liang, Haitao Wang

机构 * Institute of Nuclear and New Energy Technology, Tsinghua University(清华大学核能与新能源技术研究院) National Key Laboratory of Human Factors Engineering(人因工程重点实验室) Fujian Fuqing Nuclear Power Co., Ltd.(福建福清核电有限公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究针对核电站人为因素事件诊断问题,提出基于指南的结构化推理框架G-SHARE,将诊断指南转化为多阶段流程,含证据提取等步骤。通过构建数据集评估,其性能显著优于基线,证明了转化专家指南为推理流程对安全关键行业智能分析的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07858 2026-07-10 cs.AI cs.LG 新提交 79%

Agentic AI and Retrieval-Augmented Models in Straight-Through Underwriting

直通式承保中的智能体人工智能与检索增强模型

Robert Richardson, Josh Meyers, Brian Hartman, David Sandberg

机构 * Brigham Young University

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究人工智能在精算实践中的应用,开发用于小型商业企业主保单直通式承保的智能体人工智能框架,通过构建实验环境比较三条承保管道,发现智能体系统总体表现最佳,在特定场景中优势明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06855 2026-07-09 cs.LG cs.CL 新提交 79%

Geometric Self-Distillation for Reasoning Generalization

用于推理泛化的几何自蒸馏

Josip Jukić, Ivan Titov

机构 * ILLC, University of Amsterdam(阿姆斯特丹大学伊利沙伯格学院) ILCC, University of Edinburgh(爱丁堡大学伊利沙伯格中心)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 研究针对大语言模型特权上下文自蒸馏中监督难以信赖、导致分布外推理能力下降的问题,提出几何自蒸馏目标GeoSD,通过Hellinger损失和近端项对抗漂移,提升了模型分布外推理准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05001 2026-07-08 cs.CR cs.AI cs.LG cs.MA 新提交 79%

TACTIC-KG: Toward Small Agent Teams for Cyber Threat Intelligence Knowledge Graph Construction

TACTIC-KG:面向网络威胁情报知识图谱构建的小型智能体团队

Mouhamed Amine Bouchiha, Gregory Blanc

机构 * SAMOVAR, Télécom SudParis, Institut Polytechnique de Paris(SAMOVAR, Telecom SudParis, Institute of Paris Polytechnic)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对网络威胁情报报告构建知识图谱的问题,提出TACTIC-KG框架,将任务分解给模块化专业语言模型智能体,用轻量级模型提升性能并降低成本,实验表明优于整体式模型。

Comments 20 pages, 2 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03065 2026-07-07 cs.LG cs.AI 新提交 79%

Spectral Rewiring for Exploration, Purification, and Model Merging

用于探索、提纯和模型合并的频谱重布线

Zhilong Zhang, Hongli Yu, Huan-ang Gao, Hanlin Wu, Yuxuan Song, Wei-Ying Ma, Ya-Qin Zhang, Hao Zhou

机构 * SIA-Lab of Tsinghua AIR(清华-字节跳动联合研究中心SIA实验室) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 研究强化学习中参数更新瓶颈,提出子空间对齐重布线方法,保留频谱核心去除正交分量,可提纯训练更新、实现模型合并,提升推理和跨域性能,是无训练机制提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02345 2026-07-03 cs.SE cs.AI cs.CL 新提交 79%

SkillFuzz: Fuzzing Skill Composition for Implicit Intents Discovery in Open Skill Marketplaces

SkillFuzz: 面向开放技能市场中隐式意图发现的技能组合模糊测试

Jinwei Hu, Yi Dong, Youcheng Sun, Xiaowei Huang

机构 * School of Computer Science and Informatics, University of Liverpool(利物浦大学计算机科学与信息学学院) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出SkillFuzz,首个无需执行的模糊测试方法,通过提取结构化技能契约并利用契约引导的蒙特卡洛树搜索,在开放技能市场中高效发现因技能组合导致的隐式意图,验证了80%以上高风险组合。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30989 2026-07-01 cs.CL cs.AI 新提交 79%

Wait, am I Being Fair? Characterizing Deductive Stereotyping and Mitigating It with Fair-GCG

等等,我公平吗?刻画演绎刻板印象并用 Fair-GCG 缓解它

Naihao Deng, Yilun Zhu, Joan Nwatu, Clayton Scott, Rada Mihalcea

机构 * University of Michigan(密歇根大学)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文识别出大语言模型中的演绎刻板印象失败模式,提供统计解释,并提出推理时注入框架 Fair-GCG 以发现有效短语,提升多个公平性基准的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26986 2026-06-26 cs.CL cs.AI 新提交 79%

ReaORE: Reasoning-Guided Progressive Open Relation Extraction Empowered by Large Reasoning Models

ReaORE: 基于大推理模型的推理引导渐进式开放关系抽取

Xin Lin, Liang Zhang, Guoqi Ma, Hongyao Tu, Jinsong Su

机构 * National Institute for Data Science in Health and Medicine, Xiamen University(厦门大学健康医疗大数据国家研究院) School of Informatics, Xiamen University(厦门大学信息学院)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出ReaORE框架,通过粗到细的关系推理(关系过滤与关系预测)解决开放关系抽取中关系标签生成和易混淆关系区分难题,在数据集上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25832 2026-06-26 cs.LG cs.AI 新提交 79%

MiniOpt: Reasoning to Model and Solve General Optimization Problems with Limited Resources

MiniOpt: 在有限资源下推理建模与求解通用优化问题

Ke Zhao, Zixiang Di, Hong Qian, Xiang Shu, Yaolin Wen, Qitao Shi, Bingdong Li, Xingyu Lu, Xiangfeng Wang, Jun Zhou, Ke Tang, Yang Yu

机构 * East China Normal University(华东师范大学) AntGroup(蚂蚁集团) Southern University of Science and Technology(南方科技大学) Nanjing University(南京大学)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出MiniOpt强化学习框架,通过“推理-建模-求解”范式,结合层次化奖励函数OptReward和优化导向策略优化,使3B参数模型在多种优化问题上达到强泛化,且训练资源需求低。

Comments 20 pages, 9 figures, 11 tables, project: https://github.com/Hsiang-1/MiniOpt

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23196 2026-06-23 cs.CL cs.AI 新提交 79%

When Does Intrinsic Self-Correction Help? A Task-Sensitive Analysis

内在自我纠正何时有效?一项任务敏感分析

Elroy Stav, Dvir Berlowitz, Maayan Orner, Sarit Kraus

机构 * Bar-Ilan University(巴伊兰大学) Independent Researcher(独立研究员)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究采用任务敏感视角分析内在自我纠正(SC),发现当任务结构支持验证约束、重新审视推理或提供第二意见时,SC能带来一致性能提升,表明其有效性取决于任务类型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17478 2026-06-17 cs.CL cs.AI 新提交 79%

Decoding Hidden Deception in Reasoning LLMs: Activation Explainers for Deception Auditing

解码推理型LLM中的隐藏欺骗:用于欺骗审计的激活解释器

Kexin Chen, Yi Liu, Haonan Zhang, Yanhui Li, Xinyu Deng, Dongxia Wang

机构 * Zhejiang University(浙江大学) Griffith University(格里菲斯大学)

专题命中 推理与问题求解 :LLM(title_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出STATEWITNESS,一种通过解码目标模型隐藏状态来生成自然语言查询答案和结构化报告的激活解释器,在欺骗检测中平均AUROC达0.916,优于现有方法。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16934 2026-06-16 cs.CL cs.LG 新提交 79%

Exploring Extrinsic and Intrinsic Properties for Effective Reasoning with Code Interpreter

探索代码解释器有效推理的外在属性与内在属性

Patomporn Payoungkhamdee, Napat Laosaengpha, Jenta Wonglertsakul, Pittawat Taveekitworachai, Pume Tuchinda, Panjapong Poobanchuen, Ekapol Chuangsuwanich, Can Udomcharoenchaikit, Samuel Cahyawijaya, Peerat Limkonchotiwat, Sarana Nutanong

机构 * Vidyasirimedhi Institute of Science and Technology(维达亚希米科技学院) Kasetsart University(科琼大学) SCB 10X King Mongkut’s University of Technology Thonburi(朱拉隆功技术大学泰竹分校) Department of Computer Engineering Chulalongkorn Univesity(朱拉隆功大学计算机工程系) Cohere AI Singapore(AI新加坡)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文从外在属性(关键token)和内在属性(代码特定认知行为)两个角度研究代码解释器推理,发现强模型更频繁出现关键token和验证、回溯等行为,并利用这些属性在推理和训练中提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15866 2026-06-16 cs.AI cs.LG 新提交 79%

STRIDE: Strategic Trajectory Reasoning via Discriminative Estimation for Verifiable Reinforcement Learning

STRIDE: 通过判别估计进行策略轨迹推理以实现可验证强化学习

Qinjian Zhao, Zhihao Dou, Dinggen Zhang, Xiangyu Li, Chaoda Song, Zhongwei Wan, Xinpeng Li, Yanyan Zhang, Kaijie Chen, Qingtao Pan, Chengcheng Feng, Zhiqiang Gao, Xiaoyu Xia

机构 * Kean University(基恩大学) Case Western Reserve University(凯斯西储大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) The Ohio State University(俄亥俄州立大学) Tongji University(同济大学) Duke Kunshan University(昆山杜克大学) Royal Melbourne Institute of Technology(皇家墨尔本理工大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 提出STRIDE框架,通过对比成功与失败轨迹估计n-gram策略模式的判别偏好,结合推理显著性熵识别关键策略模式,实现细粒度信用分配,提升可验证强化学习的推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08239 2026-06-09 cs.AI cs.CL cs.CV 新提交 79%

When No Answer Is Correct: Diagnosing Absent Answer Detection for MLLMs in Video Understanding

当没有正确答案时:诊断视频理解中多模态大语言模型的缺失答案检测

Yiheng Wang, Yueqian Lin, Lichen Zhu, Yudong Liu, Hai "Helen" Li, Yiran Chen

机构 * Duke University(杜克大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究多模态大语言模型在视频理解中检测缺失答案的能力,发现模型倾向于选择干扰项而非识别无正确答案,时间推理任务中问题更严重,链式思维提示虽提升检测率但仍不理想。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20318 2026-08-21 cs.AI cs.CL cs.LG 新提交 78%

AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement

AI4AI-Bench:用于递归自我改进算法设计中大语言模型智能体的基准测试

Yizhe Chi, Wenyi Li, Deyao Hong, Xiaoqiu Wang, Mingju Gao, Kaisen Yang, Bingxiang He, Youjie Zheng, Calvin Xiao, Qinhuai Na

机构 * Navers Lab(Navers实验室) Tsinghua University(清华大学)

专题命中 推理与问题求解 :LLM(title);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出AI4AI-Bench基准测试,测试大语言模型智能体设计训练算法的能力,实验显示现有智能体仅缩小了已有算法与最优值间不到五分之一的差距,发布相关资源供重复测量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18734 2026-08-20 cs.CV 新提交 78%

CL4D: Contrastive Language-4D Pretraining for Vision-Language Reasoning in Dynamic Scenes

CL4D:用于动态场景视觉-语言推理的对比语言-4D预训练

Kumal Hewagamage, Isuranga Senavirathne, Sasika Amarasinghe, Hasitha Gallella, Dulanga Weerakoon, Vigneshwaran Subbaraju, Ranga Rodrigo

机构 * University of Moratuwa(莫拉图瓦大学) Singapore-MIT Alliance for Research & Technology (SMART) Centre(新加坡-麻省理工研究与技术联盟(SMART)中心) Agency for Science, Technology and Research (A*STAR)(新加坡科学、技术与研究局(A*STAR))

专题命中 推理与问题求解 :pretraining(title);language model(abstract)

AI总结 本研究提出CL4D(首个4D视觉编码器)及基于其的4DVLM,在自建DynAction4D数据集上训练,CL4D性能较现有方法提升约16.75%,4DVLM优于Gemini、GPT-5等前沿视频VLM。

Comments Accepted at the 19th European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17146 2026-08-19 cs.RO 新提交 78%

PDDL-ART: Autonomous Symbolic Abstraction From Demonstration For Long-Horizon Robotic Manipulation Using Vision-Language Models

PDDL-ART:基于演示的自主符号抽象方法,用于使用视觉语言模型的长时程机器人操纵

Disha Kamale, Dmitry Berenson

机构 * University of Michigan(密歇根大学)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 PDDL-ART是一种基于VLM的框架,可自主从演示生成PDDL描述,经多阶段校正确保语义对齐,在发动机维护和家庭操纵任务上平均成功率达93.3%,优于基线规划器。

详情

展开后加载摘要…

URL PDF HTML 收藏