arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-10 至 2026-02-10 共收录 48 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 48 篇

2505.23126 2026-02-10 cs.CL 85%

PBEBench: A Multi-Step Programming by Examples Reasoning Benchmark inspired by Historical Linguistics

PBEBench: 一个受历史语言学启发的多步编程-by-例子推理基准

Atharva Naik, Prakam, Yash Mathur, Darsh Agrawal, Manav Kapadnis, Yuwei An, Clayton Marr, Carolyn Rose, David Mortensen

机构 * Carnegie Mellon University(卡内基梅隆大学) Ohio State University(俄亥俄州立大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);test-time compute(abstract);分类 cs.CL

AI总结 PBEBench是一个受历史语言学启发的多步编程-by-例子推理基准,用于评估LLMs的归纳推理能力,发现模型在复杂任务中的表现存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08588 2026-02-10 cs.DB 85%

MMTS-BENCH: A Comprehensive Benchmark for Time Series Understanding and Reasoning

MMTS-BENCH: 一个全面的时间序列理解和推理基准

Yao Yin, Zhenyu Xiao, Musheng Li, Yiwen Liu, Sutong Nan, Yiting He, Ruiqi Wang, Zhenwei Zhang, Qingmin Liao, Yuantao Gu

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 MMTS-BENCH通过多模态基准评估大语言模型在时间序列理解与推理中的表现,揭示了TS-LLMs在跨领域泛化和多模态整合方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07833 2026-02-10 cs.CV cs.AI cs.CL 84%

SPD-Faith Bench: Diagnosing and Improving Faithfulness in Chain-of-Thought for Multimodal Large Language Models

SPD-Faith Bench: 诊断和改进多模态大语言模型中的推理忠实性

Weijiang Lv, Yaoxuan Feng, Xiaobo Xia, Jiayu Wang, Yan Jing, Wenchao Chen, Bo Chen

机构 * Xidian University(西安电子科技大学) National University of Singapore(新加坡国立大学) Xi’an Jiaotong University(西安交通大学)

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 SPD-Faith Bench通过细粒度图像差异推理诊断并改进多模态大语言模型中的推理忠实性,揭示了感知盲区和感知-推理脱节的系统性失败模式,并提出SAGE框架提升视觉路由和推理与感知的一致性。

Comments 53 pages, 42 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07625 2026-02-10 cs.CV cs.AI 83%

AD-MIR: Bridging the Gap from Perception to Persuasion in Advertising Video Understanding via Structured Reasoning

AD-MIR:通过结构化推理弥合从感知到说服的广告视频理解鸿沟

Binxiao Xu, Junyu Feng, Xiaopeng Lin, Haodong Li, Zhiyuan Feng, Bohan Zeng, Shaolin Lu, Ming Lu, Qi She, Wentao Zhang

机构 * Peking University, Beijing, China(北京大学) Tsinghua University, Beijing, China(清华大学) Xi'an Jiaotong University, Xi'an, China(西安交通大学) South China University of Technology, Guangzhou, China(华南理工大学)

专题命中 推理评测 :reasoning(title,abstract);self-correction(abstract);分类 cs.AI

AI总结 AD-MIR通过结构化推理框架,结合语义检索与精确关键词匹配,有效解码广告意图,提升广告视频理解的准确性与说服策略分析能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08382 2026-02-10 cs.CL cs.AI 81%

Dynamic Long Context Reasoning over Compressed Memory via End-to-End Reinforcement Learning

通过端到端强化学习实现压缩内存中的动态长上下文推理

Zhuoen Chen, Dongfang Li, Meishan Zhang, Baotian Hu, Min Zhang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于端到端强化学习的框架,通过分块压缩和选择性记忆回溯实现高效长上下文推理,提升了多跳推理任务的准确性和效率。

Comments 26 pages, 7 figures. Code and models will be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20694 2026-02-10 cs.AI astro-ph.SR cs.LG physics.space-ph 81%

Reasoning With a Star: A Heliophysics Dataset and Benchmark for Agentic Scientific Reasoning

用恒星进行推理:一个用于代理科学推理的太阳物理数据集和基准

Kevin Lee, Russell Spiewak, James Walsh

机构 * Frontier Development Lab(前沿发展实验室) Department of Mechanical and Aerospace Engineering, UCLA(机械与航空航天工程系,加州大学洛杉矶分校) Trillium Technologies Inc.(Trillium技术公司) Department of Engineering, University of Cambridge(工程系,剑桥大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究提出一个太阳物理数据集和基准,用于评估代理在科学推理中的表现,发现系统工程原则在演绎推理任务中优于直接提示方法。

Comments Accepted at NeurIPS 2025 Machine Learning and the Physical Sciences (ML4PS) Workshop. Dataset: https://huggingface.co/datasets/SpaceML/ReasoningWithAStar

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07820 2026-02-10 cs.AI cs.CL 81%

Certainty-Guided Reasoning in Large Language Models: A Dynamic Thinking Budget Approach

在大语言模型中的确定性引导推理:一种动态思维预算方法

João Paulo Nogueira, Wentao Sun, Alonso Silva, Laith Zumot

机构 * Nokia Bell Labs, France(诺基亚贝尔实验室,法国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 CGR通过动态调整推理预算,在保持准确性的同时减少token使用,通过确定性评估实现高效的推理过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15487 2026-02-10 cs.CL cs.AI 81%

ExpliCa: Evaluating Explicit Causal Reasoning in Large Language Models

ExpliCa:评估大型语言模型中的显式因果推理

Martina Miliani, Serena Auriemma, Alessandro Bondielli, Emmanuele Chersoni, Lucia Passaro, Irene Sucameli, Alessandro Lenci

机构 * CoLing Lab, Department of Philology, Literature, and Linguistics, University of Pisa, Italy(皮尔森大学哲学、文学与语言学系协作语言实验室) Department of Informatics, University of Pisa, Italy(皮尔森大学信息学系) Department of Chinese and Bilingual Studies, The Hong Kong Polytechnic University(香港理工大学中文与双语研究系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 ExpliCa数据集用于评估大型语言模型在显式因果推理中的能力,发现顶级模型在准确率上仍存在显著不足,且模型性能受语言顺序和大小影响明显。

Comments Accepted for publication in Findings of ACL 2025

Journal ref In Findings of the Association for Computational Linguistics: ACL 2025, pages 17335-17355, Vienna, Austria. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11239 2026-02-10 cs.AI cs.CL 81%

Nondeterministic Polynomial-time Problem Challenge: An Ever-Scaling Reasoning Benchmark for LLMs

非确定多项式时间问题挑战:为大语言模型构建的持续扩展推理基准

Chang Yang, Ruiyu Wang, Junzhe Jiang, Qi Jiang, Qinggang Zhang, Yanchen Deng, Shuxin Li, Shuyue Hu, Bo Li, Florian T. Pokorny, Xiao Huang, Xinrun Wang

机构 * The Hong Kong Polytechnic University(香港理工大学) KTH Royal Institute of Technology(皇家理工学院) Carnegie Mellon University(卡内基梅隆大学) Nanyang Technological University(南洋理工大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Singapore Management University(新加坡管理学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 NPPC是一个持续扩展的推理基准,通过三个模块评估LLMs的推理能力,揭示其性能极限和改进方向。

Comments Accepted to TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08675 2026-02-10 cs.NI cs.AI 79%

6G-Bench: An Open Benchmark for Semantic Communication and Network-Level Reasoning with Foundation Models in AI-Native 6G Networks

6G-Bench:面向AI原生6G网络的语义通信与网络级推理开放基准

Mohamed Amine Ferrag, Abderrahmane Lakas, Merouane Debbah

机构 * Department of Computer and Network Engineering, United Arab Emirates University, UAE(计算机与网络工程系,阿拉伯联合酋长国大学) G Research Center (6GRC), Khalifa University, UAE(6G研究中心(6GRC),哈利法大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 6G-Bench通过开放基准评估AI原生6G网络中的语义通信与网络级推理能力,涵盖22种基础模型,揭示了不同模型在语义推理上的显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18715 2026-02-10 cs.AI 79%

HuggingR$^{4}$: A Progressive Reasoning Framework for Discovering Optimal Model Companions

HuggingR$^{4}$: 一种用于发现最优模型伙伴的渐进推理框架

Shaoyin Ma, Chenggong Hu, Huiqiong Wang, Li Sun, Mingli Song, Jie Song

机构 * Zhejiang University, Hangzhou, China(浙江大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 HuggingR$^4$通过渐进推理框架提升模型选择效率,实现更高的可行性与合理性,同时降低token消耗。

Comments 21 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22443 2026-02-10 cs.CL 79%

Accounting Reasoning in Large Language Models: Concepts, Evaluation, and Empirical Analysis

在大型语言模型中进行会计推理:概念、评估与实证分析

Jie Zhou, Xin Chen, Jie Zhang, Zhe Li

机构 * School of Computer Engineering, Jiangsu Ocean University(计算机工程学院,江苏海洋大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文研究了会计推理的概念、评估方法及实证分析,发现GPT-4在会计推理任务中表现最佳,但现有LLMs仍需优化以满足实际应用需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12081 2026-02-10 cs.CV 78%

VisionReasoner: Unified Reasoning-Integrated Visual Perception via Reinforcement Learning

VisionReasoner: 通过强化学习实现统一的推理集成视觉感知

Yuqi Liu, Tianyuan Qu, Zhisheng Zhong, Bohao Peng, Shu Liu, Bei Yu, Jiaya Jia

机构 * CUHK(香港中文大学) SmartMore(SmartMore公司) HKUST(香港理工大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 VisionReasoner通过强化学习实现统一的推理集成视觉感知,其在检测、分割和计数任务中均取得优于基线模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08057 2026-02-10 cs.CV cs.AI 77%

Weak to Strong: VLM-Based Pseudo-Labeling as a Weakly Supervised Training Strategy in Multimodal Video-based Hidden Emotion Understanding Tasks

弱到强:基于VLM的伪标签作为多模态视频隐藏情绪理解任务中的弱监督训练策略

Yufei Wang, Haixu Liu, Tianxiang Xu, Chuancheng Shi, Hongsheng Xing

机构 * The University of New South Wales, Sydney, New South Wales, Australia(新南威尔士大学) The University of Sydney, Sydney, New South Wales, Australia(悉尼大学) School of Software and Microelectronics, Peking University, Zibo, Shandong, China(北京大学软件与微电子学院) Shandong University of Technology, Beijing, China(山东理工大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出基于VLM的伪标签弱监督方法,用于多模态视频隐藏情绪识别,提升准确率至0.69并建立新基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07978 2026-02-10 cs.CL 77%

Cross-Linguistic Persona-Driven Data Synthesis for Robust Multimodal Cognitive Decline Detection

跨语言人格驱动的数据合成用于鲁棒多模态认知衰退检测

Rui Feng, Zhiyao Luo, Liuyu Wu, Wei Wang, Yuting Song, Yong Liu, Kok Pin Ng, Jianqing Li, Xingyao Wang

机构 * Engineering Research Center of Intelligent Theranostics Technology and Instruments, Ministry of Education, School of Biomedical Engineering and Informatics, Nanjing Medical University(智能诊疗技术与仪器工程研究中心、教育部、生物医学工程与信息学院、南京医科大学) Institute of Biomedical Engineering, University of Oxford(生物医学工程研究所、牛津大学) Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR)(高性能计算研究所、科技研究局(A*STAR)) Department of Neurology, National Neuroscience Institute, Singapore, 308433, Singapore(神经病学部、新加坡国家神经科学研究所) Duke-NUS Medical School, Singapore, 169857, Singapore(新加坡国立大学医学院)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 SynCog通过跨语言人格驱动数据合成与推理链微调,提升多模态模型在认知衰退检测中的诊断性能和跨语言泛化能力。

Comments 18 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07054 2026-02-10 cs.LG cs.CV cs.HC 74%

AVERE: Improving Audiovisual Emotion Reasoning with Preference Optimization

AVERE: 通过偏好优化提升音频视觉情感推理

Ashutosh Chaubey, Jiacheng Pang, Maksim Siniukov, Mohammad Soleymani

专题命中 推理评测 :reasoning(title);分类 cs.LG

AI总结 AVERE通过偏好优化技术提升音频视觉情感推理性能,解决情感与无关线索的虚假关联和幻觉问题,提升多模态模型在情感理解中的表现。

Comments Accepted as a conference paper at ICLR 2026. Project page: https://avere-iclr.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08369 2026-02-10 cs.AI cs.CL cs.LG 67%

MemAdapter: Fast Alignment across Agent Memory Paradigms via Generative Subgraph Retrieval

MemAdapter:通过生成子图检索实现跨代理记忆范式的快速对齐

Xin Zhang, Kailai Yang, Chenyue Li, Hao Li, Qiyu Wei, Jun'ichi Tsujii, Sophia Ananiadou

机构 * The University of Manchester(曼彻斯特大学) Stanford University(斯坦福大学) Imperial College London(伦敦帝国理工学院) National Institute of Advanced Industrial Science(国家先进工业科学与技术研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MemAdapter通过生成子图检索实现跨代理记忆范式的快速对齐,提升记忆检索灵活性并降低对齐成本,实验显示其性能优于现有系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08266 2026-02-10 cs.LG cs.AI cs.CL cs.CV cs.IR 67%

Benchmarking Large Language Models for Geolocating Colonial Virginia Land Grants

对殖民弗吉尼亚土地授予进行大规模语言模型评估

Ryan Mioduski

机构 * Independent Researcher(独立研究者)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究评估了大规模语言模型在将殖民弗吉尼亚土地授予描述转换为地理坐标方面的性能,发现模型在准确性与成本效益上表现优异。

Journal ref Journal of Spatial Information Science, No. 31 (2025), pp. 57-96

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07642 2026-02-10 cs.AI cs.LG 62%

Efficient Table Retrieval and Understanding with Multimodal Large Language Models

基于多模态大语言模型的高效表格检索与理解

Zhuoyan Xu, Haoyang Fang, Boran Han, Bonan Min, Bernie Wang, Cuixiong Hu, Shuai Zhang

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) AWS(亚马逊网络服务)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 TabRAG通过多模态大语言模型实现高效表格检索与理解,显著提升检索召回率和答案准确率。

Comments Published at EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07422 2026-02-10 cs.CR cs.AI cs.CL 62%

Secure Code Generation via Online Reinforcement Learning with Vulnerability Reward Model

通过在线强化学习与漏洞奖励模型实现安全代码生成

Tianyi Wu, Mingzhe Du, Yue Liu, Chengran Yang, Terry Yue Zhuo, Jiaheng Zhang, See-Kiong Ng

机构 * National University of Singapore(国立新加坡大学) Singapore Management University(新加坡管理学院) Nanyang Technological University(南洋理工大学) Monash University(墨尔本大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 SecCoderX通过在线强化学习与漏洞奖励模型提升代码安全性,实现功能与安全性的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08487 2026-02-10 cs.CL cs.AI 62%

Beyond Bias Scores: Unmasking Vacuous Neutrality in Small Language Models

超越偏见分数:揭示小型语言模型中的空洞中性

Sumanth Manduru, Carlotta Domeniconi

机构 * George Mason University(乔治·马歇尔大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出空洞中性框架,评估小型语言模型的公平性与鲁棒性,揭示其在不同社会偏见类别中的隐藏漏洞。

Comments Accepted at EACL 2026 Student Research Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03444 2026-02-10 cs.CL cs.AI 62%

Taxation Perspectives from Large Language Models: A Case Study on Additional Tax Penalties

大语言模型的税收视角:关于附加税收罚金的案例研究

Eunkyung Choi, Youngjin Suh, Siun Lee, Hongseok Oh, Juheon Kang, Won Hur, Hun Park, Wonseok Hwang

机构 * University of Seoul(首尔大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨大语言模型在税收领域的能力,通过PLAT基准测试发现其在复杂法律推理任务中表现有限。

Comments 9 pages

Journal ref EACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06975 2026-02-10 cs.CL cs.AI 62%

BiomechAgent: AI-Assisted Biomechanical Analysis Through Code-Generating Agents

BiomechAgent: 通过代码生成代理实现AI辅助的生物力学分析

R. James Cotton, Thomas Leonard

机构 * Shirley Ryan AbilityLab Northwestern University(Shirley Ryan AbilityLab 北卡罗来纳大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 BiomechAgent通过自然语言和代码生成技术,使无标记运动捕捉数据的生物力学分析更易被非编程用户使用,提升临床应用的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08872 2026-02-10 cs.CL cs.IR 57%

Large Language Models for Geolocation Extraction in Humanitarian Crisis Response

大型语言模型在人道主义危机响应中的地理信息提取

G. Cafferata, T. Demarco, K. Kalimeri, Y. Mejova, M. G. Beiró

机构 * Universidad de San Andrés Victoria(圣安德烈斯大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出基于LLM的两步框架,通过结合命名实体识别和上下文地理编码模块,提升人道主义文档中地理信息提取的精度与公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08716 2026-02-10 cs.CL 57%

PERSPECTRA: A Scalable and Configurable Pluralist Benchmark of Perspectives from Arguments

PERSPECTRA: 一种可扩展且可配置的多元视角论证基准

Shangrui Nie, Kian Omoomi, Lucie Flek, Zhixue Zhao, Charles Welch

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 PERSPECTRA提出了一种结合结构清晰与语义多样性的多元视角论证基准,用于评估模型在处理多个视角时的表示、区分与推理能力。

Comments 15 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08342 2026-02-10 cs.CV cs.AI 57%

UrbanGraphEmbeddings: Learning and Evaluating Spatially Grounded Multimodal Embeddings for Urban Science

UrbanGraphEmbeddings: 学习和评估空间导向的多模态嵌入用于城市科学

Jie Zhang, Xingtong Yu, Yuan Fang, Rudi Stouffs, Zdravko Trivic

机构 * National University of Singapore Department of Architecture Singapore The Chinese University of Hong Kong Dept of Systems Eng. \& Eng. Mgmt. China Singapore Management University School of Computing \& Info. Systems Singapore National University of Singapore Department of Architecture The Chinese University of Hong Kong Singapore Management University

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出UGE框架,通过空间导向的多模态嵌入提升城市理解任务性能,实验显示在图像检索和地理位置排名上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08311 2026-02-10 cs.AI 57%

Moral Sycophancy in Vision Language Models

视觉语言模型中的道德趋炎奉承

Shadman Rabby, Md. Hefzul Hossain Papon, Sabbir Ahmed, Nokimul Hasan Arif, A. B. M. Ashikur Rahman, Irfan Ahmad

机构 * University of Dhaka(达卡大学) Daffodil International University(达福迪国际大学) Islamic University of Technology(伊斯兰技术大学) University of Central Florida(佛罗里达中央大学) King Fahad University of Petroleum and Minerals(国王法赫德石油与矿物大学) SDAIA - KFUPM Joint research Center for Artificial Intelligence(SDAIA-KFUPM人工智能联合研究中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了视觉语言模型在道德决策中的趋炎奉承现象,发现模型在用户偏见下易产生道德错误回应,揭示了模型在伦理一致性与稳健性上的权衡问题。

Comments 13 pages, 6 figures, 8 tables, Submitted for review in ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08305 2026-02-10 cs.CL 57%

JUSTICE: Judicial Unified Synthesis Through Intermediate Conclusion Emulation for Automated Judgment Document Generation

JUSTICE: 通过中间结论模拟实现司法统一合成以生成自动判决文件

Binglin Wu, Yingyi Zhang, Xiannneg Li

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 JUSTICE通过模拟预判过程提升判决书生成的法律准确性和连贯性

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03219 2026-02-10 cs.AI 57%

Beyond Quantity: Trajectory Diversity Scaling for Code Agents

超越数量:代码代理的轨迹多样性扩展

Guhong Chen, Chenghao Sun, Cheng Fu, Qiyao Wang, Zhihong Huang, Chaopeng Wei, Guangxu Chen, Feiteng Fang, Ahmadreza Argha, Bing Zhao, Xander Xu, Qi Han, Hamid Alinejad-Rokny, Qiang Qu, Binhua Li, Shiwen Ni, Min Yang, Hu Wei, Yongbin Li

机构 * SIAT, CAS(中国科学院软件研究所) Alibaba Group(阿里巴巴集团) UNSW Sydney(新南威尔士大学悉尼分校) SUAT(上海大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 TDScaling通过提升轨迹多样性而非单纯增加数据量,优化代码代理训练的性能-成本平衡,提升工具使用泛化和编码能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04094 2026-02-10 cs.LG 57%

KoTaP: A Panel Dataset for Corporate Tax Avoidance, Performance, and Governance in Korea

KoTaP:韩国企业税务避税、绩效与治理的面板数据集

Hyungjong Na, Wonho Song, Seungyong Han, Donghyeon Jo, Sejin Myung, Hyungjoon Kim

专题命中 推理评测 :planning(abstract);分类 cs.LG

AI总结 KoTaP是一个涵盖韩国非金融企业的长期面板数据集,用于研究税务避税、绩效和治理,提供标准化变量和国际可比性,支持经济计量、AI分析和政策研究。

Comments 18 pages, 3 figures, 8 tables. Submitted to Scientific Data; currently under review. Data and codebook available at Zenodo (DOI: 10.5281/zenodo.17149808)

详情

展开后加载摘要…

URL PDF HTML 收藏