arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-06 至 2026-01-06 共收录 108 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 18 篇

2505.12752 2026-01-06 cs.RO 50%

MOON: Multi-Objective Optimization-Driven Object-Goal Navigation Using a Variable-Horizon Set-Orienteering Planner

MOON:基于多目标优化的物体-目标导航变量视距集导向规划器

Daigo Nakajima, Kanji Tanaka, Daiki Iwata, Kouki Terashima

机构 * University of Fukui(福井大学)

专题命中 规划推理 :planning(abstract)

AI总结 MOON通过多目标优化解决大规模复杂环境中的导航问题,结合可变视距集导向规划和高效神经规划器,提升全局规划与实时决策效率。

Comments 9 pages, 7 figures, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01416 2026-01-06 cs.CV 50%

AirSpatialBot: A Spatially-Aware Aerial Agent for Fine-Grained Vehicle Attribute Recognization and Retrieval

AirSpatialBot: 一种空间感知的空中智能体用于细粒度车辆属性识别与检索

Yue Zhou, Ran Ding, Xue Yang, Xue Jiang, Xingzhao Liu

机构 * Department of Electronic Engineering, Shanghai Jiao Tong University(电子工程系,上海交通大学) Department of Automation, Shanghai Jiao Tong University(自动化系,上海交通大学)

专题命中 规划推理 :planning(abstract)

AI总结 AirSpatialBot通过空间感知的VLM和两阶段训练策略,实现细粒度车辆属性识别与检索,解决遥感图像中的空间理解难题。

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01196 2026-01-06 cs.RO 50%

EduSim-LLM: An Educational Platform Integrating Large Language Models and Robotic Simulation for Beginners

EduSim-LLM: 一个整合大语言模型和机器人模拟的教育平台,用于初学者

Shenqi Lu, Liangwei Zhang

机构 * Hangzhou Dianzi University Information Engineering College(杭州电子科技大学信息工程学院)

专题命中 规划推理 :planning(abstract)

AI总结 EduSim-LLM通过整合大语言模型与机器人模拟,实现自然语言到机器人行为的转换,提升初学者在人机交互和多机器人协作中的控制与操作能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01139 2026-01-06 cs.RO cs.MA 50%

Latent Space Reinforcement Learning for Multi-Robot Exploration

潜在空间强化学习用于多机器人探索

Sriram Rajasekar, Ashwini Ratnoo

机构 * Department of Aerospace Engineering(航空航天工程系) Indian Institute of Science(印度科学研究所)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出利用潜在空间强化学习,通过自编码器和过程生成算法提升多机器人探索效率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00922 2026-01-06 eess.IV cs.CV 50%

MetaFormer-driven Encoding Network for Robust Medical Semantic Segmentation

基于MetaFormer的编码网络用于鲁棒的医学语义分割

Le-Anh Tran, Chung Nguyen Tran, Nhan Cach Dang, Anh Le Van Quoc, Jordi Carrabina, David Castells-Rufas, Minh Son Nguyen

专题命中 规划推理 :planning(abstract)

AI总结 本文提出MFEnNet,通过引入MetaFormer和优化模块,实现高效的医学图像语义分割,降低计算成本并提升分割精度。

Comments 10 pages, 5 figures, MCT4SD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09907 2026-01-06 cs.CV 50%

VisualActBench: Can VLMs See and Act like a Human?

VisualActBench: VLMs能否像人一样看见并行动?

Daoan Zhang, Pai Liu, Xiaofei Zhou, Yuan Ge, Guangchen Lan, Jing Bi, Christopher Brinton, Ehsan Hoque, Jiebo Luo

机构 * University of Rochester(罗切斯特大学) Purdue University(普渡大学) Northeastern University(东北大学)

专题命中 规划推理 :reasoning(abstract)

AI总结 VisualActBench通过评估VLMs在视觉行动推理任务中的表现,揭示了其在主动推理和高优先级动作生成方面与人类能力的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16772 2026-01-06 cs.HC 50%

AI Knows Best? The Paradox of Expertise, AI-Reliance, and Performance in Educational Tutoring Decision-Making Tasks

AI知最佳?专家性、AI依赖与在教育辅导决策任务中的表现悖论

Eason Chen, Jeffrey Li, Scarlett Huang, Xinyi Tang, Jionghao Lin, Paulo Carvalho, Kenneth Koedinger

专题命中 规划推理 :reasoning(abstract)

AI总结 研究探讨AI辅助决策中专家性与AI依赖的矛盾,发现非专家更依赖AI建议而提升准确性,而专家则常忽视AI建议,导致表现差异。

Comments Paper presented at The International Conference on Learning Analytics & Knowledge (LAK26)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 7 篇

2506.21656 2026-01-06 cs.CV cs.CL 85%

Fine-Grained Preference Optimization Improves Spatial Reasoning in VLMs

细粒度偏好优化提升视觉语言模型的空间推理能力

Yifan Shen, Yuanzhe Liu, Jingyuan Zhu, Xu Cao, Xiaofeng Zhang, Yixiao He, Wenming Ye, James Matthew Rehg, Ismini Lourentzou

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);logical reasoning(abstract);分类 cs.CL

AI总结 细粒度偏好优化方法SpatialReasoner-R1通过改进空间推理能力,在空间推理任务中取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02346 2026-01-06 cs.AI 79%

Falcon-H1R: Pushing the Reasoning Frontiers with a Hybrid Model for Efficient Test-Time Scaling

Falcon-H1R:通过高效推理扩展的混合模型推动推理前沿

Falcon LLM Team, Iheb Chaabane, Puneesh Khanna, Suhail Mohmad, Slim Frikha, Shi Hu, Abdalgader Abubaker, Reda Alami, Mikhail Lubinets, Mohamed El Amine Seddik, Hakim Hacid

机构 * Falcon LLM Team(Falcon LLM团队)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 Falcon-H1R通过高效推理优化和混合模型设计,在保持模型规模的同时实现高效推理性能的突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01984 2026-01-06 cs.CV 78%

Thinking with Blueprints: Assisting Vision-Language Models in Spatial Reasoning via Structured Object Representation

基于蓝图的思考:通过结构化物体表示协助视觉-语言模型进行空间推理

Weijian Ma, Shizhao Sun, Tianyu Yu, Ruiyu Wang, Tat-Seng Chua, Jiang Bian

机构 * National University of Singapore(新加坡国立大学) Microsoft Research, Asia(微软亚洲研究院) Tsinghua University(清华大学) University of Toronto(多伦多大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 通过结构化物体表示提升视觉-语言模型的空间推理能力,引入蓝图嵌入推理轨迹、蓝图意识奖励和反捷径数据增强技术。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01546 2026-01-06 cs.AI 57%

Improving Behavioral Alignment in LLM Social Simulations via Context Formation and Navigation

通过情境形成与导航提升LLM社交模拟中的行为一致性

Letian Kong, Qianran, Jin, Renyu Zhang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出通过情境形成与导航提升LLM在复杂决策环境中的行为一致性,验证了两阶段框架在不同任务中的有效性。

Comments 39 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24133 2026-01-06 physics.chem-ph physics.comp-ph physics.data-an 50%

Bridging Visual Intuition and Chemical Expertise: An Autonomous Analysis Framework for Nonadiabatic Dynamics Simulations via Mentor-Engineer-Student Collaboration

弥合视觉直觉与化学专业性:通过导师-工程师-学生协作的自主分析框架实现非绝热动力学模拟分析

Yifei Zhu, Jiahui Zhang, Binni Huang, Zhenggang Lan

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 VisU通过导师-工程师-学生协作框架,实现非绝热动力学模拟分析的自动化,减少人工依赖,提升机理发现的直观性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11480 2026-01-06 cs.CV 50%

CADMorph: Geometry-Driven Parametric CAD Editing via a Plan-Generate-Verify Loop

CADMorph: 通过计划-生成-验证循环实现几何驱动的参数化CAD编辑

Weijian Ma, Shizhao Sun, Ruiyu Wang, Jiang Bian

机构 * Fudan University(复旦大学) Microsoft Research, Asia(微软亚洲研究院) University of Toronto(多伦多大学)

专题命中 视觉空间推理 :planning(abstract)

AI总结 CADMorph通过计划-生成-验证循环实现几何驱动的参数化CAD编辑,利用预训练模型在数据稀少情况下保持结构、语义和形状保真度,超越现有方法并支持下游应用。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23019 2026-01-06 cs.RO 50%

Stairway to Success: An Online Floor-Aware Zero-Shot Object-Goal Navigation Framework via LLM-Driven Coarse-to-Fine Exploration

通往成功的阶梯:一种通过LLM驱动的粗到细探索的在线楼层感知零样本物体-目标导航框架

Zeying Gong, Rong Li, Tianshuai Hu, Ronghe Qiu, Lingdong Kong, Lingfeng Zhang, Guoyang Zhao, Yiyi Ding, Junwei Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出ASCENT框架,通过LLM驱动的粗到细探索实现在线楼层感知零样本物体-目标导航,无需预建地图或重新训练,适用于多楼层环境。

Comments Accepted to IEEE Robotics and Automation Letters (RAL). Project Page at https://zeying-gong.github.io/projects/ascent

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 5 篇

2305.14934 2026-01-06 cs.CL cs.AI 90%

GRACE: Discriminator-Guided Chain-of-Thought Reasoning

GRACE: 基于判别器的链式推理

Muhammad Khalifa, Lajanugen Logeswaran, Moontae Lee, Honglak Lee, Lu Wang

机构 * University of Michigan(密歇根大学) LG AI Research(LG人工智能研究) University of Illinois at Chicago(伊利诺伊大学香槟分校)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(title,abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 GRACE通过引入判别器引导链式推理,有效提升多步推理任务中答案的准确性和中间推理的正确性。

Comments Fixed typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23506 2026-01-06 cs.AI cs.HC 88%

Emotion-Coherent Reasoning for Multimodal LLMs via Emotional Rationale Verifier

通过情感推理验证器实现多模态大语言模型的情感一致性推理

Hyeongseop Rha, Jeong Hun Yeo, Yeonju Kim, Yong Man Ro

机构 * Corresponding author(通讯作者)

专题命中 测试时计算 :reasoning(title,abstract);verifier(title,abstract);分类 cs.AI

AI总结 本文提出情感推理验证器和解释奖励,通过引导模型生成与目标情绪一致的推理,提升多模态大语言模型在情绪识别中的解释准确性与一致性。

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22732 2026-01-06 cs.LG cs.CL 86%

Reasoning Beyond Limits: Advances and Open Problems for LLMs

超越极限的推理:大型语言模型的进展与开放问题

Mohamed Amine Ferrag, Norbert Tihanyi, Merouane Debbah

机构 * United Arab Emirates University(阿拉伯联合酋长国大学) Technology Innovation Institute(技术创新研究所) Eötvös Loránd University(厄特沃什·洛朗大学) Khalifa University of Science(谢赫扎耶德科学技术大学)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);test-time compute(abstract);分类 cs.CL、cs.LG

AI总结 本文探讨了大型语言模型在推理能力上的最新进展,分析了多种模型的创新与性能提升,并指出了未来在多步骤推理、鲁棒性、提示平衡及工具整合等方面的研究挑战。

Comments The paper is published ICT Express Volume 11, Issue 6, December 2025, Pages 1054-1096

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01332 2026-01-06 cs.CL cs.LG 81%

FLOP-Efficient Training: Early Stopping Based on Test-Time Compute Awareness

高效计算训练:基于测试时间计算意识的提前停止

Hossam Amer, Maryam Dialameh, Hossein Rajabzadeh, Walid Ahmed, Weiwei Zhang, Yang Liu

机构 * Ascend Team, Huawei Technologies, Toronto, Canada(华为技术有限公司,多伦多,加拿大) University of Waterloo, Waterloo, Canada(滑铁卢大学,滑铁卢,加拿大)

专题命中 测试时计算 :test-time compute(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种基于测试时间计算意识的高效训练方法,通过提前停止算法减少训练计算量,同时保持或提升模型准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13201 2026-01-06 cs.CR cs.LG cs.MA 57%

CEE: An Inference-Time Jailbreak Defense for Embodied Intelligence via Subspace Concept Rotation

CEE: 通过子空间概念旋转实现体智能中的推断时间劫持防御

Jirui Yang, Zheyu Lin, Zhihui Lu, Yinggui Wang, Lei Wang, Tao Wei, Qiang Duan, Xin Du, Shuhan Yang

机构 * Fudan University(复旦大学) Dalian University of Technology(大连理工大学) Ant Group(蚂蚁集团) Pennsylvania State University(宾夕法尼亚州立大学) Zhejiang University(浙江大学)

专题命中 测试时计算 :planning(abstract);分类 cs.LG

AI总结 CEE通过动态构建子空间并应用SLERP旋转,实现体智能系统中高效的推断时间劫持防御,提升安全性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 复杂问题求解 14 篇

2501.12948 2026-01-06 cs.CL cs.AI cs.LG 85%

DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

DeepSeek-R1: 通过强化学习激励大语言模型的推理能力

DeepSeek-AI, Daya Guo, Dejian Yang, Haowei Zhang, Junxiao Song, Peiyi Wang, Qihao Zhu, Runxin Xu, Ruoyu Zhang, Shirong Ma, Xiao Bi, Xiaokang Zhang, Xingkai Yu, Yu Wu, Z. F. Wu, Zhibin Gou, Zhihong Shao, Zhuoshu Li, Ziyi Gao, Aixin Liu, Bing Xue, Bingxuan Wang, Bochao Wu, Bei Feng, Chengda Lu, Chenggang Zhao, Chengqi Deng, Chenyu Zhang, Chong Ruan, Damai Dai, Deli Chen, Dongjie Ji, Erhang Li, Fangyun Lin, Fucong Dai, Fuli Luo, Guangbo Hao, Guanting Chen, Guowei Li, H. Zhang, Han Bao, Hanwei Xu, Haocheng Wang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Qu, Hui Li, Jianzhong Guo, Jiashi Li, Jiawei Wang, Jingchang Chen, Jingyang Yuan, Junjie Qiu, Junlong Li, J. L. Cai, Jiaqi Ni, Jian Liang, Jin Chen, Kai Dong, Kai Hu, Kaige Gao, Kang Guan, Kexin Huang, Kuai Yu, Lean Wang, Lecong Zhang, Liang Zhao, Litong Wang, Liyue Zhang, Lei Xu, Leyi Xia, Mingchuan Zhang, Minghua Zhang, Minghui Tang, Meng Li, Miaojun Wang, Mingming Li, Ning Tian, Panpan Huang, Peng Zhang, Qiancheng Wang, Qinyu Chen, Qiushi Du, Ruiqi Ge, Ruisong Zhang, Ruizhe Pan, Runji Wang, R. J. Chen, R. L. Jin, Ruyi Chen, Shanghao Lu, Shangyan Zhou, Shanhuang Chen, Shengfeng Ye, Shiyu Wang, Shuiping Yu, Shunfeng Zhou, Shuting Pan, S. S. Li, Shuang Zhou, Shaoqing Wu, Shengfeng Ye, Tao Yun, Tian Pei, Tianyu Sun, T. Wang, Wangding Zeng, Wanjia Zhao, Wen Liu, Wenfeng Liang, Wenjun Gao, Wenqin Yu, Wentao Zhang, W. L. Xiao, Wei An, Xiaodong Liu, Xiaohan Wang, Xiaokang Chen, Xiaotao Nie, Xin Cheng, Xin Liu, Xin Xie, Xingchao Liu, Xinyu Yang, Xinyuan Li, Xuecheng Su, Xuheng Lin, X. Q. Li, Xiangyue Jin, Xiaojin Shen, Xiaosha Chen, Xiaowen Sun, Xiaoxiang Wang, Xinnan Song, Xinyi Zhou, Xianzu Wang, Xinxia Shan, Y. K. Li, Y. Q. Wang, Y. X. Wei, Yang Zhang, Yanhong Xu, Yao Li, Yao Zhao, Yaofeng Sun, Yaohui Wang, Yi Yu, Yichao Zhang, Yifan Shi, Yiliang Xiong, Ying He, Yishi Piao, Yisong Wang, Yixuan Tan, Yiyang Ma, Yiyuan Liu, Yongqiang Guo, Yuan Ou, Yuduan Wang, Yue Gong, Yuheng Zou, Yujia He, Yunfan Xiong, Yuxiang Luo, Yuxiang You, Yuxuan Liu, Yuyang Zhou, Y. X. Zhu, Yanhong Xu, Yanping Huang, Yaohui Li, Yi Zheng, Yuchen Zhu, Yunxian Ma, Ying Tang, Yukun Zha, Yuting Yan, Z. Z. Ren, Zehui Ren, Zhangli Sha, Zhe Fu, Zhean Xu, Zhenda Xie, Zhengyan Zhang, Zhewen Hao, Zhicheng Ma, Zhigang Yan, Zhiyu Wu, Zihui Gu, Zijia Zhu, Zijun Liu, Zilin Li, Ziwei Xie, Ziyang Song, Zizheng Pan, Zhen Huang, Zhipeng Xu, Zhongyu Zhang, Zhen Zhang

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DeepSeek-R1通过强化学习提升大语言模型的推理能力,无需人工标注数据,实现更复杂的推理任务表现。

Journal ref Nature volume 645, pages 633-638 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00828 2026-01-06 cs.AI 80%

Decomposing LLM Self-Correction: The Accuracy-Correction Paradox and Error Depth Hypothesis

分解大语言模型的自我纠正:准确性-纠正悖论与错误深度假说

Yin Li

机构 * University of Birmingham(伯明翰大学)

专题命中 复杂问题求解 :self-correction(title,abstract);分类 cs.AI

AI总结 本研究揭示大语言模型在自我纠正中的准确性-纠正悖论,提出错误深度假说,发现更强模型犯更深入的错误,且错误检测与纠正成功率无直接关联。

Comments 9 pages, 2 figures, 3 tables. Code available at https://github.com/Kevin0304-li/llm-self-correction

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01609 2026-01-06 cs.AI 79%

Structured Decomposition for LLM Reasoning: Cross-Domain Validation and Semantic Web Integration

结构分解用于LLM推理:跨领域验证与语义网集成

Albert Sadowski, Jarosław A. Chudziak

机构 * Warsaw University of Technology(华沙技术大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出结构分解框架,结合LLM与符号推理,通过本体填充和符号验证提升跨领域推理的准确性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01195 2026-01-06 cs.AI 79%

Reinforcement Learning Enhanced Multi-hop Reasoning for Temporal Knowledge Question Answering

强化学习增强的多跳推理用于时间知识问答

Wuzhenghong Wen, Chao Xue, Su Pan, Yuwei Sun, Minlong Peng

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究提出MRE框架,通过增强正向和反向推理,提升时间知识问答中多跳推理的准确性和鲁棒性。

Comments 11 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23489 2026-01-06 cs.AI 79%

The Gaining Paths to Investment Success: Information-Driven LLM Graph Reasoning for Venture Capital Prediction

投资成功的获取路径:基于信息驱动的LLM图推理的创业投资预测

Haoyu Pei, Zhongyang Liu, Xiangyi Xiao, Xiaocong Du, Suting Hong, Kunpeng Zhang, Haipeng Zhang

机构 * ShanghaiTech University(上海科技大学) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) University of Maryland(马里兰大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 MIRAGE-VC通过信息驱动的图路径推理,提升创业投资预测的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24794 2026-01-06 cs.CL 79%

MR-Align: Meta-Reasoning Informed Factuality Alignment for Large Reasoning Models

MR-Align: 为大推理模型引入元推理的事实性对齐

Xinming Wang, Jian Xu, Bin Yu, Sheng Lian, Hongzhu Yi, Yi Chen, Yingjian Zhu, Boran Wang, Hongming Yang, Han Hu, Xu-Yao Zhang, Cheng-Lin Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhongguancun Academy(中关村学院) University of Chinese Academy of Sciences(中国科学院大学) Tencent(腾讯)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 MR-ALIGN通过元推理引导的对齐框架提升大型推理模型的事实准确性,通过优化推理过程中的状态转移概率来增强事实性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00905 2026-01-06 cs.CV cs.AI 74%

Evaluating Contextual Intelligence in Recyclability: A Comprehensive Study of Image-Based Reasoning Systems

评估可回收性中的情境智能:图像推理系统的全面研究

Eliot Park, Abhi Kumar, Pranav Rajpurkar

机构 * Harvard College(哈佛学院) Stanford University(斯坦福大学) Department of Biomedical Informatics(生物医学信息学系) Harvard Medical School(哈佛医学院)

专题命中 复杂问题求解 :reasoning(title);分类 cs.AI

AI总结 本研究利用先进视觉-语言模型评估物品可回收性,探讨其在不同场景下的表现,揭示模型在情境理解上的进展与不足。

Comments x

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24618 2026-01-06 cs.CL 70%

Youtu-LLM: Unlocking the Native Agentic Potential for Lightweight Large Language Models

Youtu-LLM:解锁轻量级大语言模型的原生代理潜力

Junru Lu, Jiarui Qin, Lingfeng Qiao, Yinghui Li, Xinyi Dai, Bo Ke, Jianfeng He, Ruizhi Qiao, Di Yin, Xing Sun, Yunsheng Wu, Yinsong Liu, Shuangyin Liu, Mingkong Tang, Haodong Lin, Jiayi Kuang, Fanxu Meng, Xiaojuan Tang, Yunjia Xi, Junjie Huang, Haotong Yang, Zhenyi Shen, Yangning Li, Qianwen Zhang, Yifei Yu, Siyu An, Junnan Dong, Qiufeng Wang, Jie Wang, Keyu Chen, Wei Wen, Taian Guo, Zhifeng Shen, Daohai Yu, Jiahao Li, Ke Li, Zongyi Li, Xiaoyu Tan

机构 * Youtu-LLM Team(Youtu-LLM团队)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 Youtu-LLM通过紧凑架构和长上下文支持,实现了轻量级大语言模型在代理任务中的高效推理与规划能力。

Comments 57 pages, 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01233 2026-01-06 cs.SE 67%

Atomizer: An LLM-based Collaborative Multi-Agent Framework for Intent-Driven Commit Untangling

Atomizer: 一种基于大语言模型的协作多智能体框架,用于意图驱动的复合提交解缠

Kangchen Zhu, Zhiliang Tian, Shangwen Wang, Mingyue Leng, Xiaoguang Mao

专题命中 复杂问题求解 :chain-of-thought(abstract);CoT(abstract)

AI总结 Atomizer通过意图导向的思考链策略和协作多智能体框架,有效解决复合提交解缠中的语义意图识别和多轮细化问题,提升解缠效果。

Comments Accepted by ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01446 2026-01-06 cs.CL cs.LG 62%

iFlip: Iterative Feedback-driven Counterfactual Example Refinement

iFlip: 迭代反馈驱动的反事实示例精炼

Yilong Wang, Qianli Wang, Nils Feldhus

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.CL、cs.LG

AI总结 iFlip通过迭代反馈驱动的方法生成有效反事实示例,提升模型性能和鲁棒性。

Comments In submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20293 2026-01-06 cs.CL 57%

AprielGuard

AprielGuard:一个统一安全与对抗防御的8B参数模型

Jaykumar Kasundra, Anjaneya Praharaj, Sourabh Surana, Lakshmi Sirisha Chodisetty, Sourav Sharma, Abhigya Verma, Abhishek Bhardwaj, Debasish Kanhar, Aakash Bhagat, Khalil Slimi, Seganrasan Subramanian, Sathwik Tejaswi Madhusudhan, Ranga Prasad Chenna, Srinivas Sunkara

机构 * AprielGuard

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 AprielGuard是一个统一安全与对抗防御的8B参数模型,通过多任务训练在多步骤和推理场景中有效检测有害内容和对抗操纵。

详情

展开后加载摘要…

URL PDF HTML 收藏