arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-14 至 2026-01-14 共收录 78 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 5 篇

2601.08811 2026-01-14 cs.CV cs.AI 79%

Reasoning Matters for 3D Visual Grounding

推理在3D视觉定位中至关重要

Hsiang-Wei Huang, Kuang-Ming Chen, Wenhao Chai, Cheng-Yen Yang, Jen-Hao Cheng, Jenq-Neng Hwang

机构 * University of Washington(华盛顿大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出了一种自动合成3D视觉定位数据的管道,并引入了在仅使用1.6%训练数据下表现优于现有方法的Reason3DVG-8B模型,证明了推理在3D视觉定位中的重要性。

Comments 2025 CVPR Workshop on 3D-LLM/VLA: Bridging Language, Vision and Action in 3D Environments

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08699 2026-01-14 cs.CL 57%

RAGShaper: Eliciting Sophisticated Agentic RAG Skills via Automated Data Synthesis

RAGShaper: 通过自动化数据合成激发复杂的代理RAG技能

Zhengwei Tao, Bo Li, Jialong Wu, Guochen Yan, Huanyao Zhang, Jiahao Xu, Haitao Mi, Wentao Zhang

机构 * Peking University(北京大学) Tencent AI Lab(腾讯人工智能实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 RAGShaper通过自动化数据合成构建高质量RAG任务和代理轨迹,提升模型在复杂检索任务中的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16237 2026-01-14 cs.CL 57%

Align-GRAG: Anchor and Rationale Guided Dual Alignment for Graph Retrieval-Augmented Generation

Align-GRAG: 基于锚点和推理引导的双 Alignment 图检索增强生成

Derong Xu, Pengyue Jia, Xiaopeng Li, Yingyi Zhang, Maolin Wang, Qidong Liu, Xiangyu Zhao, Yichao Wang, Huifeng Guo, Ruiming Tang, Enhong Chen, Tong Xu

机构 * University of Science and Technology of China(中国科学技术大学) City University of Hong Kong(香港城市大学) Noah’s Ark Lab, Huawei(华为诺亚实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 Align-GRAG通过锚点和推理引导的双 Alignment 框架,提升图检索增强生成的准确性与语义对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03215 2026-01-14 cs.AI 57%

COSINT-Agent: A Knowledge-Driven Multimodal Agent for Chinese Open Source Intelligence

COSINT-Agent: 一种面向中文开源情报的知识驱动多模态智能体

Wentao Li, Congcong Wang, Xiaoxiao Cui, Zhi Liu, Wei Guo, Lizhen Cui

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 COSINT-Agent通过整合多模态大语言模型与实体-事件-场景知识图谱,提升中文开源情报的多模态推理能力与情报生成效率。

Comments This manuscript (arXiv:2503.03215) is being withdrawn at the supervisor's request. The content is preliminary and needs further internal revision and approval before public release. We will resubmit a revised version after completion. Apologies for the inconvenience

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 测试时计算 9 篇

2601.08511 2026-01-14 cs.CL cs.CR cs.LG 86%

STAR: Detecting Inference-time Backdoors in LLM Reasoning via State-Transition Amplification Ratio

STAR: 通过状态转移放大比率检测推理时后门

Seong-Gyu Park, Sohee Park, Jisu Lee, Hyunsik Na, Daeseon Choi

机构 * Department of Software, Soongsil University(软件系,顺斯大学)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.LG

AI总结 STAR通过分析输出概率变化检测推理时后门,利用状态转移放大比率和CUSUM算法实现高效率和高准确率的后门检测。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08734 2026-01-14 cs.SE cs.AI 83%

TerraFormer: Automated Infrastructure-as-Code with LLMs Fine-Tuned via Policy-Guided Verifier Feedback

TerraFormer:基于LLM的自动化基础设施即代码生成与变异框架

Prithwish Jana, Sam Davidson, Bhavana Bhasker, Andrey Kan, Anoop Deoras, Laurent Callot

机构 * Georgia Institute of Technology(佐治亚理工学院) Amazon Web Services(亚马逊网络服务)

专题命中 测试时计算 :verifier(title,abstract);self-correction(abstract);分类 cs.AI

AI总结 TerraFormer通过结合监督微调与验证器引导强化学习,提升LLM生成IaC的准确性与合规性,实现更高的正确率和安全性。

Comments The paper has been published at the 2026 IEEE/ACM 48th International Conference on Software Engineering (ICSE 2026), Rio de Janeiro, Brazil, April 12-18, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17627 2026-01-14 cs.CL cs.AI 81%

The Evolution of Thought: Tracking LLM Overthinking via Reasoning Dynamics Analysis

思维的演变:通过推理动态分析追踪LLM过度思考

Zihao Wei, Liang Pang, Jiahao Liu, Wenjie Shi, Jingcheng Deng, Shicheng Xu, Zenghao Duan, Fei Sun, Huawei Shen, Xueqi Cheng

机构 * State Key Laboratory of AI Safety,Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 通过分析推理动态,提出RCPD方法以识别LLM推理完成点,减少token使用量同时保持准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20315 2026-01-14 cs.CL cs.AI 76%

Arctic-Text2SQL-R1: Simple Rewards, Strong Reasoning in Text-to-SQL

Arctic-Text2SQL-R1: 简单奖励,强推理的文本到SQL

Zhewei Yao, Guoheng Sun, Lukasz Borchmann, Gaurav Nuti, Zheyu Shen, Minghang Deng, Bohan Zhai, Hao Zhang, Ang Li, Yuxiong He

机构 * Snowflake AI Research(Snowflake AI研究院) University of Maryland(马里兰大学) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 测试时计算 :reasoning(title);分类 cs.CL、cs.AI

AI总结 Arctic-Text2SQL-R1通过简单奖励机制和强化学习框架,在文本到SQL任务中实现高准确率和高效性,优于现有大型模型。

Comments 22 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06224 2026-01-14 cs.CV 67%

Ground What You See: Hallucination-Resistant MLLMs via Caption Feedback, Diversity-Aware Sampling, and Conflict Regularization

在所见之地接地:通过标题反馈、多样性感知采样和冲突正则化实现抗幻觉的MLLMs

Miao Pan, Wangjie Gan, Jintao Chen, Wenqi Zhang, Bing Sun, Jianwei Yin, Xuhong Zhang

专题命中 测试时计算 :reasoning(abstract);planning(abstract)

AI总结 本文提出抗幻觉的MLLMs方法,通过标题反馈、多样性感知采样和冲突正则化减少幻觉,提升推理准确性。

Comments AAAI-2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08302 2026-01-14 cs.CL cs.AI 62%

Enhancing Sentiment Classification and Irony Detection in Large Language Models through Advanced Prompt Engineering Techniques

通过高级提示工程技术增强大型语言模型的情感分类和讽刺检测

Marvin Schmitt, Anne Schwerk, Sebastian Lempert

机构 * IU International University of Applied Sciences(国际应用科学大学)

专题命中 测试时计算 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文通过高级提示工程技术提升大型语言模型在情感分类和讽刺检测中的性能,发现不同提示策略对不同模型和任务效果显著。

Comments 21 pages, 4 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26167 2026-01-14 cs.AI cs.CL 62%

ToolRM: Towards Agentic Tool-Use Reward Modeling

ToolRM: 向代理工具使用奖励建模迈进

Renhao Li, Jianhong Tu, Yang Su, Yantao Liu, Fei Huang, Hamid Alinejad-Rokny, Derek F. Wong, Junyang Lin, Min Yang

机构 * University of Macau(澳门大学) Qwen Team, Alibaba Inc.(阿里云Qwen团队) UNSW Sydney(新南威尔士大学悉尼分校) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所)

专题命中 测试时计算 :self-correction(abstract);分类 cs.CL、cs.AI

AI总结 ToolRM通过构建高质量偏好数据集和基准,提升代理AI在工具调用任务中的表现和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15793 2026-01-14 cs.CL cs.LG 62%

Format as a Prior: Quantifying and Analyzing Bias in LLMs for Heterogeneous Data

以格式为先:量化和分析LLM在异构数据中的偏见

Jiacheng Liu, Mayi Xu, Qiankun Pi, Wenli Li, Ming Zhong, Yuanyuan Zhu, Mengchi Liu, Tieyun Qian

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文通过三阶段分析,揭示了LLM在处理异构数据时的格式偏见问题,提出通过数据预处理、推理干预和平衡训练语料库来减少偏见的方法。

Comments Accepted by AAAI 2026, camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08408 2026-01-14 cs.CV cs.RO 50%

Edge-Optimized Multimodal Learning for UAV Video Understanding via BLIP-2

边缘优化的多模态学习用于无人机视频理解 via BLIP-2

Yizhan Feng, Hichem Snoussi, Jing Teng, Jian Liu, Yuyang Wang, Abel Cherouat, Tian Wang

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文提出基于BLIP-2的轻量级多模态学习平台,通过集成YOLO模型实现无人机视频理解的高效处理与多任务适应。

Comments The Tenth International Conference on Data Mining and Big Data (DMBD'2025)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 复杂问题求解 10 篇

2601.08058 2026-01-14 cs.CL cs.AI 90%

Reasoning Beyond Chain-of-Thought: A Latent Computational Mode in Large Language Models

超越链式推理:大型语言模型中的一个潜在计算模式

Zhenghao He, Guangzhi Xiong, Bohan Liu, Sanchit Sinha, Aidong Zhang

机构 * University of Virginia(弗吉尼亚大学)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 研究发现大型语言模型中的推理能力由潜在内部激活支持,通过引导特定潜在特征可提升性能,CoT提示并非唯一触发方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06002 2026-01-14 cs.CL cs.AI 90%

The Molecular Structure of Thought: Mapping the Topology of Long Chain-of-Thought Reasoning

思维的分子结构:映射长链推理的拓扑结构

Qiguang Chen, Yantao Du, Ziniu Li, Jinhao Liu, Songyao Duan, Jiarui Guo, Minghao Liu, Jiaheng Liu, Tong Yang, Ge Zhang, Libo Qin, Wanxiang Che, Wenhao Huang

机构 * LARG, SCIR, Harbin Institute of Technology(LARG、SCIR、哈尔滨工业大学) Peking University(北京大学) Nanjing University(南京大学) Central South University(中南大学)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过分子结构类比理解长链推理的拓扑特性,引入有效语义异构体概念,并提出Mole-Syn方法提升长链推理性能和稳定性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08282 2026-01-14 cs.CL 86%

D$^2$Plan: Dual-Agent Dynamic Global Planning for Complex Retrieval-Augmented Reasoning

D$^2$Plan: 双智能体动态全局规划用于复杂检索增强推理

Kangcheng Luo, Tinglang Wu, Yansong Feng

机构 * Peking University(北京大学)

专题命中 复杂问题求解 :reasoning(title,abstract);planning(title);分类 cs.CL

AI总结 D$^2$Plan通过双智能体协作提升复杂检索增强推理的连贯性和抗干扰能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08079 2026-01-14 cs.AI cs.CL cs.IR 81%

MemoBrain: Executive Memory as an Agentic Brain for Reasoning

MemoBrain: 作为推理代理的执行记忆脑

Hongjin Qian, Zhao Cao, Zheng Liu

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 MemoBrain通过构建依赖感知的记忆模型,实现对长周期推理轨迹的显式认知控制,提升工具增强代理的推理连贯性和任务对齐性。

Comments Our codes are in https://github.com/qhjqhj00/MemoBrain

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04261 2026-01-14 cs.CY 78%

Small Models Achieve Large Language Model Performance: Evaluating Reasoning-Enabled AI for Secure Child Welfare Research

小型模型实现大型语言模型性能:评估具备推理能力的AI用于安全儿童福利研究

Zia Qi, Brian E. Perron, Bryan G. Victor, Dragan Stoll, Joseph P. Ryan

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 本研究展示小型模型通过扩展推理能力在儿童福利研究中实现高准确性,优于大模型,节省资源并提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07935 2026-01-14 cs.LG cs.AI cs.CL 67%

Towards Specialized Generalists: A Multi-Task MoE-LoRA Framework for Domain-Specific LLM Adaptation

迈向专业化的通用者:一种多任务MoE-LoRA框架用于领域特定LLM适应

Yuxin Yang, Aoxiong Zeng, Xiangquan Yang

机构 * Shanghai University(上海大学) East China Normal University(东华大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Med-MoE-LoRA框架,通过结合MoE与LoRA实现高效多任务领域适应,尤其适用于医学场景,有效解决领域知识获取与通用能力保留的难题。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08584 2026-01-14 cs.CL 57%

Ministral 3

Ministral 3:参数高效密集语言模型系列

Alexander H. Liu, Kartik Khandelwal, Sandeep Subramanian, Victor Jouault, Abhinav Rastogi, Adrien Sadé, Alan Jeffares, Albert Jiang, Alexandre Cahill, Alexandre Gavaudan, Alexandre Sablayrolles, Amélie Héliou, Amos You, Andy Ehrenberg, Andy Lo, Anton Eliseev, Antonia Calvi, Avinash Sooriyarachchi, Baptiste Bout, Baptiste Rozière, Baudouin De Monicault, Clémence Lanfranchi, Corentin Barreau, Cyprien Courtot, Daniele Grattarola, Darius Dabert, Diego de las Casas, Elliot Chane-Sane, Faruk Ahmed, Gabrielle Berrada, Gaëtan Ecrepont, Gauthier Guinet, Georgii Novikov, Guillaume Kunsch, Guillaume Lample, Guillaume Martin, Gunshi Gupta, Jan Ludziejewski, Jason Rute, Joachim Studnia, Jonas Amar, Joséphine Delas, Josselin Somerville Roberts, Karmesh Yadav, Khyathi Chandu, Kush Jain, Laurence Aitchison, Laurent Fainsin, Léonard Blier, Lingxiao Zhao, Louis Martin, Lucile Saulnier, Luyu Gao, Maarten Buyl, Margaret Jennings, Marie Pellat, Mark Prins, Mathieu Poirée, Mathilde Guillaumin, Matthieu Dinot, Matthieu Futeral, Maxime Darrin, Maximilian Augustin, Mia Chiquier, Michel Schimpf, Nathan Grinsztajn, Neha Gupta, Nikhil Raghuraman, Olivier Bousquet, Olivier Duchenne, Patricia Wang, Patrick von Platen, Paul Jacob, Paul Wambergue, Paula Kurylowicz, Pavankumar Reddy Muddireddy, Philomène Chagniot, Pierre Stock, Pravesh Agrawal, Quentin Torroba, Romain Sauvestre, Roman Soletskyi, Rupert Menneer, Sagar Vaze, Samuel Barry, Sanchit Gandhi, Siddhant Waghjale, Siddharth Gandhi, Soham Ghosh, Srijan Mishra, Sumukh Aithal, Szymon Antoniak, Teven Le Scao, Théo Cachet, Theo Simon Sorg, Thibaut Lavril, Thiziri Nait Saada, Thomas Chabal, Thomas Foubert, Thomas Robert, Thomas Wang, Tim Lawson, Tom Bewley, Tom Bewley, Tom Edwards, Umar Jamil, Umberto Tomasini, Valeriia Nemychnikova, Van Phung, Vincent Maladière, Virgile Richard, Wassim Bouaziz, Wen-Ding Li, William Marshall, Xinghui Li, Xinyu Yang, Yassine El Ouahidi, Yihan Wang, Yunhao Tang, Zaccharie Ramzi

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 Ministral 3系列提供三种参数规模的高效密集语言模型,支持图像理解,并通过级联蒸馏技术实现复杂问题解决能力。

Comments Release page: https://mistral.ai/news/mistral-3 ; Models available at https://huggingface.co/collections/mistralai/ministral-3

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08225 2026-01-14 cs.CL 57%

User-Oriented Multi-Turn Dialogue Generation with Tool Use at scale

面向用户的多轮对话生成与工具使用规模化

Jungho Cho, Minbyul Jeong, Sungrae Park

机构 * Upstage AI

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出面向用户的多轮对话生成方法,通过动态生成领域特定工具解决任务,提升大规模多轮对话生成的可扩展性和真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08292 2026-01-14 cs.CV 50%

KidVis: Do Multimodal Large Language Models Possess the Visual Perceptual Capabilities of a 6-Year-Old?

KidVis: 多模态大语言模型是否具备六岁儿童的视觉感知能力?

Xianfeng Wang, Kaiwei Zhang, Qi Jia, Zijian Chen, Guangtao Zhai, Xiongkuo Min

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 KidVis研究通过对比人类儿童与多模态大语言模型在视觉能力上的表现,揭示了当前模型在基础视觉感知上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08241 2026-01-14 cs.CV cs.DC 50%

Improving Zero-shot ADL Recognition with Large Language Models through Event-based Context and Confidence

通过基于事件的上下文和置信度提升零样本ADL识别

Michele Fiori, Gabriele Civitarese, Marco Colussi, Claudio Bettini

机构 * Dept. of Computer Science University of Milan, Milan, Italy(计算机科学系米兰大学)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出通过基于事件的上下文分割和新的置信度估计方法,改进零样本ADL识别,实验表明其在复杂数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 推理评测 17 篇

2510.04230 2026-01-14 cs.CL 89%

Pushing on Multilingual Reasoning Models with Language-Mixed Chain-of-Thought

通过语言混合的推理模型推动多语言推理

Guijin Son, Donghun Yang, Hitesh Laxmichand Patel, Amit Agarwal, Hyunwoo Ko, Chanuk Lim, Srikant Panda, Minhyuk Kim, Nikunj Drolia, Dasol Choi, Kyong-Ha Lee, Youngjae Yu

机构 * OneLineAI KISTI Oracle AI Korea University(韩国大学) Modulabs Seoul National University(首尔国立大学) University College Dublin(都柏林大学学院) Yonsei University(延世大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出语言混合的推理方法,通过多语言推理提升模型性能,展示在韩国案例研究中达到最先进的表现。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08748 2026-01-14 cs.CV cs.AI 79%

UR-Bench: A Benchmark for Multi-Hop Reasoning over Ultra-High-Resolution Images

UR-Bench:面向超高清图像的多跳推理基准

Siqi Li, Xinyu Cai, Jianbiao Mei, Nianchen Deng, Pinlong Cai, Licheng Wen, Yufan Shen, Xuemeng Yang, Botian Shi, Yong Liu

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 UR-Bench是一个针对超高清图像多跳推理的基准,通过引入代理框架和语义工具,评估大语言模型在极端视觉信息下的推理能力。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07553 2026-01-14 cs.AI q-bio.QM 79%

GTR-CoT: Graph Traversal as Visual Chain of Thought for Molecular Structure Recognition

GTR-CoT:图遍历作为视觉推理链用于分子结构识别

Jingchao Wang, Yifan He, Haote Yang, Jiang Wu, Lingli Ge, Xingjian Wei, Yinfan Wang, Linye Li, Huijie Ao, Chengjin Liu, Bin Wang, Lijun Wu, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) East China Normal University(华东师范大学) Peking University(北京大学) Shanghai Jiaotong University(上海交通大学) Tongji University(同济大学) Fudan University(复旦大学) Northwestern Polytechnical University(西北工业大学)

专题命中 推理评测 :CoT(title);reasoning(abstract);分类 cs.AI

AI总结 GTR-CoT通过图遍历机制和强化学习提升手绘分子结构识别性能,构建首个细粒度评估基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08108 2026-01-14 cs.CL cs.AI 79%

Debiasing Large Language Models via Adaptive Causal Prompting with Sketch-of-Thought

通过适应性因果提示的草图思维去偏Large Language Models

Bowen Li, Ziqi Xu, Jing Ren, Renqiang Luo, Xikun Zhang, Xiuzhen Zhang, Yongli Ren, Feng Xia

机构 * RMIT University(皇家墨尔本理工大学) Jilin University(吉林大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 ACPS通过适应性因果提示与草图思维方法,提升Large Language Models的推理效率与泛化能力。

Comments Accepted by Findings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08176 2026-01-14 cs.CL cs.AI 73%

Prompt-Based Clarity Evaluation and Topic Detection in Political Question Answering

基于提示的清晰度评估与政治问答主题检测

Lavanya Prahallad, Sai Utkarsh Choudarypally, Pragna Prahallad, Pranathi Prahallad

机构 * Research Spark Hub Inc. Emerald High School

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了基于提示的清晰度评估与政治问答主题检测,发现思维链提示显著提升清晰度和主题识别准确性,但细粒度逃避检测仍具挑战性。

Comments 6 pages, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07877 2026-01-14 cs.LG cs.AI 73%

E^2-LLM: Bridging Neural Signals and Interpretable Affective Analysis

E²-LLM:连接神经信号与可解释的情感分析

Fei Ma, Han Lin, Yifan Xie, Hongwei Ren, Xiaoyu Shen, Wenbo Ding, Qi Tian

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室) Zhejiang University(浙江大学) Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学) Eastern Institute of Technology(东方技术研究所) Huawei(华为)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 E²-LLM通过整合预训练EEG编码器与Qwen-based LLM,实现了可解释的情绪分析,展示了模型扩展在情感识别和可解释性上的优势。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18882 2026-01-14 cs.CY 71%

Personalized Safety in LLMs: A Benchmark and A Planning-Based Agent Approach

大语言模型中的个性化安全:一个基准和基于规划的代理方法

Yuchen Wu, Edward Sun, Kaijie Zhu, Jianxun Lian, Jose Hernandez-Orallo, Aylin Caliskan, Jindong Wang

专题命中 推理评测 :planning(title)

AI总结 本文提出个性化安全框架PENGUIN和RAISE,通过获取用户背景信息提升LLM的安全性,实验显示安全评分提升达31.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏