arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-14 至 2026-01-14 共收录 17 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 17 篇

2510.04230 2026-01-14 cs.CL 89%

Pushing on Multilingual Reasoning Models with Language-Mixed Chain-of-Thought

通过语言混合的推理模型推动多语言推理

Guijin Son, Donghun Yang, Hitesh Laxmichand Patel, Amit Agarwal, Hyunwoo Ko, Chanuk Lim, Srikant Panda, Minhyuk Kim, Nikunj Drolia, Dasol Choi, Kyong-Ha Lee, Youngjae Yu

机构 * OneLineAI KISTI Oracle AI Korea University(韩国大学) Modulabs Seoul National University(首尔国立大学) University College Dublin(都柏林大学学院) Yonsei University(延世大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出语言混合的推理方法,通过多语言推理提升模型性能,展示在韩国案例研究中达到最先进的表现。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08748 2026-01-14 cs.CV cs.AI 79%

UR-Bench: A Benchmark for Multi-Hop Reasoning over Ultra-High-Resolution Images

UR-Bench:面向超高清图像的多跳推理基准

Siqi Li, Xinyu Cai, Jianbiao Mei, Nianchen Deng, Pinlong Cai, Licheng Wen, Yufan Shen, Xuemeng Yang, Botian Shi, Yong Liu

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 UR-Bench是一个针对超高清图像多跳推理的基准,通过引入代理框架和语义工具,评估大语言模型在极端视觉信息下的推理能力。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07553 2026-01-14 cs.AI q-bio.QM 79%

GTR-CoT: Graph Traversal as Visual Chain of Thought for Molecular Structure Recognition

GTR-CoT:图遍历作为视觉推理链用于分子结构识别

Jingchao Wang, Yifan He, Haote Yang, Jiang Wu, Lingli Ge, Xingjian Wei, Yinfan Wang, Linye Li, Huijie Ao, Chengjin Liu, Bin Wang, Lijun Wu, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) East China Normal University(华东师范大学) Peking University(北京大学) Shanghai Jiaotong University(上海交通大学) Tongji University(同济大学) Fudan University(复旦大学) Northwestern Polytechnical University(西北工业大学)

专题命中 推理评测 :CoT(title);reasoning(abstract);分类 cs.AI

AI总结 GTR-CoT通过图遍历机制和强化学习提升手绘分子结构识别性能,构建首个细粒度评估基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08108 2026-01-14 cs.CL cs.AI 79%

Debiasing Large Language Models via Adaptive Causal Prompting with Sketch-of-Thought

通过适应性因果提示的草图思维去偏Large Language Models

Bowen Li, Ziqi Xu, Jing Ren, Renqiang Luo, Xikun Zhang, Xiuzhen Zhang, Yongli Ren, Feng Xia

机构 * RMIT University(皇家墨尔本理工大学) Jilin University(吉林大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 ACPS通过适应性因果提示与草图思维方法,提升Large Language Models的推理效率与泛化能力。

Comments Accepted by Findings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08176 2026-01-14 cs.CL cs.AI 73%

Prompt-Based Clarity Evaluation and Topic Detection in Political Question Answering

基于提示的清晰度评估与政治问答主题检测

Lavanya Prahallad, Sai Utkarsh Choudarypally, Pragna Prahallad, Pranathi Prahallad

机构 * Research Spark Hub Inc. Emerald High School

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了基于提示的清晰度评估与政治问答主题检测,发现思维链提示显著提升清晰度和主题识别准确性,但细粒度逃避检测仍具挑战性。

Comments 6 pages, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07877 2026-01-14 cs.LG cs.AI 73%

E^2-LLM: Bridging Neural Signals and Interpretable Affective Analysis

E²-LLM:连接神经信号与可解释的情感分析

Fei Ma, Han Lin, Yifan Xie, Hongwei Ren, Xiaoyu Shen, Wenbo Ding, Qi Tian

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室) Zhejiang University(浙江大学) Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学) Eastern Institute of Technology(东方技术研究所) Huawei(华为)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 E²-LLM通过整合预训练EEG编码器与Qwen-based LLM,实现了可解释的情绪分析,展示了模型扩展在情感识别和可解释性上的优势。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18882 2026-01-14 cs.CY 71%

Personalized Safety in LLMs: A Benchmark and A Planning-Based Agent Approach

大语言模型中的个性化安全:一个基准和基于规划的代理方法

Yuchen Wu, Edward Sun, Kaijie Zhu, Jianxun Lian, Jose Hernandez-Orallo, Aylin Caliskan, Jindong Wang

专题命中 推理评测 :planning(title)

AI总结 本文提出个性化安全框架PENGUIN和RAISE,通过获取用户背景信息提升LLM的安全性,实验显示安全评分提升达31.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08288 2026-01-14 cs.AI 70%

OpenMic: A Multi-Agent-Based Stand-Up Comedy Generation System

OpenMic: 基于多智能体的站立喜剧生成系统

Yuyang Wu, Hanzhong Cao, Jianhao Chen, Yufei Li

机构 * School of Electronics Engineering and Computer Science, Peking University(电子工程与计算机科学学院,北京大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 OpenMic通过多智能体系统生成基于文化背景的站立喜剧,结合检索增强生成和专用JokeWriter提升幽默与节奏表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08141 2026-01-14 cs.CL cs.AI cs.LG 67%

Qalb: Largest State-of-the-Art Urdu Large Language Model for 230M Speakers with Systematic Continued Pre-training

Qalb:面向2.3亿使用者的最先进的乌尔都语大型语言模型,采用系统性持续预训练

Muhammad Taimoor Hassan, Jawad Ahmed, Muhammad Awais

机构 * Auburn University, USA(美国阿伯杜大学) BHT Berlin, Germany(柏林BHT学院) BTU Cottbus, Germany(库滕堡工业大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Qalb通过持续预训练和监督微调,为乌尔都语构建了最先进的大型语言模型,显著提升了在多种任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08472 2026-01-14 cs.CL cs.AI 62%

sui-1: Grounded and Verifiable Long-Form Summarization

sui-1:可验证的长文本摘要

Benedikt Droste, Jan Philipp Harries, Maximilian Idahl, Björn Plüster

机构 * ellamind

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 sui-1通过生成带引用的摘要,解决了大型语言模型摘要不可验证的问题,展示了任务特定训练在引用支持摘要中的优越性。

Comments 13 pages, 4 figures, model weights at https://huggingface.co/ellamind/sui-1-24b

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08003 2026-01-14 cs.CL cs.AI cs.MA 62%

LLM Review: Enhancing Creative Writing via Blind Peer Review Feedback

LLM Review: 通过盲审同行反馈增强创造性写作

Weiyue Li, Mingxiao Song, Zhenda Shen, Dachuan Zhao, Yunfan Long, Yi Li, Yongce Li, Ruyi Yang, Mengyu Wang

机构 * Harvard University(哈佛大学) Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 LLM Review通过盲审同行反馈机制提升创造性写作,实验显示其优于多智能体基线,并使小模型超越大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02333 2026-01-14 cs.CL cs.AI cs.SI 62%

Human Mobility Datasets Enriched With Contextual and Social Dimensions

具有上下文和社会维度的人类移动数据集

Chiara Pugliese, Francesco Lettich, Guido Rocchietti, Chiara Renso, Fabio Pinelli

机构 * IIT-CNR(意大利理工学院-克雷莫纳国家研究委员会) ISTI-CNR(意大利信息科学研究所-克雷莫纳国家研究委员会) IMT Lucca(利卡大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出两个结合语义丰富和社交媒体数据的人类移动数据集,用于多模态移动分析与知识图谱构建。

Comments 5 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08464 2026-01-14 cs.CV cs.AI 57%

CoMa: Contextual Massing Generation with Vision-Language Models

CoMa:基于视觉-语言模型的上下文体量生成

Evgenii Maslov, Valentin Khrulkov, Anastasia Volkova, Anton Gusarov, Andrey Kuznetsov, Ivan Oseledets

机构 * FusionBrain Lab(融合大脑实验室) Innopolis University(因诺普里斯大学) Institute of Numerical Mathematics(数值数学研究所)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 CoMa提出基于视觉-语言模型的自动化框架,生成基于功能需求和场地背景的建筑体量,引入CoMa-20K数据集并验证了VLMs在生成上下文敏感体量选项中的潜力。

Comments Code and dataset will be released later

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08342 2026-01-14 cs.CL 57%

Detecting Mental Manipulation in Speech via Synthetic Multi-Speaker Dialogue

通过合成多说话对话检测心理操控

Run Chen, Wen Liang, Ziwei Gong, Lin Ai, Julia Hirschberg

机构 * Columbia University(哥伦比亚大学) Red Hat(红帽公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出首个通过合成多说话对话检测心理操控的研究,揭示语音与文本在检测准确性上的差异,强调多模态对话系统中模态意识的重要性。

Comments Accepted to IWSDS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03603 2026-01-14 cs.LG 57%

A Comparative Study of Traditional Machine Learning, Deep Learning, and Large Language Models for Mental Health Forecasting using Smartphone Sensing Data

基于智能手机传感数据的传统机器学习、深度学习和大语言模型在心理健康预测中的比较研究

Kaidong Feng, Zhu Sun, Roy Ka-Wei Lee, Xun Jiang, Yin-Leng Theng, Yi Ding

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Tianqiao and Chrissy Chen Institute(田桥和克里斯西·陈研究所) Nanyang Technological University(南洋理工大学) Purdue University(普渡大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文比较了传统机器学习、深度学习和大语言模型在心理健康预测中的表现,发现深度学习模型在整体性能上最佳,个性化策略显著提升严重心理健康状态的预测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08001 2026-01-14 cs.AI 57%

Interpreting Fedspeak with Confidence: A LLM-Based Uncertainty-Aware Framework Guided by Monetary Policy Transmission Paths

以信心解读Fedspeak:一种基于大语言模型的不确定性感知框架,由货币政策传导路径引导

Rui Yao, Qi Chai, Jinhai Yao, Siyuan Li, Junhao Chen, Qi Zhang, Hao Wang

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的不确定性感知框架,用于解读Fedspeak并分类其货币政策立场,通过动态不确定性解码模块提升模型可靠性与准确性。

Comments Accepted by AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08155 2026-01-14 cs.CV 50%

Instance-Aligned Captions for Explainable Video Anomaly Detection

实例对齐的描述用于可解释的视频异常检测

Inpyo Song, Minjun Joo, Joonhyung Kwon, Eunji Jeon, Jangwon Lee

机构 * SungKyunKwan University(顺 Kyun 峰大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出实例对齐的描述方法,用于提升视频异常检测的可解释性和可信度,通过空间定位和实例关联增强解释的可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏