arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-14 至 2026-01-14 共收录 78 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 17 篇

2601.08288 2026-01-14 cs.AI 70%

OpenMic: A Multi-Agent-Based Stand-Up Comedy Generation System

OpenMic: 基于多智能体的站立喜剧生成系统

Yuyang Wu, Hanzhong Cao, Jianhao Chen, Yufei Li

机构 * School of Electronics Engineering and Computer Science, Peking University(电子工程与计算机科学学院,北京大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 OpenMic通过多智能体系统生成基于文化背景的站立喜剧,结合检索增强生成和专用JokeWriter提升幽默与节奏表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08141 2026-01-14 cs.CL cs.AI cs.LG 67%

Qalb: Largest State-of-the-Art Urdu Large Language Model for 230M Speakers with Systematic Continued Pre-training

Qalb:面向2.3亿使用者的最先进的乌尔都语大型语言模型,采用系统性持续预训练

Muhammad Taimoor Hassan, Jawad Ahmed, Muhammad Awais

机构 * Auburn University, USA(美国阿伯杜大学) BHT Berlin, Germany(柏林BHT学院) BTU Cottbus, Germany(库滕堡工业大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Qalb通过持续预训练和监督微调,为乌尔都语构建了最先进的大型语言模型,显著提升了在多种任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08472 2026-01-14 cs.CL cs.AI 62%

sui-1: Grounded and Verifiable Long-Form Summarization

sui-1:可验证的长文本摘要

Benedikt Droste, Jan Philipp Harries, Maximilian Idahl, Björn Plüster

机构 * ellamind

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 sui-1通过生成带引用的摘要,解决了大型语言模型摘要不可验证的问题,展示了任务特定训练在引用支持摘要中的优越性。

Comments 13 pages, 4 figures, model weights at https://huggingface.co/ellamind/sui-1-24b

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08003 2026-01-14 cs.CL cs.AI cs.MA 62%

LLM Review: Enhancing Creative Writing via Blind Peer Review Feedback

LLM Review: 通过盲审同行反馈增强创造性写作

Weiyue Li, Mingxiao Song, Zhenda Shen, Dachuan Zhao, Yunfan Long, Yi Li, Yongce Li, Ruyi Yang, Mengyu Wang

机构 * Harvard University(哈佛大学) Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 LLM Review通过盲审同行反馈机制提升创造性写作,实验显示其优于多智能体基线,并使小模型超越大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02333 2026-01-14 cs.CL cs.AI cs.SI 62%

Human Mobility Datasets Enriched With Contextual and Social Dimensions

具有上下文和社会维度的人类移动数据集

Chiara Pugliese, Francesco Lettich, Guido Rocchietti, Chiara Renso, Fabio Pinelli

机构 * IIT-CNR(意大利理工学院-克雷莫纳国家研究委员会) ISTI-CNR(意大利信息科学研究所-克雷莫纳国家研究委员会) IMT Lucca(利卡大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出两个结合语义丰富和社交媒体数据的人类移动数据集,用于多模态移动分析与知识图谱构建。

Comments 5 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08464 2026-01-14 cs.CV cs.AI 57%

CoMa: Contextual Massing Generation with Vision-Language Models

CoMa:基于视觉-语言模型的上下文体量生成

Evgenii Maslov, Valentin Khrulkov, Anastasia Volkova, Anton Gusarov, Andrey Kuznetsov, Ivan Oseledets

机构 * FusionBrain Lab(融合大脑实验室) Innopolis University(因诺普里斯大学) Institute of Numerical Mathematics(数值数学研究所)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 CoMa提出基于视觉-语言模型的自动化框架,生成基于功能需求和场地背景的建筑体量,引入CoMa-20K数据集并验证了VLMs在生成上下文敏感体量选项中的潜力。

Comments Code and dataset will be released later

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08342 2026-01-14 cs.CL 57%

Detecting Mental Manipulation in Speech via Synthetic Multi-Speaker Dialogue

通过合成多说话对话检测心理操控

Run Chen, Wen Liang, Ziwei Gong, Lin Ai, Julia Hirschberg

机构 * Columbia University(哥伦比亚大学) Red Hat(红帽公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出首个通过合成多说话对话检测心理操控的研究,揭示语音与文本在检测准确性上的差异,强调多模态对话系统中模态意识的重要性。

Comments Accepted to IWSDS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03603 2026-01-14 cs.LG 57%

A Comparative Study of Traditional Machine Learning, Deep Learning, and Large Language Models for Mental Health Forecasting using Smartphone Sensing Data

基于智能手机传感数据的传统机器学习、深度学习和大语言模型在心理健康预测中的比较研究

Kaidong Feng, Zhu Sun, Roy Ka-Wei Lee, Xun Jiang, Yin-Leng Theng, Yi Ding

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Tianqiao and Chrissy Chen Institute(田桥和克里斯西·陈研究所) Nanyang Technological University(南洋理工大学) Purdue University(普渡大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文比较了传统机器学习、深度学习和大语言模型在心理健康预测中的表现,发现深度学习模型在整体性能上最佳,个性化策略显著提升严重心理健康状态的预测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08001 2026-01-14 cs.AI 57%

Interpreting Fedspeak with Confidence: A LLM-Based Uncertainty-Aware Framework Guided by Monetary Policy Transmission Paths

以信心解读Fedspeak:一种基于大语言模型的不确定性感知框架,由货币政策传导路径引导

Rui Yao, Qi Chai, Jinhai Yao, Siyuan Li, Junhao Chen, Qi Zhang, Hao Wang

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的不确定性感知框架,用于解读Fedspeak并分类其货币政策立场,通过动态不确定性解码模块提升模型可靠性与准确性。

Comments Accepted by AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08155 2026-01-14 cs.CV 50%

Instance-Aligned Captions for Explainable Video Anomaly Detection

实例对齐的描述用于可解释的视频异常检测

Inpyo Song, Minjun Joo, Joonhyung Kwon, Eunji Jeon, Jangwon Lee

机构 * SungKyunKwan University(顺 Kyun 峰大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出实例对齐的描述方法,用于提升视频异常检测的可解释性和可信度,通过空间定位和实例关联增强解释的可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 8 篇

2601.08739 2026-01-14 cs.CL 79%

PrivGemo: Privacy-Preserving Dual-Tower Graph Retrieval for Empowering LLM Reasoning with Memory Augmentation

PrivGemo: 保护隐私的双塔图检索用于增强LLM推理的记忆增强

Xingyu Tan, Xiaoyang Wang, Qing Liu, Xiwei Xu, Xin Yuan, Liming Zhu, Wenjie Zhang

机构 * University of New South Wales(新南威尔士大学) Data61, CSIRO(Data61,CSIRO)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 PrivGemo通过双塔设计和隐私保护机制,实现隐私保护的图检索增强推理,提升LLM在知识密集型任务中的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08444 2026-01-14 cs.AI 79%

Beyond Linearization: Attributed Table Graphs for Table Reasoning

超越线性化:属性表格图用于表格推理

Yuxiang Wang, Junhao Gan, Shengxiang Gao, Shenghao Ye, Zhengyi Yang, Jianzhong Qi

机构 * The University of Melbourne(墨尔本大学) The University of New South Wales(新南威尔士大学) The University of Science and Technology of China(中国科学技术大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出TABGR模型,通过属性表格图保留表格结构并提升推理可解释性,实验表明其在表格推理任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08000 2026-01-14 cs.AI cs.SE 79%

Reasoning over Precedents Alongside Statutes: Case-Augmented Deliberative Alignment for LLM Safety

在法规中进行推理:结合案例的 deliberative 对齐方法用于 LLM 安全性

Can Jin, Rui Wu, Tong Che, Qixin Zhang, Hongwu Peng, Jiahui Zhao, Zhenting Wang, Wenqi Wei, Ligong Han, Zhao Zhang, Yuan Cao, Ruixiang Tang, Dimitris N. Metaxas

机构 * Rutgers University(罗格斯大学) NVIDIA Research(NVIDIA研究) Nanyang Technological University(南洋理工大学) Adobe Research(Adobe研究) University of Connecticut(康涅狄格大学) Fordham University(福特汉姆大学) Google DeepMind(谷歌DeepMind)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出CADA方法,通过案例增强的推理链进行强化学习,提升LLM的安全性和实用性,避免过度依赖规则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04563 2026-01-14 cs.LG cs.AI cs.CL cs.CV 67%

A Vision for Multisensory Intelligence: Sensing, Science, and Synergy

多感官智能的愿景:感知、科学与协同

Paul Pu Liang

机构 * MIT Media Lab and MIT EECS(MIT媒体实验室和MIT电子工程与计算机科学系)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出未来十年多感官人工智能的研究愿景,强调通过感知、科学和协同三大主题推动多感官技术发展,提升人与AI的交互体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02004 2026-01-14 cs.LG cs.CL 62%

AlignSAE: Concept-Aligned Sparse Autoencoders

AlignSAE:概念对齐的稀疏自编码器

Minglai Yang, Xinyu Guo, Zhengliang Shi, Jinhe Bi, Steven Bethard, Mihai Surdeanu, Liangming Pan

机构 * University of Arizona(亚利桑那大学) Peking University(北京大学) Shandong University(山东大学) LMU Munich(慕尼黑大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 AlignSAE通过预训练和后训练课程方法,实现稀疏自编码器特征与概念的对齐,提升模型对特定概念的可控性和可解释性。

Comments 23 pages, 16 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08435 2026-01-14 cs.CL 57%

Fine-Mem: Fine-Grained Feedback Alignment for Long-Horizon Memory Management

细粒度反馈对齐的长期记忆管理:Fine-Mem

Weitao Ma, Xiaocheng Feng, Lei Huang, Xiachong Feng, Zhanyu Ma, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Meituan(美团) Peng Cheng Laboratory(鹏城实验室) The University of Hong Kong(香港大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 Fine-Mem通过细粒度反馈对齐提升长周期内存管理,通过块级奖励和证据锚定奖励分配优化策略,实现更高效的内存操作与长期效用对齐。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08158 2026-01-14 cs.CL 57%

WISE-Flow: Workflow-Induced Structured Experience for Self-Evolving Conversational Service Agents

WISE-Flow: 基于工作流的结构化经验用于自进化对话服务代理

Yuqing Zhou, Zhuoer Wang, Jie Yuan, Hong Wang, Samson Koelle, Ziwei Zhu, Wei Niu

机构 * George Mason University(乔治·马歇尔大学) Amazon(亚马逊公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 WISE-Flow通过将历史服务交互转化为可重用的程序经验,实现自进化对话服务代理的可靠性和稳定性提升。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11665 2026-01-14 cs.PL cs.MA 50%

StackPilot: Autonomous Function Agents for Scalable and Environment-Free Code Execution

StackPilot: 用于可扩展和无环境代码执行的自主函数代理

Xinkui Zhao, Yifan Zhang, Zhengyi Zhou, Yueshen Xu

专题命中 其他推理 :reasoning(abstract)

AI总结 StackPilot通过自主函数代理和栈式调度策略,实现语言无关的代码验证与执行,提升LLM生成代码的可靠性与可执行性。

Comments This method needs to be reconsidered and there is something wrong with experiment

详情

展开后加载摘要…

URL PDF HTML 收藏