arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-27 至 2026-01-27 共收录 404 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 83 篇

2508.18880 2026-01-27 cs.AI 70%

Challenges for Generative AI in Legal Reasoning

生成AI在法律推理中的挑战

Eljas Linna, Tuula Linna

机构 * Tampere University(塔尔库大学) University of Helsinki(赫尔辛基大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了生成AI在法律推理中的关键挑战,分析了现有AI技术在处理法律问题中的局限性,并提出分阶段采用技术以提升法律推理的严谨性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17084 2026-01-27 physics.chem-ph cs.AI physics.comp-ph 70%

ChemNavigator: Agentic AI Discovery of Design Rules for Organic Photocatalysts

ChemNavigator: 基于代理AI的有机光催化剂设计规则发现

Iman Peivaste, Ahmed Makradi, Salim Belouettar

机构 * Luxembourg Institute of Science and Technology (LIST)(卢森堡科学技术研究所) University of Luxembourg(卢森堡大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ChemNavigator通过代理AI自主发现有机光催化剂设计规则,推导出六个化学基础设计原则,为AI辅助材料发现提供新框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17002 2026-01-27 cs.CL 70%

RAM-SD: Retrieval-Augmented Multi-agent framework for Sarcasm Detection

RAM-SD:基于检索的多智能体框架用于讽刺检测

Ziyang Zhou, Ziqi Liu, Yan Wang, Yiming Lin, Yangbin Chen

机构 * Xi’an Jiaotong–Liverpool University(西安交通大学利物浦大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 RAM-SD通过多智能体框架提升讽刺检测性能,实现77.74%的宏F1值,提供透明推理轨迹。

Comments 12 pages, 4 figures, 6 tables, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18386 2026-01-27 cs.CV 67%

ARMOR: Agentic Reasoning for Methods Orchestration and Reparameterization for Robust Adversarial Attacks

ARMOR: 为对抗攻击的鲁棒性进行方法编排与重参数化中的代理推理

Gabriel Lee Jun Rong, Christos Korgialas, Dion Jia Xu Ho, Pai Chet Ng, Xiaoxiao Miao, Konstantinos N. Plataniotis

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 ARMOR通过视觉语言模型引导的代理协作,提升对抗攻击的鲁棒性和跨架构迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11031 2026-01-27 cs.LG cs.AI cs.CL 67%

Prefill-Guided Thinking for zero-shot detection of AI-generated images

预填充引导的思考用于AI生成图像的零样本检测

Zoher Kachwala, Danishjeet Singh, Danielle Yang, Filippo Menczer

机构 * Observatory on Social Media(社会媒体观察所) Indiana University(印第安纳大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出预填充引导思考方法,通过引导视觉-语言模型推理提升AI生成图像的零样本检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17762 2026-01-27 cs.SE 67%

Multi-Agent End-to-End Vulnerability Management for Mitigating Recurring Vulnerabilities

多智能体端到端漏洞管理用于缓解重复漏洞

Zelong Zheng, Jiayuan Zhou, Xing Hu, Yi Gao, Shengyi Pan

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 MAVM通过多智能体框架实现端到端重复漏洞管理,整合知识库、检测、确认、修复和验证,有效提升漏洞修复准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17219 2026-01-27 cs.RO 67%

Advancing Improvisation in Human-Robot Construction Collaboration: Taxonomy and Research Roadmap

推动人机协同建造中的即兴能力:分类与研究路线图

David Wireko Atibila, Vineet R. Kamat, Carol C. Menassa

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出六级分类法,分析人机协同建造中即兴能力的发展现状与未来研究方向,指出技术、概念和方法学三方面障碍,建议通过增强现实、大语言模型和云系统提升人机协作水平。

Comments 73 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15304 2026-01-27 cs.IR 67%

MLLMRec: A Preference Reasoning Paradigm with Graph Refinement for Multimodal Recommendation

MLLMRec: 基于图细化的多模态推荐偏好推理范式

Yuzhuo Dang, Xin Zhang, Zhiqiang Pan, Yuxiao Duan, Wanyu Chen, Fei Cai, Honghui Chen

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 MLLMRec通过图细化和多模态大语言模型提升多模态推荐的用户偏好推理与物品表示学习准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18552 2026-01-27 cs.CL cs.LG 62%

Unknown Unknowns: Why Hidden Intentions in LLMs Evade Detection

未知未知数:为何大语言模型中的隐藏意图难以被检测

Devansh Srivastav, David Pape, Lea Schönherr

机构 * CISPA Helmholtz Center for Information Security(CISPA赫尔姆霍茨信息安全中心)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL、cs.LG

AI总结 研究揭示大语言模型中隐藏意图难以检测的问题,提出分类法并分析检测方法失效原因,强调需建立稳健框架以应对潜在风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18137 2026-01-27 cs.AI cs.CL 62%

DeepPlanning: Benchmarking Long-Horizon Agentic Planning with Verifiable Constraints

DeepPlanning: 用可验证约束基准测试长周期代理规划

Yinger Zhang, Shutong Jiang, Renhao Li, Jianhong Tu, Yang Su, Lianghao Deng, Xudong Guo, Chenxu Lv, Junyang Lin

机构 * Alibaba Group(阿里巴巴集团)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 DeepPlanning是一个针对长周期代理规划的基准测试,通过多日旅行和多产品购物任务,评估代理在全局约束优化和局部约束推理中的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09394 2026-01-27 cs.CL cs.AI 62%

Beyond Single-Granularity Prompts: A Multi-Scale Chain-of-Thought Prompt Learning for Graph

超越单一粒度提示:用于图的多尺度链式思考提示学习

Ziyu Zheng, Yaming Yang, Ziyu Guan, Wei Zhao, Xinyan Huang, Weigang Lu

机构 * School of Computer Science and Technology(计算机科学与技术学院) Xidian University(西安电子科技大学) School of Artificial Intelligence(人工智能学院) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出多尺度图链式思考提示框架,通过多尺度信息增强图提示学习,提升少样本场景下的性能。

Comments Accepted by WWW2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17489 2026-01-27 cs.LG cs.CL cs.CV 62%

SpatialMath: Spatial Comprehension-Infused Symbolic Reasoning for Mathematical Problem-Solving

SpatialMath: 基于空间认知的符号推理框架用于数学问题解决

Ashutosh Bajpai, Akshat Bhandari, Akshay Nambi, Tanmoy Chakraborty

机构 * Indian Institute of Technology Delhi(印度理工学院德里) Indian Institute of Technology Abu Dhabi(印度理工学院阿布扎克) Microsoft Research(微软研究院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.LG

AI总结 SpatialMath通过整合空间表示到结构化符号推理链中,提升多模态模型在视觉密集型数学问题中的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17197 2026-01-27 cs.CL cs.LG 62%

Reasoning Beyond Literal: Cross-style Multimodal Reasoning for Figurative Language Understanding

超越字面:跨风格多模态推理用于隐喻语言理解

Seyyed Saeid Cheshmi, Hahnemann Ortiz, James Mooney, Dongyeop Kang

机构 * University of Minnesota(明尼苏达大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种三步框架,通过跨风格多模态推理提升隐喻语言理解能力,实验显示推理轨迹和跨风格训练能显著提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08741 2026-01-27 cs.CL cs.AI 62%

Coordinates from Context: Using LLMs to Ground Complex Location References

基于上下文的坐标:利用大语言模型来定位复杂位置参考

Tessa Masis, Brendan O'Connor

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种利用大语言模型来处理复杂位置参考地理编码的方法,展示了其在性能上的优势。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13545 2026-01-27 cs.AI cs.ET cs.MA 57%

TruthTensor: Evaluating LLMs through Human Imitation on Prediction Market under Drift and Holistic Reasoning

TruthTensor:通过人类模仿在预测市场中评估LLM的漂移和整体推理

Shirin Shahabi, Spencer Graham, Haruna Isah

机构 * Inference Labs Inc(Inference Labs公司)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 TruthTensor通过人类模仿在预测市场中评估LLM的漂移和整体推理,提供多维度的评估方法。

Comments 16 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14932 2026-01-27 cs.AI 57%

FOL-Traces: Verified First-Order Logic Reasoning Traces at Scale

FOL-Traces: 在大规模上验证的首阶逻辑推理轨迹

Isabelle Lee, Sarah Liaw, Dani Yogatama

机构 * USC(美国大学) Harvard University(哈佛大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 FOL-Traces是一个大规模验证的首阶逻辑推理轨迹数据集,用于严格评估结构逻辑推理,通过挑战性任务揭示模型在语法意识和推理过程忠实度上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17123 2026-01-27 cs.HC cs.CV cs.RO 50%

Acoustic Field Video for Multimodal Scene Understanding

用于多模态场景理解的声学场视频

Daehwa Kim, Chris Harrison

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出声学场视频作为多模态场景理解的新输入方式,通过整合空间声学数据显著提升视觉-语言模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 88 篇

2601.09028 2026-01-27 cs.CL cs.AI cs.IR 91%

OpenDecoder: Open Large Language Model Decoding to Incorporate Document Quality in RAG

OpenDecoder: 开源大型语言模型解码以纳入文档质量在RAG中

Fengran Mo, Zhan Su, Yuchen Hui, Jinghan Zhang, Jia Ao Sun, Zheyuan Liu, Chao Zhang, Tetsuya Sakai, Jian-Yun Nie

机构 * Clemson University(克莱姆森大学) University of Notre Dame(诺特丹大学) Georgia Institute of Technology(佐治亚理工学院) Waseda University(早稻田大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

AI总结 OpenDecoder通过整合文档质量评估提升RAG模型的鲁棒性,利用相关性、排序和QPP评分优化生成过程。

Comments Accepted by ACM WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16444 2026-01-27 cs.CL 90%

Exploring the Effects of Alignment on Numerical Bias in Large Language Models

探索对大型语言模型中数值偏差的影响

Ayako Sato, Hwichan Kim, Zhousi Chen, Masato Mita, Mamoru Komachi

机构 * Tokyo Metropolitan University(东京 Metropolitan 大学) Hitotsubashi University(立命馆大学) CyberAgent Inc.(CyberAgent 公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)

AI总结 本文研究了对齐对大型语言模型数值偏差的影响,发现对齐会增加偏差,并提出分数范围调整作为缓解策略。

Comments Accepted at AIBSD 2026 (Workshop at AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17344 2026-01-27 cs.CL 90%

The Shadow Self: Intrinsic Value Misalignment in Large Language Model Agents

阴影自我:大型语言模型代理中的内在价值偏差

Chen Chen, Kim Young Il, Yuan Yang, Wenhao Su, Yilin Zhang, Xueluan Gong, Qian Wang, Yongsen Zheng, Ziyao Liu, Kwok-Yan Lam

机构 * Nanyang Technological University(南洋理工大学) Wuhan University(武汉大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 研究提出IMPRESS框架,系统评估大型语言模型代理中的内在价值偏差风险,发现其在不同模型中普遍存在,且受上下文化和框架机制显著影响。

Comments 21 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17312 2026-01-27 cs.CL cs.AI 90%

Meta-Judging with Large Language Models: Concepts, Methods, and Challenges

元评判与大型语言模型:概念、方法与挑战

Hugo Silva, Mateus Mendes, Hugo Gonçalo Oliveira

机构 * University of Coimbra, CISUC/LASI – Centre for Informatics and Systems of the University of Coimbra, Department of Informatics Engineering(科英布拉大学,CISUC/LASI——科英布拉大学信息与系统研究中心,信息工程系) Polytechnic University of Coimbra, Rua da Misericórdia, Lagar dos Cortiços, S. Martinho do Bispo, 3045-093 Coimbra, Portugal(科英布拉理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了LLM-as-a-Meta-Judge在提升自动化评估稳定性与可信度方面的潜力,同时指出需解决的成本、提示敏感性及共享偏差等挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18271 2026-01-27 cs.DL cs.CL 89%

Designing large language model prompts to extract scores from messy text: A shared dataset and challenge

设计大型语言模型提示以从杂乱文本中提取分数:一个共享数据集和挑战

Mike Thelwall

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出一个共享数据集和挑战,旨在通过设计提示提升大型语言模型从杂乱文本中提取分数的准确性。

Journal ref Trends in Information Management, 13(2), paper 1 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16516 2026-01-27 cs.LG 89%

Rethinking Large Language Models For Irregular Time Series Classification In Critical Care

重新思考用于危重监护中不规则时间序列分类的大型语言模型

Feixiang Zheng, Yu Wu, Cecilia Mascolo, Ting Dang

机构 * The University of Melbourne, Australia(墨尔本大学) University of Cambridge, UK(剑桥大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 本文研究了LLMs在不规则ICU时间序列分类中的有效性,发现编码器设计比对齐策略更重要,但LLMs在训练时间和少样本学习中表现欠佳。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01993 2026-01-27 cs.AI 89%

Towards Privacy-Preserving Mental Health Support with Large Language Models

面向隐私保护的大型语言模型在心理健康支持中的应用

Dong Xue, Jicheng Tu, Ming Wang, Xin Yan, Fangzhou Liu, Jie Hu

机构 * IEEE

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出MindChat和MindCorpus,通过多智能体角色扮演框架生成高质量咨询数据,结合联邦学习和差分隐私优化,实现隐私保护的高效心理健康支持系统。

Comments 15 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09493 2026-01-27 cs.IR 89%

Evaluating Conversational Recommender Systems via Large Language Models: A User-Centric Framework

通过大语言模型评估对话推荐系统:一种以用户为中心的框架

Nuo Chen, Quanyu Dai, Xiaoyu Dong, Piaohong Wang, Qinglin Jia, Zhaocheng Du, Zhenhua Dong, Xiao-Ming Wu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出CoRE框架,通过大语言模型评估对话推荐系统,结合用户评价和多代理辩论,提升用户体验评估的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18053 2026-01-27 cs.CL cs.AI cs.LG 88%

Addressing LLM Diversity by Infusing Random Concepts

通过注入随机概念来解决LLM多样性问题

Pulin Agrawal, Prasoon Goyal

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Amazon(亚马逊)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究通过在提示中注入随机概念提高LLM输出多样性,并提出系统评估协议以更系统地研究LLM多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18554 2026-01-27 cs.AI 88%

Deconstructing Instruction-Following: A New Benchmark for Granular Evaluation of Large Language Model Instruction Compliance Abilities

解构指令遵循:一个用于大语言模型指令合规能力细粒度评估的新基准

Alberto Purpura, Li Wang, Sahil Badyal, Eugenio Beaufrand, Adam Faulkner

机构 * Card Intelligence, Capital One(Card Intelligence,Capital One)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出MOSAIC基准,通过细粒度分析揭示大语言模型在复杂指令遵循中的差异与弱点,为提升模型可靠性提供关键洞察。

Comments Paper accepted to EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21679 2026-01-27 cs.CL cs.CY 88%

JiraiBench: A Bilingual Benchmark for Evaluating Large Language Models' Detection of Human Self-Destructive Behavior Content in Jirai Community

JiraiBench:一个双语基准,用于评估大型语言模型在Jirai社区中检测人类自毁行为内容的效果

Yunze Xiao, Tingyu He, Lionel Z. Wang, Yiming Ma, Xingyu Song, Xiaohang Xu, Mona Diab, Irene Li, Ka Chung Ng

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Washington(华盛顿大学) The Hong Kong Polytechnic University(香港理工大学) The University of Tokyo(东京大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 JiraiBench通过双语评估揭示文化接近性在检测自毁内容中的重要性,展示跨语言知识迁移的潜力。

Comments 20 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18346 2026-01-27 cs.CV 88%

Q-Bench-Portrait: Benchmarking Multimodal Large Language Models on Portrait Image Quality Perception

Q-Bench-Portrait:多模态大语言模型在肖像图像质量感知上的基准测试

Sijing Wu, Yunhao Li, Zicheng Zhang, Qi Jia, Xinyue Li, Huiyu Duan, Xiongkuo Min, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 Q-Bench-Portrait首次提出用于评估多模态大语言模型在肖像图像质量感知上的能力,包含2765个三元组,涵盖多种图像来源和质量维度,评估20个模型后发现其表现有限,与人类判断存在差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18712 2026-01-27 cs.CV 88%

LLaVAction: evaluating and training multi-modal large language models for action understanding

LLaVAction:评估和训练多模态大语言模型进行动作理解

Haozhe Qi, Shaokai Ye, Alexander Mathis, Mackenzie W. Mathis

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 LLaVAction通过引入动作标记和两阶段流程提升多模态大语言模型的动作理解能力,显著提升基准测试性能。

Comments https://github.com/AdaptiveMotorControlLab/LLaVAction

Journal ref International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏