arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10549 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10549 篇

2511.05080 2026-01-21 cs.CL 57%

An Architectural Advantage of The Instruction-Tuned LLM in Containing The Readability-Accuracy Tension in Text Simplification

指令调优LLM在文本简化中缓解可读性-准确性张力的优势

P. Bilha Githinji, Aikaterini Meilliou, Zeming Liang, Lian Zhang, Peiwu Qin

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究通过比较指令调优和推理增强的LLM,发现指令调优在文本简化中能更有效平衡可读性与准确性,提升话语忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00332 2026-01-21 cs.AI cs.CE 57%

When Hallucination Costs Millions: Benchmarking AI Agents in High-Stakes Adversarial Financial Markets

当幻觉成本百万:在高风险对抗性金融市场中基准测试AI代理

Zeshi Dai, Zimo Peng, Zerui Cheng, Ryan Yihe Li

机构 * Surf AI, Cybertino Lab(Surf AI,Cybertino 实验室) Princeton University(普林斯顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 CAIA基准测试揭示了AI在对抗性金融市场中的能力缺口,指出当前模型在面对虚假信息和不可逆决策时表现不佳,强调对抗鲁棒性对可信AI的重要性。

Comments 15 pages, 5 figures, 4 tables; Accepted to AAAI 2026 (AI-4-Finance Workshop - Oral, top 10%); In submission to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24294 2026-01-21 cs.CL cs.HC 57%

LOGOS: LLM-driven End-to-End Grounded Theory Development and Schema Induction for Qualitative Research

LOGOS: 基于大语言模型的端到端 grounded theory 开发与模式诱导用于定性研究

Xinyu Pi, Qisen Yang, Chuong Nguyen

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 LOGOS 是一种基于大语言模型的端到端框架,通过自动化 grounded theory 工作流程,实现定性研究的结构化理论开发和模式诱导,显著提升了研究的可扩展性和理论精确度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16101 2026-01-21 cs.AI cs.IR 57%

Worse than Zero-shot? A Fact-Checking Dataset for Evaluating the Robustness of RAG Against Misleading Retrievals

比零样本更差?一个评估RAG在误导检索中鲁棒性的事实核查数据集

Linda Zeng, Rithwik Gupta, Divij Motwani, Yi Zhang, Diji Yang

机构 * The Harker School(哈克尔学校) Irvington High School(艾尔文顿高中) Palo Alto High School(帕洛阿尔托高中) University of California Santa Cruz(加州大学圣克鲁兹分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 RAGuard是首个评估RAG系统在误导检索中鲁棒性的基准,揭示LLM在面对误导信息时的表现劣于零样本基线。

Comments Advances in Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11468 2026-01-19 cs.AI cs.IT math.IT 57%

Exploring LLM Features in Predictive Process Monitoring for Small-Scale Event-Logs

探索LLM特性在小规模事件日志预测过程监控中的应用

Alessandro Padella, Massimiliano de Leoni, Marlon Dumas

机构 * University of Tartu(塔尔图大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于LLM的预测过程监控方法,通过扩展框架评估其通用性、语义利用和推理能力,在小规模事件日志中实现了优于传统方法的预测性能。

Comments 19 pages, 4 figure, TMIS journal submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10110 2026-01-19 cs.CL cs.HC 57%

Generate-Then-Validate: A Novel Question Generation Approach Using Small Language Models

生成后再验证:一种利用小语言模型的新型问题生成方法

Yumou Wei, John Stamper, Paulo F. Carvalho

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种利用小语言模型的新型问题生成方法,通过生成后再验证策略生成高质量问题,验证了其在学习分析中的有效性。

Comments Accepted as a full research paper for the 16th International Conference on Learning Analytics and Knowledge (LAK'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11039 2026-01-19 cs.SD cs.CL 57%

SonicBench: Dissecting the Physical Perception Bottleneck in Large Audio Language Models

SonicBench: 解剖大音频语言模型中的物理感知瓶颈

Yirong Sun, Yanjun Chen, Xin Qiu, Gang Zhang, Hongyu Chen, Daokuan Wu, Chengming Li, Min Yang, Dawei Zhu, Wei Zhang, Xiaoyu Shen

机构 * Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative, Institute of Digital Twin, EIT(宁波空间智能与数字衍生关键实验室,数字孪生研究院,EIT) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院) Shenzhen University of Advanced Technology(深圳先进技术大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学) Amazon AGI(亚马逊人工智能)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 SonicBench通过评估大音频语言模型在物理属性感知上的能力,揭示其在基础听觉理解上的不足,指出瓶颈在于对齐和解码阶段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10131 2026-01-19 cs.AI cs.MA 57%

M^4olGen: Multi-Agent, Multi-Stage Molecular Generation under Precise Multi-Property Constraints

M^4olGen: 多智能体、多阶段分子生成在精确多属性约束下

Yizhan Li, Florence Cloutier, Sifan Wu, Ali Parviz, Boris Knyazev, Yan Zhang, Glen Berseth, Bang Liu

机构 * DIRO & Université de Montréal(DIRO与蒙特利尔大学) Mila – Quebec AI Institute(魁北克人工智能研究所) Institut Courtois(Courtois研究所) Samsung AI Lab, Montreal(三星AI实验室) Canada CIFAR AI Chair(加拿大CIFAR人工智能 chair)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 M^4olGen通过多智能体和强化学习框架,在多属性约束下实现精确分子生成,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08689 2026-01-19 cs.CL 57%

QuantEval: A Benchmark for Financial Quantitative Tasks in Large Language Models

QuantEval:大型语言模型中金融量化任务的基准测试

Zhaolu Kang, Junhao Gong, Wenqing Hu, Shuo Yin, Kehan Jiang, Zhicheng Fang, Yingjie He, Chunlei Meng, Rong Fu, Dongyang Chen, Leqi Zheng, Eric Hanchen Jiang, Yunfei Feng, Yitong Leng, Junfan Zhu, Xiaoyou Chen, Xi Yang, Richeng Xuan

机构 * Peking University(北京大学) Tsinghua University(清华大学) Fudan University(复旦大学) University of Macau(澳门大学) University of California, Los Angeles(加州大学洛杉矶分校) Shanghai Jiao Tong University(上海交通大学) Imperial College London(伦敦帝国理工学院) University of Chicago(芝加哥大学) Shanghai Weina Software Technology(上海韦纳软件技术) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 QuantEval是一个用于评估大型语言模型在金融量化任务中能力的基准测试,涵盖知识问答、数学推理和策略编程,通过回测框架评估模型性能,并展示了改进方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01386 2026-01-19 cs.LG 57%

ThinkEval: Practical Evaluation of Knowledge Leakage in LLM Editing using Thought-based Knowledge Graphs

ThinkEval: 基于思维的知识图谱对 LLM 编辑中知识泄漏的实用评估

Manit Baser, Dinil Mon Divakaran, Mohan Gurusamy

机构 * Electrical and Computer Engineering National University of Singapore(新加坡国立大学电子与计算机工程系) A*STAR Institute for Infocomm Research (A*STAR I 2 R), Singapore(新加坡A*STAR信息与通信研究机构)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 ThinkEval通过构建专门知识图谱评估LLM编辑中的间接知识泄漏,揭示了现有编辑技术在平衡知识抑制与保留方面的不足。

Comments Accepted to TMLR

Journal ref Transactions on Machine Learning Research (01/2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10660 2026-01-16 cs.CL 57%

Detecting Winning Arguments with Large Language Models and Persuasion Strategies

利用大型语言模型和说服策略检测获胜论点

Tiziano Labruna, Arkadiusz Modzelewski, Giorgio Satta, Giovanni Da San Martino

机构 * University of Padua(帕多瓦大学) Polish-Japanese Academy of Information Technology(波兰-日本信息科技学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文利用大型语言模型和说服策略分析论证文本,通过多策略评分方法提升说服力预测,并公开发布主题注释数据集以促进研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10156 2026-01-16 cs.CL 57%

ToolSafe: Enhancing Tool Invocation Safety of LLM-based agents via Proactive Step-level Guardrail and Feedback

ToolSafe: 通过主动的步骤级防护和反馈提升基于LLM的代理的工具调用安全性

Yutao Mou, Zhangchi Xue, Lijun Li, Peiyang Liu, Shikun Zhang, Wei Ye, Jing Shao

机构 * National Engineering Research Center for Software Engineering, Peking University(软件工程国家工程研究中心,北京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 ToolSafe通过构建TS-Bench和TS-Guard模型,结合TS-Flow框架,有效减少LLM代理的有害工具调用并提升任务完成率。

Comments Work in Progress. Code available: https://github.com/MurrayTom/ToolSafe

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10020 2026-01-16 cs.CL 57%

EHRNavigator: A Multi-Agent System for Patient-Level Clinical Question Answering over Heterogeneous Electronic Health Records

EHRNavigator: 一种用于异构电子健康记录上患者级临床问答的多智能体系统

Lingfei Qian, Mauro Giuffre, Yan Wang, Huan He, Qianqian Xie, Xuguang Ai, Xeuqing Peng, Fan Ma, Ruey-Ling Weng, Donald Wright, Adan Wang, Qingyu Chen, Vipina K. Keloth, Hua Xu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 EHRNavigator通过多智能体系统在异构电子健康记录上实现患者级临床问答,展示出高准确率和高效响应,有效连接基准评估与临床应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10010 2026-01-16 cs.CV cs.AI 57%

VERHallu: Evaluating and Mitigating Event Relation Hallucination in Video Large Language Models

VERHallu: 评估和缓解视频大语言模型中的事件关系幻觉

Zefan Zhang, Kehua Zhu, Shijie Jiang, Hongyuan Lu, Shengkai Sun, Tian Bai

机构 * College of Computer Science and Technology, Key Laboratory of Symbolic Computation and Knowledge Engineering, Ministry of Education, Jilin University(吉林大学计算机科学与技术学院,符号计算与知识工程重点实验室,教育部,吉林大学) College of Software, Jilin University(吉林大学软件学院) Facemind Group(FaceMind集团) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出VERHallu基准,用于评估和缓解视频大语言模型中的事件关系幻觉,通过关键帧传播策略提升多事件理解能力。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09972 2026-01-16 cs.AI 57%

Chinese Labor Law Large Language Model Benchmark

中国劳动法大语言模型基准

Zixun Lan, Maochun Xu, Yifan Ren, Rui Wu, Jianghui Zhou, Xueyang Cheng, Jianan Ding Ding, Xinheng Wang, Mingmin Chi, Fei Ma

机构 * Department of Mechatronics and Robotics, Xi’an Jiaotong–Liverpool University(机械与机器人系,西安交通大学利物浦大学) Department of Applied Mathematics, Xi’an Jiaotong–Liverpool University(应用数学系,西安交通大学利物浦大学) Hansheng Lawyers Building(翰盛律师事务所) Suzhou Gewu Digital Technology Co., Ltd.(苏州葛武数字技术有限公司) Kenneth Wang School of Law, Soochow University(肯尼斯·王法学院,苏州大学) College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出LabourLawLLM和LabourLawBench,专门针对中国劳动法任务,通过精确的法律知识和复杂推理提升法律AI的应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09713 2026-01-16 cs.CL 57%

LLM-Driven Preference Data Synthesis for Proactive Prediction of the Next User Utterance in Human-Machine Dialogue

基于大语言模型的偏好数据合成用于人机对话中下一用户话语的前瞻性预测

Jinqiang Wang, Huansheng Ning, Jianguo Ding, Tao Zhu, Liming Chen, Chris Nugent

机构 * School of Computer & Communication Engineering, University of Science and Technology Beijing(计算机与通信工程学院,北京科技大学) Department of Computer Science, Blekinge institute of Technology(计算机科学系,布莱金厄理工大学) School of Computer Science, University of South China(计算机科学学院,南方大学) School of Computer Science and Technology, Dalian University of Technology(计算机科学与技术学院,大连理工大学) School of Computing, Ulster University(计算机科学学院,乌斯特大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 ProUtt通过意图树建模和偏好数据合成,提升人机对话中下一次用户发言的预测精度。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18691 2026-01-16 cs.CL 57%

Investigating LLM Capabilities on Long Context Comprehension for Medical Question Answering

探究大语言模型在医疗问答中的长上下文理解能力

Feras AlMannaa, Talia Tseriotou, Jenny Chim, Maria Liakata

机构 * Istanbul Aydın University(伊斯坦布尔阿迪兰大学) Queen Mary University of London(伦敦女王学院) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究探讨大语言模型在医疗问答中处理长上下文任务的能力,分析了模型大小、记忆问题及RAG方法的效果,揭示了其在不同任务中的优势与限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16821 2026-01-16 cs.NI cs.LG eess.SP 57%

LLM-Based Emulation of the Radio Resource Control Layer: Towards AI-Native RAN Protocols

基于大语言模型的无线资源控制层仿真:迈向AI原生的无线接入网络协议

Ziming Liu, Bryan Liu, Alvaro Valcarce, Xiaoli Chu

机构 * School of Electrical and Electronic Engineering, The University of Sheffield(电子与电气工程学院,谢菲尔德大学) Nokia Bell Labs(诺基亚贝尔实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出基于大语言模型的RRC层仿真方法,通过参数高效适应和模式受限提示,实现高精度协议仿真,展示了AI原生RAN协议的可行性。

Comments This work has been submitted to the IEEE for possible publication. Focuses on applying LLMs to 5G RRC protocol generation; primary: cs.NI; cross-list: eess.SP, cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09613 2026-01-15 cs.CV cs.AI 57%

CogRail: Benchmarking VLMs in Cognitive Intrusion Perception for Intelligent Railway Transportation Systems

CogRail: 对智能铁路运输系统中认知入侵感知的视觉语言模型进行基准测试

Yonglin Tian, Qiyao Zhang, Wei Xu, Yutong Wang, Yihao Wu, Xinyi Li, Xingyuan Dai, Hui Zhang, Zhiyong Cui, Baoqing Guo, Zujun Yu, Yisheng Lv

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Automation, Beijing Institute of Technology(自动化学院,北京理工大学) Signal & Communication Research Institute, China Academy of Railway Sciences(信号与通信研究所,中国铁路科学研究院) Beijing Huairou Academy of Parallel Sensing(北京怀柔平行感知院) School of Computer Science and Technology, Beijing Jiaotong University(计算机科学与技术学院,北京交通大学) State Key Lab of Intelligent Transportation Systems, School of Transportation Science and Engineering, Beihang University(智能交通系统国家重点实验室,交通科学与工程学院,北京航空航天大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 CogRail提出一个用于评估视觉语言模型在认知入侵感知任务中性能的基准,通过联合微调框架提升模型在时空推理和威胁分析中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05755 2026-01-15 cs.CR cs.AI 57%

VIGIL: Defending LLM Agents Against Tool Stream Injection via Verify-Before-Commit

VIGIL: 通过验证后再提交协议保护LLM代理免受工具流注入攻击

Junda Lin, Zhaomeng Zhou, Zhi Zheng, Shuochen Liu, Tong Xu, Yong Chen, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) North Automatic Control Technology Research Institute(北自动控制技术研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 VIGIL通过验证后再提交协议保护LLM代理免受工具流注入攻击,有效提升安全性和效用平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09136 2026-01-15 cs.CV cs.AI 57%

SkinFlow: Efficient Information Transmission for Open Dermatological Diagnosis via Dynamic Visual Encoding and Staged RL

SkinFlow: 通过动态视觉编码和分阶段强化学习实现开放性皮肤病诊断的高效信息传输

Lijun Liu, Linwei Chen, Zhishou Zhang, Meng Tian, Hengfu Cui, Ruiyang Li, Zhaocheng Liu, Qiang Ju, Qianxi Li, Hong-Yu Zhou

机构 * Baichuan Inc.(百川公司) Department of Dermatology Peking University First Hospital(北京大学第一医院皮肤科) Beijing Key Laboratory of Molecular Diagnosis on Dermatoses(北京分子皮肤病诊断重点实验室) National Clinical Research Center for Skin and Sexually Transmitted Diseases(国家皮肤及性传播疾病临床医学研究中心) NMPA Key Laboratory for Quality Control and Evaluation of Cosmetics(国家药监局化妆品质量控制与评价重点实验室) School of Biomedical Engineering Tsinghua University(清华大学生物医学工程学院) University of Hong Kong(香港大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 SkinFlow通过动态视觉编码和分阶段强化学习提升皮肤病诊断效率,实现比通用模型更优的准确率

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09130 2026-01-15 eess.IV cs.AI cs.CV 57%

Equi-ViT: Rotational Equivariant Vision Transformer for Robust Histopathology Analysis

Equi-ViT:用于鲁棒病理学分析的旋转等变视觉变换器

Fuyao Chen, Yuexi Du, Elèonore V. Lieffrig, Nicha C. Dvornek, John A. Onofrey

机构 * Yale University(耶鲁大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 Equi-ViT通过引入等变卷积核提升ViT在病理学图像中的旋转鲁棒性和数据效率。

Comments Accepted by IEEE ISBI 2026 4-page paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09036 2026-01-15 cs.CL cs.IR 57%

SpectraQuery: A Hybrid Retrieval-Augmented Conversational Assistant for Battery Science

SpectraQuery: 一种用于电池科学的混合检索增强型对话助手

Sreya Vangara, Jagjit Nanda, Yan-Kai Tzeng, Eric Darve

机构 * Mechanical Engineering, Stanford University(斯坦福大学机械工程系) Applied Energy Division, SLAC National Accelerator Laboratory(SLAC国家加速器实验室应用能源部门) Institute of Computational and Mathematical Engineering, Stanford University(斯坦福大学计算与数学工程研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 SpectraQuery通过结合结构化数据库和文献语料库,为电池科学提供检索增强型对话助手,有效整合数值证据与机理解释,提升科学推理效率。

Comments 11 pages, 8 figures, appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08183 2026-01-15 cs.CV cs.AI 57%

GI-Bench: A Panoramic Benchmark Revealing the Knowledge-Experience Dissociation of Multimodal Large Language Models in Gastrointestinal Endoscopy Against Clinical Standards

GI-Bench: 一个全景基准测试,揭示多模态大语言模型在内窥镜检查中与临床标准相比的知识-经验脱节

Yan Zhu, Te Luo, Pei-Yao Fu, Zhen Zhang, Zi-Long Wang, Yi-Fan Qu, Zi-Han Geng, Jia-Qi Xu, Lu Yao, Li-Yun Ma, Wei Su, Wei-Feng Chen, Quan-Lin Li, Shuo Wang, Ping-Hong Zhou

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 GI-Bench通过评估多模态大语言模型在胃肠内窥镜中的性能,揭示其在诊断推理和空间定位方面的不足,发现模型在语言流畅度上优于人类,但事实准确性较低。

Comments 45 pages, 17 figures, 6 tables. Leaderboard available at: https://roterdl.github.io/GIBench/ . Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07309 2026-01-15 cs.CL 57%

Agent Bain vs. Agent McKinsey: A New Text-to-SQL Benchmark for the Business Domain

Agent Bain vs. Agent McKinsey:业务领域的新文本到SQL基准测试

Yue Li, Ran Tao, Derek Hommel, Yusuf Denizay Dönder, Sungyong Chang, David Mimno, Unso Eun Seo Jo

机构 * Cornell University(康奈尔大学) Gena AI

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 CORGI是一个新的文本到SQL基准测试,旨在评估业务领域中更复杂的问题,如预测和推荐,揭示LLM在处理复杂任务时的性能下降。

Comments 23 pages, under review for ACL ARR

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08464 2026-01-14 cs.CV cs.AI 57%

CoMa: Contextual Massing Generation with Vision-Language Models

CoMa:基于视觉-语言模型的上下文体量生成

Evgenii Maslov, Valentin Khrulkov, Anastasia Volkova, Anton Gusarov, Andrey Kuznetsov, Ivan Oseledets

机构 * FusionBrain Lab(融合大脑实验室) Innopolis University(因诺普里斯大学) Institute of Numerical Mathematics(数值数学研究所)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 CoMa提出基于视觉-语言模型的自动化框架,生成基于功能需求和场地背景的建筑体量,引入CoMa-20K数据集并验证了VLMs在生成上下文敏感体量选项中的潜力。

Comments Code and dataset will be released later

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08342 2026-01-14 cs.CL 57%

Detecting Mental Manipulation in Speech via Synthetic Multi-Speaker Dialogue

通过合成多说话对话检测心理操控

Run Chen, Wen Liang, Ziwei Gong, Lin Ai, Julia Hirschberg

机构 * Columbia University(哥伦比亚大学) Red Hat(红帽公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出首个通过合成多说话对话检测心理操控的研究,揭示语音与文本在检测准确性上的差异,强调多模态对话系统中模态意识的重要性。

Comments Accepted to IWSDS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03603 2026-01-14 cs.LG 57%

A Comparative Study of Traditional Machine Learning, Deep Learning, and Large Language Models for Mental Health Forecasting using Smartphone Sensing Data

基于智能手机传感数据的传统机器学习、深度学习和大语言模型在心理健康预测中的比较研究

Kaidong Feng, Zhu Sun, Roy Ka-Wei Lee, Xun Jiang, Yin-Leng Theng, Yi Ding

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Tianqiao and Chrissy Chen Institute(田桥和克里斯西·陈研究所) Nanyang Technological University(南洋理工大学) Purdue University(普渡大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文比较了传统机器学习、深度学习和大语言模型在心理健康预测中的表现,发现深度学习模型在整体性能上最佳,个性化策略显著提升严重心理健康状态的预测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08001 2026-01-14 cs.AI 57%

Interpreting Fedspeak with Confidence: A LLM-Based Uncertainty-Aware Framework Guided by Monetary Policy Transmission Paths

以信心解读Fedspeak:一种基于大语言模型的不确定性感知框架,由货币政策传导路径引导

Rui Yao, Qi Chai, Jinhai Yao, Siyuan Li, Junhao Chen, Qi Zhang, Hao Wang

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的不确定性感知框架,用于解读Fedspeak并分类其货币政策立场,通过动态不确定性解码模块提升模型可靠性与准确性。

Comments Accepted by AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07638 2026-01-13 cs.AI 57%

SALT-KG: A Benchmark for Semantics-Aware Learning on Enterprise Tables

SALT-KG:一个面向企业表格的语义感知学习基准

Isaiah Onando Mulang, Felix Sasaki, Tassilo Klein, Jonas Kolk, Nikolay Grechanov, Johannes Hoffart

机构 * SAP SE(SAP股份有限公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 SALT-KG是一个面向企业表格的语义感知学习基准,通过链接元数据知识图与多表事务数据,评估模型在表格证据和上下文语义上推理的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏