What do LLMs Know about Financial Markets? A Case Study on Reddit Market Sentiment Analysis
专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)
通过代数不变量实现LLMs的结构归纳-演绎-演绎推理
机构 * DeepThought Solutions(深思科技) ; Department of Computer Science University of Florida(佛罗里达大学计算机科学系)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出通过代数不变量实现LLMs的结构归纳-演绎-演绎推理框架,通过五种代数不变量确保推理链中结论的可靠性,防止逻辑不一致的累积。
Comments 10 pages + 3 pages references. Accepted as a poster at the ICLR 2026 Workshop for LLM Reasoning
行动中的理论思维:动态人机协作中的指令推断任务
机构 * North Carolina State University(北卡罗来纳州立大学) ; Delft University of Technology(代尔夫特理工大学)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出指令推断任务,通过Tomcat模型评估人机协作中理论思维能力,实验表明Fs-CoT在GPT-4o和DeepSeek-R1上表现接近人类参与者。
Comments 66 pages with appendix, 10 figures (Appendix: 26 Figures), 11 tables. Code available at: https://github.com/fardinsaad/Tomcat-LLM
专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)
Comments NeurIPS 2023 Foundation Models for Decision Making Workshop
知晓并非总能表达:视觉语言模型中空间编码何时能抵达答案?
机构 * Peking University(北京大学) ; Tsinghua University(清华大学)
专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL
AI总结 本研究针对视觉语言模型的空间编码何时能抵达答案的问题,采用方向干预方法,揭示了因果影响仅出现在中深层、文本思维链与视觉接地提示的不同作用等传输模式,为解决编码-接地差距提供了新视角。
Comments Accepted to appear in the EMNLP 2026 Main Conference
单独对齐,共同错位:预测大语言模型智能体群体中的对抗捕获
专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.CL
AI总结 该研究针对LLM智能体群体,提出从群体无攻击时的良性运行状态校准响应函数,可提前预测坚定少数群体引发的对抗捕获,且捕获为临时状态,孤立对齐不等同于群体对齐。
洗白仇恨内容、抹黑无害内容:针对基于大语言模型的内容审核的标注者式反驳攻击
机构 * Dalian University of Technology(大连理工大学) ; Zhejiang University(浙江大学) ; University of Science and Technology of China(中国科学技术大学) ; Tencent(腾讯) ; Tongji University(同济大学)
专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 该研究针对LLMs内容审核提出标注者式反驳攻击,发现洗白仇恨内容与抹黑无害内容的攻击效果存在模型特异性不对称性,防御措施无法完全消除攻击影响,凸显需定向防御与反馈鲁棒性评估。
更准确还是更高效?评估用于数学推理的本地部署紧凑型开放权重语言模型
机构 * Florida Institute of Technology(佛罗里达理工学院) ; College of Engineering and Science(工程与科学学院)
专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.AI
AI总结 本文提出了一种用于评估本地部署语言模型数学推理性能的受控流程,研究三款紧凑型开放权重模型后发现,无单一模型占优,仅靠准确性不足以选择本地模型。
Comments 8 pages, 1 figure, 6 tables
基于视觉语言模型的证据门控任务与运动规划
机构 * Waseda University(早稻田大学) ; Flinders University(弗林德斯大学)
专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI
AI总结 针对机器人执行自然语言指令长时操纵任务时的部分可观测问题,提出 EAFG 框架,通过视觉证据获取与可行性门控提升食谱完成率并减少无效操纵尝试。
面向AI友好的制图学:理解颜色设计如何影响基础模型在顺序 choropleth 地图上的空间推理
机构 * School of Geographic Sciences, Hunan Normal University(湖南师范大学地理科学学院) ; Hunan Key Laboratory of Geospatial Big Data Mining and Application(湖南省地理空间大数据挖掘与应用重点实验室) ; School of Information and Communication Engineering, Beijing University of Posts and Telecommunications(北京邮电大学信息与通信工程学院) ; School of Geography and Information Engineering, China University of Geosciences(中国地质大学(武汉)地理与信息工程学院) ; Advanced Interdisciplinary Institute of Satellite Applications, State Key Laboratory of Earth Surface Processes and Resource Ecology, Faculty of Geographical Science, Beijing Normal University(北京师范大学地理科学学部卫星应用先进交叉研究院、地表过程与资源生态国家重点实验室)
专题命中 推理与问题求解 :foundation model(title,abstract);分类 cs.AI
AI总结 本研究探究颜色设计对基础模型空间推理的影响,构建基准评估多模态模型,发现顺序颜色排序和足够对比度对机器地图理解关键,为AI友好制图提供实证指导。
Comments 42 pages, 12 figures, 13 tables
层次间推理:通过层选择性融合恢复视频-语言模型中的时间推理
机构 * National University of Singapore(新加坡国立大学) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学)
专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);分类 cs.CL
AI总结 本文提出MERIT框架,通过层选择性融合提升视频-语言模型的时间推理能力,同时保持时间感知能力,优于全模型融合和随机层选择。
StateBridge:面向大语言模型多智能体系统潜在通信的无训练隐藏状态对齐
机构 * School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院)
专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 StateBridge 是一种无训练的潜在通信方法,通过闭式正交变换对齐大语言模型多智能体的隐藏状态,在 26 个模型-任务对中 22 个取得最优或并列最优性能,优于基线。
Comments 18 pages, 3 figures, 4 tables, accepted by COLM2026
Mr3D-VL:面向多参数3D磁共振成像的通用视觉语言基础模型
专题命中 推理与问题求解 :foundation model(title,abstract);language model(abstract);分类 cs.AI
AI总结 本文针对现有3D视觉语言模型无法满足多参数3D MRI跨模态协同推理需求的问题,提出Mr3D-VL模型,通过特定设计实现性能提升,在多项任务上优于同规模的领域及通用模型。
面向拜占庭鲁棒的大语言模型智能体协作的分层认证语义承诺
机构 * University of Glasgow(格拉斯哥大学) ; University of Western Ontario(西部 Ontario 大学)
专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI
AI总结 提出H-CSC协议,将基于嵌入的终结性信号转换为三种类型输出(语义承诺、判决承诺或显式中止),实现大语言模型智能体拜占庭协作的最终性控制,在语义投毒和拜占庭攻击下保持低角度偏差和高中止率。
Comments 43 pages, 5 figures, 20 tables, 1 algorithm. Substantial revision: new title, new framing, new downstream-audit experiment; supersedes v1
Evo-Bench:语言模型能否改进智能体框架?
专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL
AI总结 本研究推出首个智能体框架进化基准Evo-Bench,评估语言模型的自主框架优化能力,发现其在通用、搜索任务中优于人工框架,在办公任务中表现不佳,且合成框架可迁移提升各类模型。
为生产大语言模型代理选择和组合运行时架构模式的方法
机构 * AI Architect, Independent Researcher(人工智能架构师,独立研究员) ; Stanford School of Engineering(斯坦福大学工程学院)
专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI
AI总结 本文提出了一种方法,用于选择和组合运行时架构模式,以定义大语言模型代理的随机-确定性边界,并探讨其在不同代理类型中的应用及可靠性分解。
Comments 26 pages, 2 figures, 6 tables. Companion repo at https://github.com/vasundras/agent-runtime-patterns
能力并非倾向:评估公民大语言模型智能体的压力鲁棒合作行为
机构 * Indian Institute of Technology Bombay(印度理工学院孟买分校)
专题命中 推理与问题求解 :LLM(title);language model(abstract);prompting(abstract);分类 cs.AI
AI总结 该研究针对公民大语言模型智能体,推出DiffCoop-Civic评估套件,发现压力会显著影响模型合作行为,提出Pareto-Trace提示干预提升压力鲁棒性。
Comments Accepted at ICML AI4GOOD Workshop 2026
数学视觉图表:评估大型语言模型数学图表生成能力的综合基准
机构 * Pandita AI Inc.(潘迪塔人工智能公司)
专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本研究推出首个专门评估LLMs数学图表生成能力的基准Math-Vision Diagrams,涵盖文本到代码与图像范式,测试发现LLMs在该任务上存在困难,相关资源将开源。
Comments Accepted at ICANN 2026
通过部分信息分解理解多模态语言模型中的模态交互
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.AI
AI总结 引入部分信息分解(PID)框架,分离感官和语言输入的独特、冗余和协同贡献,揭示多模态大模型中的模态使用模式,并扩展至三模态系统。
Comments Accepted by ICML 2026
思考使大语言模型代理变得内向:强制性思考在用户参与代理中的反效果
专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.CL
AI总结 本文研究了强制性思考在用户参与代理中的反效果,发现其导致性能下降,而主动透明性可提升代理性能。
Comments 26 pages, 5 figures, 7 tables
仅知道两跳信息是不够:理解语言模型中的两跳泛化
机构 * Xi’an Jiaotong University(西安交通大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL
AI总结 本研究针对语言模型两跳查询失败问题,在受控环境训练Transformer,揭示其泛化规律与跨层不匹配机制,提出循环式训练策略以提升分布外两跳泛化能力。
Comments 24 pages, 20 figures
相同公式,不同语义:语言模型是否遵循模态逻辑规范?
机构 * Univ. Lille(里尔大学) ; Inria(法国国家信息与自动化研究所) ; CNRS(法国国家科学研究中心) ; Centrale Lille(里尔中央理工学院) ; UMR 9189 - CRIStAL(UMR 9189 - CRIStAL(法国国家科研中心联合研究机构))
专题命中 推理与问题求解 :language model(title,abstract);prompting(abstract);分类 cs.CL
AI总结 该研究探究语言模型是否遵循模态逻辑规范,构建成对模态问题测试五款模型,发现遵循规定模态语义依赖推理模式与模型身份,发布相关产物。
Comments 9 pages. Code: https://github.com/sileod/modal-semantics-reasoning. Data and artifacts: https://huggingface.co/datasets/sileod/modal-semantics-reasoning
用金丝雀工具诊断大语言模型智能体的工具选择推理
专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.AI
AI总结 本研究引入金丝雀工具诊断LLM智能体的工具选择推理,通过多维度分类法评估8个模型,发现模型能力提升会降低易感性,分类法具能力分层性,且发布了相关框架与数据。
Comments 10 pages, 9 figures, 5 tables
CoT-Core:通过感知思维链的核心集选择加速大语言模型评估
机构 * Nanjing University(南京大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 CoT-Core是无训练的核心问题选择框架,通过感知大语言模型的思维链推理轨迹聚类问题,可大幅降低LLMs评估成本,且在GSM8K等多数据集上维持高保真度分数估计。
Comments 23 pages, 3 figures, 10 tables. Includes appendix
地图对机器来说仍然重要吗:重新审视分级统计图在基础模型空间理解中的作用
专题命中 推理与问题求解 :foundation model(title,abstract);prompting(abstract);分类 cs.AI
AI总结 研究探讨分级统计图对基础模型空间理解的作用,引入ChoroplethMap-Bench基准,在三种输入条件下评估22个模型,发现地图能显著提升空间推理,尤其结合符号数据及高层次空间模式理解任务时,证明地图是基础模型空间推理的重要外部表示。
Comments 34 pages, 4 figures, and 10 tables
NeurOWL:基于大语言模型的神经符号框架用于不完整OWL本体推理
机构 * The University of Manchester(曼彻斯特大学) ; Zhejiang University(浙江大学)
专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究不完整OWL本体的包含关系推理问题,提出NeurOWL框架,通过大语言模型和本体嵌入联合执行验证和溯因,利用形式与文本语义,在多领域真实本体上评估,展现强大稳健性能。
MolSight: 一种用于统一化学图像理解的图感知视觉语言模型
机构 * Renmin University of China(中国人民大学)
专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.AI
AI总结 提出MolSight框架,通过分子拓扑模块和分子接地模块增强视觉语言模型对分子图像的结构理解,在多项化学视觉理解任务中显著优于现有模型。
位置,而非来源:在医学视觉-语言模型中分离推理中介与逢迎行为
机构 * IEM Kolkata(印度工程管理学院 Kolkata校区) ; School of UEMK Kolkata(UEMK Kolkata学院) ; Heritage Institute of Technology Kolkata(加尔各答遗产技术学院) ; Indian Institute of Information Technology, Kalyani(卡利亚尼印度信息技术学院)
专题命中 推理与问题求解 :language model(title,abstract);prompting(abstract);分类 cs.LG
AI总结 本研究提出CoT-Mediate框架,结合双臂协议与来源控制干预,在VQA-RAD数据集上评估LLaVA-Med和MedGemma,发现上下文位置而非声明来源是医学VLMs使用生成推理的主要决定因素。
GuideSkill:面向基于指南的临床推理的可执行大语言模型智能体技能演化框架
专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI
AI总结 本文提出与模型无关的GuideSkill框架,通过可执行技能结合指南流程与病例诊断模式,在多基准和骨干模型上显著提升临床推理性能,技能可靠且实用。
利用大型语言模型的迭代个性化增强行为提示:一项关于电力和热水节约的实地实验
机构 * School of Environment, Tsinghua University(清华大学环境学院) ; Department of Applied Psychology and Human Development, University of Toronto(多伦多大学应用心理学与人类发展系) ; State Key Laboratory of Regional Environment and Sustainability, Tsinghua University(清华大学区域环境与可持续性国家重点实验室) ; Department of Psychology, Beijing Normal University at Zhuhai(北京师范大学珠海校区心理学系) ; Department of Psychology and Cognitive Sciences, Tsinghua University(清华大学心理学与认知科学系)
专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI
AI总结 本研究利用大型语言模型实现迭代个性化,通过实地实验发现其在促进节能方面效果显著,且在前两轮干预中表现更优,但热水节约效果较弱且随时间减弱。