Command Palette
Search for a command to run...
论文
每日更新的前沿人工智能研究论文,帮助您紧跟最新的人工智能趋势
篇论文

空间理论:Foundation Models 能否通过主动探索构建空间信念?

记忆迁移学习:Memory 在 Coding Agents 中是如何跨领域迁移的






























OccuBench: 通过 Language World Models 在真实世界专业任务上评估 AI Agents
SpatialEvo:通过确定性几何环境实现自我演化的空间智能
RationalRewards:通过推理 Rewards 在训练与测试阶段共同提升视觉生成的 Scale
Seedance 2.0:提升应对世界复杂性的 Video Generation 能力
GameWorld:迈向多模态 Game Agents 标准化与可验证性的评估研究
通过 ScaleFormer 实现跨尺度 Pansharpening 以及 PanScale 基准测试
ParseBench:面向 AI Agents 的文档解析基准测试
存储智能 Agent
PROPELLA-1:面向大规模 LLM 数据策展的多属性文档标注
长上下文视觉文档理解中的内化推理机制
TurboQuant:具有近乎最优失真率的在线 Vector Quantization 方法
BERT-as-a-Judge:一种高效、稳健的参考式大语言模型评估方法,可替代传统词汇法
SPPO:用于长程推理任务的序列级PPO方法
屏幕上的图灵测试:移动端GUI智能体人性化评测基准
Audio-Omni: 将多模态理解扩展至多功能的 Audio 生成与编辑
重新思考大语言模型的在线策略蒸馏:现象、机制与方法配方
KnowRL: 通过最小充分知识引导的强化学习提升大语言模型推理能力
Uni-ViGU:基于扩散式视频生成器的统一视频生成与理解方法
ClawGUI:用于训练、评测与部署GUI智能体的统一框架
Transformers 中的 Attention Sink:关于其利用、解释与缓解的研究综述
OmniShow: 统一用于 Human-Object Interaction 视频生成的 Multimodal Conditions
往事并非过往:基于 Memory 增强的 Dynamic Reward Shaping
QuanBench+: 一个用于 LLM-Based 量子代码生成的统一多框架 benchmark
ELT:用于视觉生成的弹性循环Transformer
ECHO: 基于 One-step Block Diffusion 的高效胸部 X 线报告生成
Matrix-Game 3.0:具有长时程 Memory 的实时流式交互式 World Model
EXAONE 4.5 技术报告
RefineAnything: 用于完美局部细节的多模态区域特定 Refinement
FORGE:面向制造场景的细粒度 Multimodal Evaluation
WildDet3D: 在野外环境下扩展 Promptable 3D Detection