Command Palette
Search for a command to run...
论文
每日更新的前沿人工智能研究论文,帮助您紧跟最新的人工智能趋势
篇论文

EpochX:构建涌现智能体文明的基础设施

TAPS:面向推测采样的任务感知提议分布






























具有推理轨迹的长尾驾驶场景:KITScenes 长尾数据集
RealChart2Code:基于真实数据与多任务评估推进图表到代码生成研究
Trace2Skill:将轨迹局部经验蒸馏为可迁移的 Agent 技能
PackForcing:短视频训练足以支持长视频采样与长上下文推理
ShotStream:面向交互式叙事的流式多镜头视频生成
视而不见,心却不忘:面向动态视频世界模型的混合记忆机制
BeSafe-Bench:揭示功能性环境中 Situated Agents 的行为安全风险
世界推理竞技场
MSA:面向高效端到端记忆模型扩展至 1 亿 tokens 的稀疏记忆注意力机制
Voxtral TTS
RealRestorer:面向基于大规模图像编辑模型的通用真实世界图像复原
Calibri:通过参数高效校准增强 Diffusion Transformer
Intern-S1-Pro:万亿级科学多模态基础模型
PixelSmile:迈向细粒度面部表情编辑
Claudini: Autoresearch 发现适用于 LLMs 的最先进(State-of-the-Art)对抗攻击算法
AutoHarness:通过自动合成代码 Harness 来提升 LLM Agents 的性能
GameplayQA:用于决策密集型第一人称视角同步多视频理解的3D虚拟Agent基准测试框架
为何自蒸馏(有时)会削弱 LLMs 的推理能力?
UI-Voyager:一种基于失败经验进行自我演进的 GUI Agent
T-MAP:基于轨迹感知的进化搜索对 LLM Agent 进行红队测试
CUA-Suite:面向计算机使用 Agent 的大规模人工标注视频演示数据集
EVA:面向端到端视频 Agent 的高效强化学习
Foveated Diffusion:高效的空间自适应图像与视频生成
Ego2Web:一种基于第一视角视频的 Web Agent 基准测试
从静态模板到动态运行时图:LLM Agent 工作流优化综述
SpecEyes:通过推测性感知与规划加速代理式多模态LLM
DA-Flow:基于 Diffusion 模型的退化感知光流估计
PEARL:个性化流式视频理解模型
WildWorld:面向生成式 ARPG 的、具备动作与显式状态的大规模动态世界建模数据集
MinerU-Diffusion:通过 Diffusion 解码将文档 OCR 重新构想为逆渲染