Command Palette
Search for a command to run...
论文
每日更新的前沿人工智能研究论文,帮助您紧跟最新的人工智能趋势
篇论文

UniT:迈向人类到人形机器人策略学习与世界建模的统一物理语言

WorldMark:一个用于交互式视频世界模型的统一基准测试套件






























LLaTiSA:迈向从视觉感知到语义的难度分层时间序列推理
图像生成器是通用视觉学习者
LongCat-Next:将模态词汇化为离散 tokens
FIPO:通过 Future-KL 影响下的 Policy Optimization 激发深度推理能力
通过强化学习中组级自然语言反馈进行 Bootstrapping 探索
SocialOmni:评估 Omni Models 在视听社交交互中的表现
DeepSeek-V4:迈向高效的 Million-Token 上下文智能
从生成式视角探索空间智能
DeVI:通过合成视频模仿实现基于物理的灵巧人机交互
大模型时代的奖励作弊(Reward Hacking):机制、涌现性失调与挑战
DR-Venus:仅需 1 万条开源数据,迈向前沿边缘规模深度研究 agent
近未来策略优化
LLaDA2.0-Uni:通过扩散大语言模型统一多模态理解与生成
BioInstruct:面向生物医学自然语言处理的 Large Language Models 指令微调研究
Logics-Parsing-Omni 技术报告
Task Tokens:一种适配行为基础模型的灵活方法
Explainable AI for Blind and Low-Vision Users: Navigating Trust, Modality, and Interpretability in the Agentic Era
PlayCoder:使 LLM 生成的 GUI 代码具备可玩性
TEMPO:扩展大语言推理模型的测试时训练(Test-time Training)规模
AnyRecon:基于视频扩散模型的任意视角 3D 重建
AgentSPEX:一种 agent 规范与执行语言
CoInteract:通过空间结构化协同生成实现物理一致性的人机交互视频合成
Tstars-Tryon 1.0:针对多样化时尚单品的鲁棒且逼真的虚拟试穿研究
用于 Large Language Model 推理的快速 NF4 量化反量化 Kernel
EasyVideoR1:面向视频理解的更简便强化学习方法
MultiWorld:可扩展的多 agent 多视角视频世界模型
OpenGame:面向游戏的开放式 agentic 编程
Agent-World:为演进式通用 agent intelligence 扩展真实世界环境合成规模
OneVL:结合视觉-语言解释的一步式潜在推理与规划
通过判别式文本表示将单步图像生成从类别标签扩展至文本