Command Palette
Search for a command to run...
论文
每日更新的前沿人工智能研究论文,帮助您紧跟最新的人工智能趋势
篇论文

3DCodeBench: 基于代码的 Agentic 过程化 3D 建模基准测试

RadImageNet-VQA:用于放射学视觉问答的大规模CT和MRI数据集






























使用 SWE-Gym 训练软件工程智能体与验证器
MAKIEVAL:一种基于多语言自动WiKIdata的LLMs文化意识评估框架
GeneralVLA-2:几何感知重建与受控记忆用于机器人规划
多轮反思掩码在掩码扩散模型中激发推理
BrainG3N:一种用于可控3D脑部MRI生成的双用途分词器
GateMem: 多委托人共享记忆 Agents 中的记忆治理基准测试
MemSlides:一种用于个性化幻灯片生成并支持多轮局部修订的分层记忆驱动 Agent 框架
PerceptionDLM:基于多模态扩散语言模型的并行区域感知
用于通用游戏玩的代码世界模型
超越静态排行榜:用于评估 LLM Agents 的预测效度
S-Agent:空间工具使用激发空间智能推理
Multi-LCB:将LiveCodeBench扩展至多种编程语言
玩耍式智能体机器人学习
DragMesh-2:面向铰接物体的物理合理灵巧手-物交互
Moebius:具有10B级性能的0.2B轻量级图像修复框架
EfficientRollout:用于强化学习 rollout 的系统感知自投机解码
信任正确的教师:面向 GUI 定位的质量感知自蒸馏
强化空间视觉语言模型中的双路径推理
SAE 干预并不可靠:干预后抑制行为的恢复
Kairos:面向物理人工智能的原生世界模型栈
Guava:一种有效且通用的具身操作框架
超越当前观测:在可控非马尔可夫博弈中评估多模态大语言模型
LifeSciBench:在生命科学的真实、专家级任务中评估语言模型
TRIAGE:基于辩证推理的可解释风险预测——针对不规则采样医学时间序列结合大语言模型
LectūraAgents:一种用于自适应个性化 AI 辅助学习与具身教学的多 Agent 框架
GameCraft-Bench:Agents能否在真实游戏引擎中端到端地构建可玩的游戏?
近端策略优化的最近发展区:提示中的教师,而非梯度
ACE-Ego-0:统一第一人称视角的人类与机器人数据用于VLA预训练
LoopCoder-v2:仅循环一次以实现高效的测试时计算扩展
通过模拟部署预测大语言模型发布前的安全性