ICML 2026 · 第一作者
SimpleTool / RealtimeTool
Parallel Decoding for Real-Time LLM Function Calling
一次共享 prefill 后,让函数名与参数在多个 head 中并行生成,突破实时智能体中 “理解 → 结构化决策”的串行延迟。典型端到端加速 3–6×,最高 9.6×; RT-Qwen3-4B 在 RTX 4090 上达到 61.2 ms P50。
Real-time intelligence · Embodied agents · Interactive AI
研究兴趣:后训练与推理infra;端侧具身实时智能体:更快的结构化决策、可scaling的具身智能体, 端侧AI-native 应用。
上海创智学院 / 上海交通大学博士生,导师黄增峰教授。
我的工作横跨 LLM 后训练、推理系统与端侧产品。核心问题始终相同: 当智能模型需要在几十毫秒内理解状态、作出决策并影响真实界面或身体时, 模型、动作空间与执行系统应如何共同设计?
Research, systems, and product
ICML 2026 · 第一作者
Parallel Decoding for Real-Time LLM Function Calling
一次共享 prefill 后,让函数名与参数在多个 head 中并行生成,突破实时智能体中 “理解 → 结构化决策”的串行延迟。典型端到端加速 3–6×,最高 9.6×; RT-Qwen3-4B 在 RTX 4090 上达到 61.2 ms P50。
在研 · Embodied Agent-as-Policy
Typed tool calls as a scalable embodied action space
将 tool calling 定义为 LLM / VLM 与 controller、VLA skill 或 world-action model 之间的高层动作接口,以动态 schema 描述可验证、可组合的语义动作。 当前研究聚焦两项可证伪问题:仿真与合成 tool trajectories 能否随规模提升迁移能力, 以及端侧闭环能否稳定满足物理 deadline。
创业项目 · AI-OC-native interactive content
Personal OC for the Interactive Internet
SimpleLove 探索持续 AI-OC 身份、跨场景记忆与一句话生成互动内容。
一侧是由 OC、记忆和偏好驱动的内容消费;另一侧是支持 Agent 修改、测试与 Remix 的创作平台。
长期目标是让同一个 OC 从互动内容中的角色,成长为用户设备上的个人智能体。
总之:Coding agent & AIGC驱动的OC-mini-apps平台版“Tiktok”
米哈游实习
上海创智学院 / 上海交通大学博士生 · post- training与infra · 导师:黄增峰教授
上海交通大学化学学士 · 计算化学方向
Open invitation
SimpleLove 正在寻找理解端侧智能、AI 原生互动内容与角色智能长期价值的同行者。 欢迎 VC、创业伙伴、研究者、工程师与创作者联系我,讨论投资、合作与加入团队。