教育背景
- 2024-至今博士:上海交通大学(Top3)|计算机学院 专业:计算机科学与技术 导师:骆源
- 2022-2024硕士:南京大学(华五)|软件工程学院 专业:计算机技术 导师:陈振宇
- 2018-2022本科:河海大学(211)|物联网工程学院 专业:物联网工程
简要介绍
我是上海交通大学计算机科学学院博士 3 年级学生。我很荣幸曾在腾讯 LIGHTSPEED(青云计划)和微软研究院(MSRA) 实习。我的研究兴趣包括 LLM 智能体、Agentic Coding 以及多智能体系统。我构建的智能体能够在真实的执行环境中进行规划、调用工具并采取行动,其范围涵盖从能够发布可运行代码库的单个 Coding Agent (PlayCoder / RepoGenesis),到由基于角色的智能体组成的受控智能体集群 (OpenHire)。我的多篇论文已在 ACL、EMNLP、FSE 和 ASE 等顶级国际会议上发表。
4 篇一作 CCF-A / TH-CPL-A122 谷歌学术引用开源项目累计 1.8K stars
工作经历
腾讯|光子工作室群(青云计划)|研究实习生构建可操作真实游戏客户端、以交互验证生成代码的 GUI Agent,产出 PlayCoder(CCF-A)。
- 设计感知-决策-控制闭环的 GUI Agent,像真实玩家一样操作运行中的游戏客户端,把「可玩性」从静态代码检查变为交互式判定。
微软亚洲研究院(MSRA)|研究实习生构建从 README 到代码仓库生成基准(NL→Repo),产出 RepoGenesis(CCF-A, ACL)。
- 在沙箱中真实构建、启动并调用生成的多语言 Web 微服务,覆盖 11 个框架与 18 个应用领域,形成端到端可验证的仓库生成基准。
开源项目
- OpenHire作者github.com/pzy2000/OpenHire多智能体执行与评测基础设施:control agent 拆解任务后并行分发到容器化 worker,每个 worker 独立沙箱与权限边界,支持批量 rollout 与执行轨迹全量留存;轨迹经筛选沉淀为可复用 skill 与长期记忆,构成自进化的数据闭环。适配层可接入任意镜像化 agent。
- YimMenu贡献者1.5K★github.com/YimMenu/YimMenu长程自动驾驶模块:基于规则的感知-决策-控制闭环,沿道路导航至地图路径点、无目标时自主漫游,含控制冲突检测与人工接管让行,经约 2,000 公里连续驾驶验证。
- SoulBanner 万魂幡.Skill作者109★github.com/pzy2000/SoulBannerAgent Skill 库:把表达风格与判断框架蒸馏为可调用、可组合的 skill 模块,6 分类路由入口,已接入 OpenHire 的 Skill Catalog。
- RepoGenesis作者101★github.com/pzy2000/RepoGenesisACL'26 基准的开源实现:README → 可部署多语言微服务仓库,在 Docker 沙箱内以构建、启动、调用三步自动判定成败,覆盖 11 框架 / 18 领域。
科研成果
Q1:如何构建能自动判定成败的代码执行环境?
- RepoGenesisBenchmarking End-to-End Microservice Generation from Readme to RepositoryACL'26CCF-AMain Conference
106 个多语言微服务仓库的 Benchmark。覆盖 11 框架 18 领域、2,335 测试用例;SOTA 系统 DSR 达 100% 但 Pass@1 仅 23.7%。
- PlayCoderMaking LLM-Generated GUI Code PlayableFSE'26CCF-A
覆盖 43 个 GUI 应用,提出 Play@k 与自动判定 agent;10 个 SOTA 模型 Play@3 全为个位数,多智能体生成-评测-修复达 20.3% Play@3。
Q2:如何用执行与偏好反馈提升生成质量?
- SolEvalBenchmarking Large Language Models for Repository-level Solidity Code GenerationEMNLP'25TH-CPL-AMain Conference
首个 Solidity Coding 基准,1,507 任务 / 28 仓库;在 16 个模型上最佳仅 26.3% Pass@10,SFT 后 Pass@5 由 16.7% 升至 58.3%。
- PrefGenA Preference-Driven Methodology for Secure Yet Gas-Efficient Smart Contract GenerationASE'25CCF-A
将 Gas 与安全设计为可量化奖励扩展 DPO;Qwen2.5-7B 上 Pass@5 16.7%→66.7%、Gas@5 0%→58.9%、Secure@5 11.8%→62.5%。
技术栈
- Benchmark 构建(RepoGenesis、SolEval、PlayCoder):任务与执行环境设计、自动化正确性判定(构建-启动-调用/编译-链上测试)、评测指标设计(Pass@k、Gas@k、Vul@k、Play@k)、多语言多领域基准构造
- 智能体(PlayCoder、OpenHire):规划与工具调用(tool use / function calling)、GUI 交互、多智能体并行协作与交叉校验
- 数据与记忆(RepoGenesis、SolEval、PlayCoder、SoulBanner):执行轨迹采集与筛选、skill 抽取复用、长期记忆合并及 diff 与安全回滚
- 工程(OpenHire、RepoGenesis):容器化隔离与权限边界、批量 rollout 调度、轨迹留存与执行链路审查