Visiting Scholar — Post Training & Research (Discovery AI Lab) Responsibilities:
- Lead research on post-training algorithms for generative recommendation systems, including preference alignment methods (e.g., DPO, GRPO, SimPO) adapted for multi-objective recommendation signals.
- Design and develop self-improving agent frameworks that leverage multi-agent collaboration, LLM self-correction, and continuous-learning loops.
- Advance efficient inference techniques — including quantization, compression, and distillation — for large-scale generative and Mixture-of-Experts recommendation models.
- Collaborate with research scientists and engineers to translate research into production-ready systems at Meta scale.
- Mentor research scientists and engineers on the team, upleveling internal capabilities in post-training and agentic AI.
Minimum Qualifications:
- Demonstrated publication record at top-tier venues (e.g., NeurIPS, ICML, ICLR, ACL, EMNLP, RecSys)
- Expertise in one or more of: post-training methods (RLHF, preference optimization, reward modeling), large language models, or agentic AI systems
- Experience conducting research in collaborative, team-based environments
- Available for a full-time, 12-month on-site or hybrid engagement
Preferred Qualifications:
- Research focus at the intersection of LLMs and recommendation systems
- Experience with reinforcement learning for language models or multi-agent systems
- Published work on model compression, quantization, or efficient inference for large-scale models
- Prior industry research experience (internship or collaboration) with production ML systems