工作职责
1、基于自研AI加速卡及相关软件栈,开发大模型推理框架,实现框架功能;
2、端到端调通大模型,优化推理性能、调试精度和准确率;
3、根据实际需求,承担部分算子的开发和优化工作;
4、开发服务接口、对接外部服务接口,按业务要求达成各种测试要求,实现大模型推理框架落地。
任职资格
1、C++ , Python 编程熟练 ;
2、熟悉常用的大模型推理框架, 包括但不限于 vLLM /SGlang等,了解prefixcache/ chunkprefill/ continousbatching/ scheduler/ worker/ runner/ pd分离/ mtp等;
3、了解大模型网络结构的一种或多种,包括但不限于 deepseek系列/qwen3.6系列/qwen3/Llama等;
4、了解大模型常用 算子及优化方法,包括但不限于 各种 attention, GEMM , RoPE,通信算子等。
5、熟悉 MLIR 或 TVM;