曦望Sunrise
Posted 4mo ago

先进GPU计算体系结构研究员

曦望Sunrise
Beijing or Shenzhen or Shanghai or Hangzhou or Chengdu
OnsiteFull Time
Responsibilities
  • developing operators
  • optimizing performance
  • analyzing microarchitecture
Requirements
  • Bachelor's degree in computer or related field
  • Strong C/C++/Assembler skills
  • Experience with parallel computing
  • GPGPU architectures
  • CUDA/ROCm
  • PTX/SASS, and performance analysis tools
Technical tools mentioned
CC++AssemblerCUDAROCmPTXSASSCUTLASSCuTeTileLangcuTileLLVMTriton

Job description

1. 计算机或相关专业本科及以上学历,具备扎实的计算机基础。
2. 熟练掌握C/C++/Assembler等系统软件开发能力。
3. 熟悉并行计算技术,包括但不限于内存访问模式优化、资源利用率优化、计算通信重叠等。熟悉关键性能指标的含义及影响因素,掌握性能分析工具的使用。
4. 具备较为扎实的现代GPGPU体系结构知识,包括但不限于SIMT并行架构、存储层次结构以及TensorCore等,具备CUDA或RoCM等编程原语开发复杂算子的能力。
5. 熟练掌握PTX/SASS汇编等低级原语开发GEMM/Attention/Conv等计算密集型热点算子的能力,熟悉cutlass/CuTe/TileLang/cuTile等任意一种计算模板语言或者kernel生成框架,熟悉相关算法的常用计算模式。
6. 熟悉nvidia Ampere/Hopper/Blackwell或者AMD CDNA等某一种具体的GPGPU架构和指令集,具有丰富的微架构分析能力,能结合相关know how进行计算密集算子的极致调优能力。

【加分项】
1. 熟悉现代编译器原理,参与过 LLVM/AI编译器(Tilelang/Triton)开发项目,特别是参与过针对特定 GPGPU 硬件架构的中后端部分的指令选择/调度/优化/寄存器分配相关 Pass 的开发;
2. 参与过语言/多模态、文生图/视频/3D等生成式大模型研发、性能调优,具备性能模拟和仿真经验,提出关键性能指标指导硬件设计;
3. 对AI相关的高性能开源计算库/计算引擎(如DeepGEMM,DeepEP,FlashMLA等)有过代码贡献者优先。

About 曦望Sunrise

Designs and produces high-performance AI inference GPU chips.

Year founded
2020
Employees
450
Organization type
Private
Latest investment
Series C (2026)
Headquarters
CN