4 inference optimization engineer jobs at 3 companies in North Carolina

2mo
Save
Mark Applied
Hide
Data Science Consultant 2
Charlotte, North Carolina, United States
OnsiteFull Time
Infosys
InfosysNYSE: INFY: Provides IT consulting, software development, and business outsourcing services.
Experience building and optimizing LLM inference stacks (vLLM, TensorRT-LLM, Triton), Kubernetes-based serving (KServe, GKE), GPU orchestration, quantization techniques, performance tuning, GCP/Azure, Terraform, observability (Prometheus/Grafana). Bachelor's degree required or equivalent experience; US work authorization required.
vLLM, TensorRT-LLM, Triton, Triton Inference Server, SGLang, SAS, R, Python, Kubernetes, GKE, KServe, Helm, Operators, Terraform, HashiCorp Vault, Prometheus, Grafana, BigQuery, Hadoop, SageMaker, Snowflake, OpenShift (OCP)
2mo
Save
Mark Applied
Hide
Staff/Sr. Staff Software Engineer, AI Software Tools (Onsite)
San Diego or Raleigh
$158k-$238k/yr OnsiteFull Time
Qualcomm
QualcommNASDAQ: QCOM: Designs and manufactures semiconductors and wireless telecommunications products.
6+ YOEBachelor’s/MS/PhD in CS or related with 6+ years (Staff) / 8+ years (Sr. Staff) software experience; 3+ years AI/ML inference or model optimization; proficiency in Python, C/C++; experience with PyTorch and ONNX.
Python, C/C++, PyTorch, ONNX, ONNX Runtime, ExecuTorch, TFLite, LiteRT, Qualcomm AI Stack SDK, QAIRT, QNN, Genie, Hugging Face, PEFT, CMake, git, QNX, Android, Snapdragon SoCs, NPU
1mo
Save
Mark Applied
Hide
Senior Software Engineer - GPU Local AI Platforms
Santa Clara or Westford or Austin or Durham or Seattle
$224k-$431k/yr OnsiteFull Time
NVIDIA
NVIDIANASDAQ: NVDA: Designs GPU-accelerated computing and artificial intelligence hardware.
12+ YOE12+ years software engineering experience in GPU computing or ML systems, strong Python or C++ skills, GPU kernel optimization (CUDA/Triton), container engineering, and LLM inference knowledge.
Python, C++, CUDA, Triton, Docker, OCI, NCCL, RCCL, NVIDIA Container Toolkit
1mo
Save
Mark Applied
Hide
Senior Software Engineer - GPU Local AI Platforms
Santa Clara or Austin or Westford or Durham or Seattle
$224k-$431k/yr OnsiteFull Time
NVIDIA
NVIDIANASDAQ: NVDA: Designs graphics processing units and artificial intelligence hardware.
12+ YOE12+ years software engineering experience with GPU computing or ML systems, strong Python or C++ skills, GPU kernel optimization (CUDA/Triton), container engineering, and LLM inference knowledge.
Python, C++, CUDA, Triton, Docker, OCI, NVIDIA Container Toolkit, NCCL, RCCL