北京科学智能研究院
Posted 2mo ago

数据库后端开发实习生

北京科学智能研究院
Beijing, Beijing, China
OnsiteInternship
Responsibilities
  • developing engine
  • building pipelines
  • designing apis
Requirements
  • Master's degree in CS or related
  • Proficiency in Python/Go/C++
  • Experience with large-scale scientific data storage (HDF5,Zarr,TIFF,NetCDF)
  • NoSQL and object storage
  • Message queues and distributed task frameworks, and system performance tuning
Technical tools mentioned
HDF5ZarrPythonFastAPICeleryAsyncioGoC++NoSQLMongoDBCassandraTIFFNetCDFRedisRabbitMQKafkaRayDaskAirflowmmapDockerK8sCI/CDgRPCRESTLinux

Job description

1. 高性能数据引擎开发:设计并实现针对海量显微图像、能谱数据的高性能存储方案(如基于 HDF5, Zarr 或分布式文件系统),优化 I/O 性能以应对 TB 级数据的瞬时吞吐。
2. 分布式计算流水线(Pipeline):构建并维护高可用的异步任务调度系统,将图像预处理、分割、定量分析算法集成到分布式计算集群中。
3. 数据 API 与中间件设计:为前端可视化工具和算法研究员提供高性能、低延迟的数据访问接口(gRPC/REST),支持多维数据的切片、聚合与流式传输。
4. 系统性能调优:针对科学计算场景,进行深度性能剖析(Profiling),优化内存管理、网络传输及多线程并发模型,减少数据处理时延。
5. 工程化规范建设:主导数据平台的架构演进,引入容器化(Docker/K8s)、CI/CD 及监控报警体系,确保仪器在 7x24 小时运行下的系统稳定性。

1. 教育背景:计算机科学、软件工程或相关专业硕士及以上学历。
2. 精通后端语言:精通 Python(FastAPI/Celery/Asyncio)或 Go/C++,具有扎实的底层开发功底。
3. 大规模存储经验:熟悉 NoSQL(MongoDB, Cassandra)与对象存储,必须有处理大文件或非结构化科学数据(如 TIFF, HDF5, NetCDF)的实战经验。
4. 消息队列与并行调度:熟练使用 Redis, RabbitMQ 或 Kafka 进行任务解耦,熟悉分布式任务框架(如 Ray, Dask 或 Airflow)。
5. 高性能架构:理解 Linux 内核 I/O 模型,熟悉内存映射(mmap)、零拷贝技术或 GPU 并行数据交换者优先。

About 北京科学智能研究院

A research institute focused on AI for Science innovation.