全部项目

职业项目 / 2025

大模型训练系统

在 8×H100 集群上建立约 2B 参数语言模型从数据处理、分布式训练到评估推理的完整工程流程。

角色
技术负责人
状态
已发布
时间
2025
从数据、分布式训练到评估推理的大模型训练流程示意图

背景

这个项目验证中小规模语言模型在特定任务中的可行性。工作重点不是单次训练结果,而是把数据、训练、监控、评估和推理验证连成一条可重复的工程链路。

我的职责

  • 负责技术路线和完整训练流程。
  • 基于 PyTorch 搭建数据预处理、tokenization 与训练数据管道。
  • 在 8×H100 GPU 环境中组织分布式训练和数周运行监控。
  • 建立模型评估与推理验证流程,检查质量和稳定性。

工程判断

训练规模约 2B 参数。相较于追求更大的参数量,这一阶段更重要的是让数据版本、训练配置、监控信号和评估结果可以被追踪,让下一次实验建立在可靠证据上。

公开边界

此页面只说明本人可公开的职责和工程方法,不包含项目用途、数据内容、模型权重、内部指标或业务方信息。