docs: 确定生产全上云部署决策,更新工作计划与 AGENTS.md

This commit is contained in:
weijuesen
2026-08-11 20:58:03 +08:00
parent 16355b9572
commit a40eced01c
2 changed files with 20 additions and 4 deletions
+18 -2
View File
@@ -7,10 +7,25 @@
**采用混合架构:现有 Go 底座 + Python AI 微服务**
- 平台/业务:沿用 `server-go`Go/Gin/GORM、PostgreSQL、IoTDB、Valkey/Redis、VerneMQ、Ceph S3、WVP+ZLM 等现有能力)
- AI 能力:新建独立 Python 服务 `ai-service/`FastAPI + ONNX Runtime),承载 YOLO 检测、图像/光谱分析,部署于 Tesla P4 GPU 服务器
- AI 能力:新建独立 Python 服务 `ai-service/`FastAPI + ONNX Runtime),承载 YOLO 检测、图像/光谱分析
- 通信:Go 后端 ↔ AI 服务通过 HTTP/gRPC;摄像头流巡检由 AI 服务直接消费 ZLMediaKit 流
- 端侧:农户端微信小程序沿用现有 Taro miniapp;端侧 ONNX 推理作为后续优化项
**部署决策(2026-08-11 确定):生产环境全部上云,本地仅用于开发/训练/测试**
- 生产:业务云主机 + GPU 云主机(NVIDIA T4 16G+ 云对象存储(OSS/COS),同地域同 VPC 内网互通
- 本地(开发 VM + fnOS/i7-8700T/Tesla P4 物理机):仅做代码开发、YOLO 模型训练、数据集处理与功能测试;训练产物(`best.onnx` 等)上传云端部署
## 云部署配置(2026-08-11 确定)
| 资源 | 推荐配置 | 用途 |
|---|---|---|
| 业务云主机 | 8 vCPU / 32GB / 100GB SSD 系统盘 + 500GB SSD 数据盘,10Mbps 起步(视频多则按量),Debian 12 / Ubuntu 22.04,华南或华东 | Go 后端、PostgreSQL、IoTDB、VerneMQ、Valkey、DockerWVP/ZLM/MySQL/Redis)、recorder-go、前端 |
| GPU 云主机 | NVIDIA T4 16G8 vCPU / 32GB / 100GB SSD,与业务主机同 VPC | `ai-service`ONNX Runtime 推理),不承担训练 |
| 云对象存储 | OSS/COS:录像 bucket + 图片 bucket,配置生命周期(录像按保留期转低频/删除) | 替代 Ceph(现有 loop 100GB 容量/性能受限) |
| 网络与入口 | 域名 + HTTPS 证书(小程序合法域名需 ICP 备案)、负载均衡(可选)、CDN(模型/静态资源分发) | 对外访问与端侧模型更新 |
| 数据库 | 优先云 RDS(高可用+自动备份);成本敏感则业务主机自装 + 每日备份 + 云盘快照 | PostgreSQL 业务数据 |
## 一、前置准备(P0
- [ ] 1. 修复数据集:按原始图重新划分 train/valid/test(消除 Roboflow 增强副本导致的跨集泄漏);修正 `data.yaml``heathly``healthy`、绝对路径);删除空标签
@@ -67,4 +82,5 @@
- [ ] 时序数据库:IoTDB(现状)还是 TDengine(规格书)
- [ ] 数据集病种扩展:由二分类(healthy/sick)扩展为 7 类病种标注(影响 AI 巡检与溯源联动)
- [ ] AI 服务部署形态:Dockernvidia-container-toolkit)还是 systemd 裸进程
- [x] AI 服务部署形态:已定——云 GPU 主机(T4 16G),容器化部署
- [x] 对象存储:已定——云 OSS/COS,替代 Ceph