Tag: deployment
All the articles with the tag "deployment".
-
推理服务业界落地:从训练产物到推理服务怎么发布
Updated:写给工程师的推理服务落地:换版最小动作是改一个 URI。产物进对象存储,期望状态进 Git,集群对账后拉起 Triton / vLLM 或 CPU 上的 ONNX / PMML;按平台已有能力决定要不要 KServe,对照 LLM、广告深度 CTR 和 CPU 粗排。
-
推理运行时与服务框架选型:运行环境、服务框架、编排平台怎么分层
Updated:写给工程师的推理服务选型:先把「算、接、活」分成运行环境、服务框架、编排平台,再按场景填上常见实现——LLM 对话、广告深度 CTR、轻量打分各走哪一层。变慢时按队列、副本、引擎排查,而不是拿不同层的工具直接比。
-
模型文件格式分类与选择:.pt / SavedModel / ONNX / safetensors / GGUF / TensorRT / PMML 到底怎么选
Updated:写给工程师的模型文件格式选型:权重、计算图、元数据各是什么;只有权重时用 config.json 搭空壳,有图仍可能要 sidecar 做分词和预处理。再按给谁跑选择 checkpoint、safetensors、ONNX、GGUF、TensorRT 或 PMML。
-
广告服务上云实战 · 容器化部署与调优
容器化与 K8s 部署系列收官:把广告竞价服务生产级送上云——JVM 容器化的 cgroup 感知与 MaxRAMPercentage、滚动更新与金丝雀、readiness+preStop 优雅停机、跨可用区反亲和与 PDB、HPA+spot 成本弹性。
-
Flink 深挖 · 部署模式与 Flink on K8s
Flink 生产部署收尾:Session / Per-Job / Application 三种模式怎么选、为何生产选 Application、Flink on K8s 的 Native 与 Operator 两条路线、JobManager 高可用、checkpoint 远端存储、内存模型与 OOMKill、stop-with-savepoint 优雅升级。