Tag: inference
All the articles with the tag "inference".
-
推理服务业界落地:从训练产物到推理服务怎么发布
Updated:写给工程师的推理服务落地:换版最小动作是改一个 URI。产物进对象存储,期望状态进 Git,集群对账后拉起 Triton / vLLM 或 CPU 上的 ONNX / PMML;按平台已有能力决定要不要 KServe,对照 LLM、广告深度 CTR 和 CPU 粗排。
-
推理运行时与服务框架选型:运行环境、服务框架、编排平台怎么分层
Updated:写给工程师的推理服务选型:先把「算、接、活」分成运行环境、服务框架、编排平台,再按场景填上常见实现——LLM 对话、广告深度 CTR、轻量打分各走哪一层。变慢时按队列、副本、引擎排查,而不是拿不同层的工具直接比。
-
模型文件格式分类与选择:.pt / SavedModel / ONNX / safetensors / GGUF / TensorRT / PMML 到底怎么选
Updated:写给工程师的模型文件格式选型:权重、计算图、元数据各是什么;只有权重时用 config.json 搭空壳,有图仍可能要 sidecar 做分词和预处理。再按给谁跑选择 checkpoint、safetensors、ONNX、GGUF、TensorRT 或 PMML。