Kubeflow KFServing中vLLM引擎在未定义max_tokens时的崩溃问题分析

2025-06-16 23:09:53作者：廉彬冶Miranda

KServe是基于Kubernetes的先进机器学习模型服务框架，它简化了预测与生成模型的部署和管理，兼容TensorFlow、XGBoost等主流框架。此平台通过自动缩放、健康检查等特性，无缝集成GPU支持，实现零规模扩展及金丝雀发布等高级功能。无论是预处理、后处理还是模型解释，KServe提供了一站式解决方案，支持高度可插拔性和云无关性，极大促进了模型上线的便利性和生产环境的适应性。适用于追求高可伸缩性和智能化路由的企业级应用。加入KServe社区，探索如何利用这一强大工具推动您的AI模型高效服务于实际业务。

项目地址：https://gitcode.com/gh_mirrors/kf/kfserving

问题背景

在Kubeflow KFServing项目中，当使用Hugging Face服务器结合vLLM后端部署大型语言模型(LLM)时，如果启用了vLLM的多步调度功能(num-scheduler-steps > 1)且未在请求中设置max_tokens参数，会导致vLLM引擎崩溃。这一问题不仅影响当前请求，还会导致后续所有请求失败，显示模型未就绪的错误信息。

技术细节分析

该问题的核心在于vLLM引擎的多步调度处理器(multi_step.py)在处理输出时，强制要求SamplingParams.max_tokens参数必须被设置。当该参数未定义时，Python会尝试对None类型进行数学运算，从而引发TypeError异常。

在多步调度模式下，vLLM引擎需要计算剩余可生成的token数量，这依赖于max_tokens参数。计算公式为：剩余token数 = max_tokens - (已生成token数 + 当前步骤生成的token数)。当max_tokens为None时，这个计算就无法进行。

影响范围

此问题具有以下特点：

仅在使用多步调度(num-scheduler-steps > 1)时出现
影响所有未设置max_tokens参数的OpenAI兼容API请求
会导致引擎崩溃，需要重启服务才能恢复
在单步调度模式下工作正常

解决方案

解决此问题的方法是为max_tokens设置合理的默认值。在vLLM上游项目中，已经通过修改to_sampling_params函数修复了这一问题。该修复为max_tokens参数添加了默认值处理逻辑。

对于KFServing项目，由于它实现了自己的vLLM前端(huggingfaceserver/vllm)，而非直接使用vLLM的OpenAI前端(vllm/entrypoints/openai)，因此需要将类似的修复移植到KFServing的代码中。

最佳实践建议

为避免此类问题，建议：

在使用多步调度时，始终为请求设置max_tokens参数
在服务端实现参数校验和默认值处理
考虑在模型部署配置中设置全局的max_tokens限制
监控引擎日志，及时发现和处理类似异常

总结

这个问题展示了在分布式机器学习服务中参数验证和异常处理的重要性。特别是在性能优化功能(如多步调度)中，需要确保所有依赖参数都被正确处理。对于使用KFServing和vLLM的组合部署LLM的用户，了解这一问题及其解决方案有助于构建更稳定的服务。

KServe是基于Kubernetes的先进机器学习模型服务框架，它简化了预测与生成模型的部署和管理，兼容TensorFlow、XGBoost等主流框架。此平台通过自动缩放、健康检查等特性，无缝集成GPU支持，实现零规模扩展及金丝雀发布等高级功能。无论是预处理、后处理还是模型解释，KServe提供了一站式解决方案，支持高度可插拔性和云无关性，极大促进了模型上线的便利性和生产环境的适应性。适用于追求高可伸缩性和智能化路由的企业级应用。加入KServe社区，探索如何利用这一强大工具推动您的AI模型高效服务于实际业务。

项目地址：https://gitcode.com/gh_mirrors/kf/kfserving

登录后查看全文

项目优选

收起

deepin linux kernel

OpenHarmony documentation | OpenHarmony开发者文档

openEuler内核是openEuler操作系统的核心，既是系统性能与稳定性的基石，也是连接处理器、设备与服务的桥梁。

Nop Platform 2.0是基于可逆计算理论实现的采用面向语言编程范式的新一代低代码开发平台，包含基于全新原理从零开始研发的GraphQL引擎、ORM引擎、工作流引擎、报表引擎、规则引擎、批处理引引擎等完整设计。nop-entropy是它的后端部分，采用java语言实现，可选择集成Spring框架或者Quarkus框架。中小企业可以免费商用

🔥LeetCode solutions in any programming language | 多种编程语言实现 LeetCode、《剑指 Offer（第 2 版）》、《程序员面试金典（第 6 版）》题解

flutter_flutter

喝着茶写代码！最易用的自托管一站式代码托管平台，包含Git托管，代码审查，团队协作，软件包和CI/CD。

本项目是CANN提供的数学类基础计算算子库，实现网络在NPU上加速计算。

Ascend Extension for PyTorch

🎉 (RuoYi)官方仓库基于SpringBoot，Spring Security，JWT，Vue3 & Vite、Element Plus 的前后端分离权限管理系统