@@ -462,14 +462,24 @@ async def preprocess_chat(
462462
463463 return res
464464
465+ http_server_kwargs = self .cfg ["vllm_cfg" ].get (
466+ "http_server_serving_chat_kwargs" , {}
467+ )
465468 openai_serving_render = NeMoRLOpenAIServingRender (
466469 model_config = model_config ,
467470 renderer = engine_client .renderer ,
468471 io_processor = engine_client .io_processor ,
469472 model_registry = openai_serving_models .registry ,
470473 request_logger = None ,
471- chat_template = None ,
472- chat_template_content_format = "auto" ,
474+ chat_template = http_server_kwargs .get ("chat_template" , None ),
475+ chat_template_content_format = http_server_kwargs .get ("chat_template_content_format" , "auto" ),
476+ trust_request_chat_template = http_server_kwargs .get ("trust_request_chat_template" , False ),
477+ enable_auto_tools = http_server_kwargs .get ("enable_auto_tools" , False ),
478+ exclude_tools_when_tool_choice_none = http_server_kwargs .get ("exclude_tools_when_tool_choice_none" , False ),
479+ tool_parser = http_server_kwargs .get ("tool_parser" , None ),
480+ reasoning_parser = http_server_kwargs .get ("reasoning_parser" , None ),
481+ default_chat_template_kwargs = http_server_kwargs .get ("default_chat_template_kwargs" , None ),
482+ log_error_stack = http_server_kwargs .get ("log_error_stack" , False ),
473483 )
474484
475485 ########################################
0 commit comments