Move verify_marlin_supported to GPTQMarlinLinearMethod (#8165)

2024-09-05 11:09:46 -04:00 · 2024-09-05 11:09:46 -04:00 · 2ee45281a5
commit 2ee45281a5
parent 9da25a88aa
1 changed files with 4 additions and 4 deletions
--- a/vllm/model_executor/layers/quantization/gptq_marlin.py
+++ b/vllm/model_executor/layers/quantization/gptq_marlin.py
@ -51,10 +51,6 @@ class GPTQMarlinConfig(QuantizationConfig):

        self.quant_type = self.TYPE_MAP[(weight_bits, is_sym)]

-        # Verify supported on platform.
-        verify_marlin_supported(quant_type=self.quant_type,
-                                group_size=self.group_size)
-
    def __repr__(self) -> str:
        return (f"GPTQMarlinConfig(quant_type={self.quant_type}, "
                f"group_size={self.group_size}, "
@ -153,6 +149,10 @@ class GPTQMarlinLinearMethod(LinearMethodBase):
    def __init__(self, quant_config: GPTQMarlinConfig) -> None:
        self.quant_config = quant_config

+        # Verify supported on platform.
+        verify_marlin_supported(quant_type=self.quant_config.quant_type,
+                                group_size=self.quant_config.group_size)
+
    def create_weights(
        self,
        layer: torch.nn.Module,