fix(xpu): enable compressed-tensors FP8 W8A8 on XPU (RedHatAI FP8-dynamic models) (#33057)

This commit is contained in:
vikram singh shekhawat
2026-08-24 12:53:48 +08:00
committed by GitHub
parent b498efce52
commit f98b60de80
6 changed files with 42 additions and 10 deletions
+3 -2
View File
@@ -756,7 +756,7 @@ class RuntimeContext:
self.forward = ForwardFlags()
def get_stream(self, name: str) -> Any:
"""Named process-level CUDA side stream: get-or-create, shared by
"""Named process-level side stream: get-or-create, shared by
name (the keyed-lazy pattern of the persistent buffers). Creation is
a driver call that must stay outside cuda-graph capture — call sites
lease their stream at init/warmup time."""
@@ -764,7 +764,8 @@ class RuntimeContext:
if stream is None:
import torch
stream = torch.cuda.Stream()
device = self._server_args.device if self._server_args else "cuda"
stream = torch.get_device_module(device).Stream()
self.resources.streams[name] = stream
return stream