[TestFix] change LoRA tests to use NVIDIA adapter instead of Nutanix (#19642)
Co-authored-by: gemini-code-assist[bot] <176961590+gemini-code-assist[bot]@users.noreply.github.com>
This commit is contained in:
co-authored by
gemini-code-assist[bot]
parent
51ee17ce44
commit
cc860a2198
@@ -68,7 +68,7 @@ ALL_OTHER_LORA_MODELS = [
|
|||||||
base="meta-llama/Llama-3.1-8B-Instruct",
|
base="meta-llama/Llama-3.1-8B-Instruct",
|
||||||
adaptors=[
|
adaptors=[
|
||||||
LoRAAdaptor(
|
LoRAAdaptor(
|
||||||
name="Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16",
|
name="nvidia/llama-3.1-nemoguard-8b-topic-control",
|
||||||
prefill_tolerance=1e-1,
|
prefill_tolerance=1e-1,
|
||||||
),
|
),
|
||||||
],
|
],
|
||||||
@@ -109,7 +109,7 @@ ALL_OTHER_MULTI_LORA_MODELS = [
|
|||||||
prefill_tolerance=1e-1,
|
prefill_tolerance=1e-1,
|
||||||
),
|
),
|
||||||
LoRAAdaptor(
|
LoRAAdaptor(
|
||||||
name="Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16",
|
name="nvidia/llama-3.1-nemoguard-8b-topic-control",
|
||||||
prefill_tolerance=1e-1,
|
prefill_tolerance=1e-1,
|
||||||
),
|
),
|
||||||
],
|
],
|
||||||
|
|||||||
@@ -37,7 +37,6 @@ from sglang.test.test_utils import (
|
|||||||
register_cuda_ci(
|
register_cuda_ci(
|
||||||
est_time=487,
|
est_time=487,
|
||||||
suite="stage-b-test-large-1-gpu",
|
suite="stage-b-test-large-1-gpu",
|
||||||
disabled="Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16 removed from HuggingFace",
|
|
||||||
)
|
)
|
||||||
|
|
||||||
PROMPTS = [
|
PROMPTS = [
|
||||||
@@ -98,13 +97,13 @@ BASIC_TESTS = [
|
|||||||
max_loras_per_batch=3,
|
max_loras_per_batch=3,
|
||||||
all_adapters=[
|
all_adapters=[
|
||||||
"philschmid/code-llama-3-1-8b-text-to-sql-lora",
|
"philschmid/code-llama-3-1-8b-text-to-sql-lora",
|
||||||
"Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16",
|
"nvidia/llama-3.1-nemoguard-8b-topic-control",
|
||||||
"pbevan11/llama-3.1-8b-ocr-correction",
|
"pbevan11/llama-3.1-8b-ocr-correction",
|
||||||
],
|
],
|
||||||
initial_adapters=[
|
initial_adapters=[
|
||||||
# Testing 3 supported lora-path formats.
|
# Testing 3 supported lora-path formats.
|
||||||
"philschmid/code-llama-3-1-8b-text-to-sql-lora",
|
"philschmid/code-llama-3-1-8b-text-to-sql-lora",
|
||||||
"Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16=Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16",
|
"nvidia/llama-3.1-nemoguard-8b-topic-control=nvidia/llama-3.1-nemoguard-8b-topic-control",
|
||||||
{
|
{
|
||||||
"lora_name": "pbevan11/llama-3.1-8b-ocr-correction",
|
"lora_name": "pbevan11/llama-3.1-8b-ocr-correction",
|
||||||
"lora_path": "pbevan11/llama-3.1-8b-ocr-correction",
|
"lora_path": "pbevan11/llama-3.1-8b-ocr-correction",
|
||||||
@@ -130,14 +129,14 @@ BASIC_TESTS = [
|
|||||||
data=create_batch_data(
|
data=create_batch_data(
|
||||||
[
|
[
|
||||||
"philschmid/code-llama-3-1-8b-text-to-sql-lora",
|
"philschmid/code-llama-3-1-8b-text-to-sql-lora",
|
||||||
"Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16",
|
"nvidia/llama-3.1-nemoguard-8b-topic-control",
|
||||||
"pbevan11/llama-3.1-8b-ocr-correction",
|
"pbevan11/llama-3.1-8b-ocr-correction",
|
||||||
]
|
]
|
||||||
),
|
),
|
||||||
),
|
),
|
||||||
Operation(
|
Operation(
|
||||||
type=OperationType.UNLOAD,
|
type=OperationType.UNLOAD,
|
||||||
data="Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16",
|
data="nvidia/llama-3.1-nemoguard-8b-topic-control",
|
||||||
),
|
),
|
||||||
Operation(
|
Operation(
|
||||||
type=OperationType.UNLOAD,
|
type=OperationType.UNLOAD,
|
||||||
@@ -149,9 +148,7 @@ BASIC_TESTS = [
|
|||||||
),
|
),
|
||||||
Operation(
|
Operation(
|
||||||
type=OperationType.FORWARD,
|
type=OperationType.FORWARD,
|
||||||
data=create_batch_data(
|
data=create_batch_data("nvidia/llama-3.1-nemoguard-8b-topic-control"),
|
||||||
"Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16"
|
|
||||||
),
|
|
||||||
),
|
),
|
||||||
Operation(
|
Operation(
|
||||||
type=OperationType.FORWARD,
|
type=OperationType.FORWARD,
|
||||||
@@ -159,7 +156,7 @@ BASIC_TESTS = [
|
|||||||
),
|
),
|
||||||
Operation(
|
Operation(
|
||||||
type=OperationType.LOAD,
|
type=OperationType.LOAD,
|
||||||
data="Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16",
|
data="nvidia/llama-3.1-nemoguard-8b-topic-control",
|
||||||
expected_error="already loaded",
|
expected_error="already loaded",
|
||||||
),
|
),
|
||||||
Operation(
|
Operation(
|
||||||
@@ -172,7 +169,7 @@ BASIC_TESTS = [
|
|||||||
data=create_batch_data(
|
data=create_batch_data(
|
||||||
[
|
[
|
||||||
"philschmid/code-llama-3-1-8b-text-to-sql-lora",
|
"philschmid/code-llama-3-1-8b-text-to-sql-lora",
|
||||||
"Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16",
|
"nvidia/llama-3.1-nemoguard-8b-topic-control",
|
||||||
"pbevan11/llama-3.1-8b-ocr-correction",
|
"pbevan11/llama-3.1-8b-ocr-correction",
|
||||||
]
|
]
|
||||||
),
|
),
|
||||||
@@ -189,14 +186,14 @@ BASIC_TESTS = [
|
|||||||
type=OperationType.FORWARD,
|
type=OperationType.FORWARD,
|
||||||
data=create_batch_data(
|
data=create_batch_data(
|
||||||
[
|
[
|
||||||
"Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16",
|
"nvidia/llama-3.1-nemoguard-8b-topic-control",
|
||||||
"pbevan11/llama-3.1-8b-ocr-correction",
|
"pbevan11/llama-3.1-8b-ocr-correction",
|
||||||
]
|
]
|
||||||
),
|
),
|
||||||
),
|
),
|
||||||
Operation(
|
Operation(
|
||||||
type=OperationType.UNLOAD,
|
type=OperationType.UNLOAD,
|
||||||
data="Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16",
|
data="nvidia/llama-3.1-nemoguard-8b-topic-control",
|
||||||
),
|
),
|
||||||
Operation(
|
Operation(
|
||||||
type=OperationType.UNLOAD,
|
type=OperationType.UNLOAD,
|
||||||
@@ -204,9 +201,7 @@ BASIC_TESTS = [
|
|||||||
),
|
),
|
||||||
Operation(
|
Operation(
|
||||||
type=OperationType.FORWARD,
|
type=OperationType.FORWARD,
|
||||||
data=create_batch_data(
|
data=create_batch_data("nvidia/llama-3.1-nemoguard-8b-topic-control"),
|
||||||
"Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16"
|
|
||||||
),
|
|
||||||
),
|
),
|
||||||
Operation(
|
Operation(
|
||||||
type=OperationType.FORWARD,
|
type=OperationType.FORWARD,
|
||||||
@@ -229,7 +224,7 @@ BASIC_TESTS = [
|
|||||||
max_loras_per_batch=4,
|
max_loras_per_batch=4,
|
||||||
all_adapters=[
|
all_adapters=[
|
||||||
"philschmid/code-llama-3-1-8b-text-to-sql-lora",
|
"philschmid/code-llama-3-1-8b-text-to-sql-lora",
|
||||||
"Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16",
|
"nvidia/llama-3.1-nemoguard-8b-topic-control",
|
||||||
"pbevan11/llama-3.1-8b-ocr-correction",
|
"pbevan11/llama-3.1-8b-ocr-correction",
|
||||||
],
|
],
|
||||||
op_sequence=[
|
op_sequence=[
|
||||||
@@ -239,7 +234,7 @@ BASIC_TESTS = [
|
|||||||
),
|
),
|
||||||
Operation(
|
Operation(
|
||||||
type=OperationType.LOAD,
|
type=OperationType.LOAD,
|
||||||
data="Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16",
|
data="nvidia/llama-3.1-nemoguard-8b-topic-control",
|
||||||
),
|
),
|
||||||
Operation(
|
Operation(
|
||||||
type=OperationType.LOAD,
|
type=OperationType.LOAD,
|
||||||
@@ -263,7 +258,7 @@ BASIC_TESTS = [
|
|||||||
data=create_batch_data(
|
data=create_batch_data(
|
||||||
[
|
[
|
||||||
"philschmid/code-llama-3-1-8b-text-to-sql-lora",
|
"philschmid/code-llama-3-1-8b-text-to-sql-lora",
|
||||||
"Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16",
|
"nvidia/llama-3.1-nemoguard-8b-topic-control",
|
||||||
"pbevan11/llama-3.1-8b-ocr-correction",
|
"pbevan11/llama-3.1-8b-ocr-correction",
|
||||||
None,
|
None,
|
||||||
]
|
]
|
||||||
@@ -282,7 +277,7 @@ BASIC_TESTS = [
|
|||||||
data=create_batch_data(
|
data=create_batch_data(
|
||||||
[
|
[
|
||||||
None,
|
None,
|
||||||
"Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16",
|
"nvidia/llama-3.1-nemoguard-8b-topic-control",
|
||||||
"pbevan11/llama-3.1-8b-ocr-correction",
|
"pbevan11/llama-3.1-8b-ocr-correction",
|
||||||
None,
|
None,
|
||||||
]
|
]
|
||||||
@@ -290,7 +285,7 @@ BASIC_TESTS = [
|
|||||||
),
|
),
|
||||||
Operation(
|
Operation(
|
||||||
type=OperationType.UNLOAD,
|
type=OperationType.UNLOAD,
|
||||||
data="Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16",
|
data="nvidia/llama-3.1-nemoguard-8b-topic-control",
|
||||||
),
|
),
|
||||||
Operation(
|
Operation(
|
||||||
type=OperationType.UNLOAD,
|
type=OperationType.UNLOAD,
|
||||||
@@ -298,9 +293,7 @@ BASIC_TESTS = [
|
|||||||
),
|
),
|
||||||
Operation(
|
Operation(
|
||||||
type=OperationType.FORWARD,
|
type=OperationType.FORWARD,
|
||||||
data=create_batch_data(
|
data=create_batch_data("nvidia/llama-3.1-nemoguard-8b-topic-control"),
|
||||||
"Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16"
|
|
||||||
),
|
|
||||||
),
|
),
|
||||||
Operation(
|
Operation(
|
||||||
type=OperationType.FORWARD,
|
type=OperationType.FORWARD,
|
||||||
@@ -317,7 +310,7 @@ BASIC_TESTS = [
|
|||||||
),
|
),
|
||||||
Operation(
|
Operation(
|
||||||
type=OperationType.LOAD,
|
type=OperationType.LOAD,
|
||||||
data="Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16",
|
data="nvidia/llama-3.1-nemoguard-8b-topic-control",
|
||||||
expected_error="already loaded",
|
expected_error="already loaded",
|
||||||
),
|
),
|
||||||
Operation(
|
Operation(
|
||||||
@@ -330,7 +323,7 @@ BASIC_TESTS = [
|
|||||||
data=create_batch_data(
|
data=create_batch_data(
|
||||||
[
|
[
|
||||||
"philschmid/code-llama-3-1-8b-text-to-sql-lora",
|
"philschmid/code-llama-3-1-8b-text-to-sql-lora",
|
||||||
"Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16",
|
"nvidia/llama-3.1-nemoguard-8b-topic-control",
|
||||||
"pbevan11/llama-3.1-8b-ocr-correction",
|
"pbevan11/llama-3.1-8b-ocr-correction",
|
||||||
None,
|
None,
|
||||||
]
|
]
|
||||||
@@ -347,7 +340,7 @@ TARGET_MODULE_TESTS = [
|
|||||||
lora_target_modules=["all"],
|
lora_target_modules=["all"],
|
||||||
max_lora_rank=64,
|
max_lora_rank=64,
|
||||||
all_adapters=[
|
all_adapters=[
|
||||||
"Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16", # target_modules = q, k, v, o, gate, up, down
|
"nvidia/llama-3.1-nemoguard-8b-topic-control", # target_modules = q, k, v, o, gate, up, down
|
||||||
"algoprog/fact-generation-llama-3.1-8b-instruct-lora", # target_modules = q, k, v, o, gate
|
"algoprog/fact-generation-llama-3.1-8b-instruct-lora", # target_modules = q, k, v, o, gate
|
||||||
],
|
],
|
||||||
initial_adapters=["algoprog/fact-generation-llama-3.1-8b-instruct-lora"],
|
initial_adapters=["algoprog/fact-generation-llama-3.1-8b-instruct-lora"],
|
||||||
@@ -360,21 +353,19 @@ TARGET_MODULE_TESTS = [
|
|||||||
),
|
),
|
||||||
Operation(
|
Operation(
|
||||||
type=OperationType.FORWARD,
|
type=OperationType.FORWARD,
|
||||||
data=create_batch_data(
|
data=create_batch_data("nvidia/llama-3.1-nemoguard-8b-topic-control"),
|
||||||
"Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16"
|
|
||||||
),
|
|
||||||
expected_error="never been loaded",
|
expected_error="never been loaded",
|
||||||
),
|
),
|
||||||
Operation(
|
Operation(
|
||||||
type=OperationType.LOAD,
|
type=OperationType.LOAD,
|
||||||
data="Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16",
|
data="nvidia/llama-3.1-nemoguard-8b-topic-control",
|
||||||
),
|
),
|
||||||
Operation(
|
Operation(
|
||||||
type=OperationType.FORWARD,
|
type=OperationType.FORWARD,
|
||||||
data=create_batch_data(
|
data=create_batch_data(
|
||||||
[
|
[
|
||||||
"algoprog/fact-generation-llama-3.1-8b-instruct-lora",
|
"algoprog/fact-generation-llama-3.1-8b-instruct-lora",
|
||||||
"Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16",
|
"nvidia/llama-3.1-nemoguard-8b-topic-control",
|
||||||
None,
|
None,
|
||||||
]
|
]
|
||||||
),
|
),
|
||||||
@@ -387,16 +378,14 @@ TARGET_MODULE_TESTS = [
|
|||||||
max_loras_per_batch=3,
|
max_loras_per_batch=3,
|
||||||
max_lora_rank=64,
|
max_lora_rank=64,
|
||||||
all_adapters=[
|
all_adapters=[
|
||||||
"Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16", # target_modules = q, k, v, o, gate, up, down
|
"nvidia/llama-3.1-nemoguard-8b-topic-control", # target_modules = q, k, v, o, gate, up, down
|
||||||
"algoprog/fact-generation-llama-3.1-8b-instruct-lora", # target_modules = q, k, v, o, gate
|
"algoprog/fact-generation-llama-3.1-8b-instruct-lora", # target_modules = q, k, v, o, gate
|
||||||
],
|
],
|
||||||
initial_adapters=["Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16"],
|
initial_adapters=["nvidia/llama-3.1-nemoguard-8b-topic-control"],
|
||||||
op_sequence=[
|
op_sequence=[
|
||||||
Operation(
|
Operation(
|
||||||
type=OperationType.FORWARD,
|
type=OperationType.FORWARD,
|
||||||
data=create_batch_data(
|
data=create_batch_data("nvidia/llama-3.1-nemoguard-8b-topic-control"),
|
||||||
"Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16"
|
|
||||||
),
|
|
||||||
),
|
),
|
||||||
Operation(
|
Operation(
|
||||||
type=OperationType.FORWARD,
|
type=OperationType.FORWARD,
|
||||||
@@ -414,7 +403,7 @@ TARGET_MODULE_TESTS = [
|
|||||||
data=create_batch_data(
|
data=create_batch_data(
|
||||||
[
|
[
|
||||||
"algoprog/fact-generation-llama-3.1-8b-instruct-lora",
|
"algoprog/fact-generation-llama-3.1-8b-instruct-lora",
|
||||||
"Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16",
|
"nvidia/llama-3.1-nemoguard-8b-topic-control",
|
||||||
None,
|
None,
|
||||||
]
|
]
|
||||||
),
|
),
|
||||||
@@ -427,7 +416,7 @@ TARGET_MODULE_TESTS = [
|
|||||||
max_loras_per_batch=3,
|
max_loras_per_batch=3,
|
||||||
max_lora_rank=64,
|
max_lora_rank=64,
|
||||||
all_adapters=[
|
all_adapters=[
|
||||||
"Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16", # target_modules = q, k, v, o, gate, up, down
|
"nvidia/llama-3.1-nemoguard-8b-topic-control", # target_modules = q, k, v, o, gate, up, down
|
||||||
"algoprog/fact-generation-llama-3.1-8b-instruct-lora", # target_modules = q, k, v, o, gate
|
"algoprog/fact-generation-llama-3.1-8b-instruct-lora", # target_modules = q, k, v, o, gate
|
||||||
],
|
],
|
||||||
initial_adapters=["algoprog/fact-generation-llama-3.1-8b-instruct-lora"],
|
initial_adapters=["algoprog/fact-generation-llama-3.1-8b-instruct-lora"],
|
||||||
@@ -440,14 +429,12 @@ TARGET_MODULE_TESTS = [
|
|||||||
),
|
),
|
||||||
Operation(
|
Operation(
|
||||||
type=OperationType.FORWARD,
|
type=OperationType.FORWARD,
|
||||||
data=create_batch_data(
|
data=create_batch_data("nvidia/llama-3.1-nemoguard-8b-topic-control"),
|
||||||
"Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16"
|
|
||||||
),
|
|
||||||
expected_error="never been loaded",
|
expected_error="never been loaded",
|
||||||
),
|
),
|
||||||
Operation(
|
Operation(
|
||||||
type=OperationType.LOAD,
|
type=OperationType.LOAD,
|
||||||
data="Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16",
|
data="nvidia/llama-3.1-nemoguard-8b-topic-control",
|
||||||
expected_error="incompatible",
|
expected_error="incompatible",
|
||||||
),
|
),
|
||||||
Operation(
|
Operation(
|
||||||
@@ -469,17 +456,15 @@ MAX_LORA_RANK_TESTS = [
|
|||||||
max_loras_per_batch=3,
|
max_loras_per_batch=3,
|
||||||
max_lora_rank=32,
|
max_lora_rank=32,
|
||||||
all_adapters=[
|
all_adapters=[
|
||||||
"Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16", # r = 4
|
"nvidia/llama-3.1-nemoguard-8b-topic-control", # r = 4
|
||||||
"pbevan11/llama-3.1-8b-ocr-correction", # r = 32
|
"pbevan11/llama-3.1-8b-ocr-correction", # r = 32
|
||||||
"philschmid/code-llama-3-1-8b-text-to-sql-lora", # r = 256
|
"philschmid/code-llama-3-1-8b-text-to-sql-lora", # r = 256
|
||||||
],
|
],
|
||||||
initial_adapters=["Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16"],
|
initial_adapters=["nvidia/llama-3.1-nemoguard-8b-topic-control"],
|
||||||
op_sequence=[
|
op_sequence=[
|
||||||
Operation(
|
Operation(
|
||||||
type=OperationType.FORWARD,
|
type=OperationType.FORWARD,
|
||||||
data=create_batch_data(
|
data=create_batch_data("nvidia/llama-3.1-nemoguard-8b-topic-control"),
|
||||||
"Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16"
|
|
||||||
),
|
|
||||||
),
|
),
|
||||||
Operation(
|
Operation(
|
||||||
type=OperationType.FORWARD,
|
type=OperationType.FORWARD,
|
||||||
@@ -500,7 +485,7 @@ MAX_LORA_RANK_TESTS = [
|
|||||||
data=create_batch_data(
|
data=create_batch_data(
|
||||||
[
|
[
|
||||||
"pbevan11/llama-3.1-8b-ocr-correction",
|
"pbevan11/llama-3.1-8b-ocr-correction",
|
||||||
"Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16",
|
"nvidia/llama-3.1-nemoguard-8b-topic-control",
|
||||||
None,
|
None,
|
||||||
]
|
]
|
||||||
),
|
),
|
||||||
@@ -522,7 +507,7 @@ MAX_LORA_RANK_TESTS = [
|
|||||||
data=create_batch_data(
|
data=create_batch_data(
|
||||||
[
|
[
|
||||||
"pbevan11/llama-3.1-8b-ocr-correction",
|
"pbevan11/llama-3.1-8b-ocr-correction",
|
||||||
"Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16",
|
"nvidia/llama-3.1-nemoguard-8b-topic-control",
|
||||||
None,
|
None,
|
||||||
]
|
]
|
||||||
),
|
),
|
||||||
@@ -534,7 +519,7 @@ MAX_LORA_RANK_TESTS = [
|
|||||||
base="meta-llama/Llama-3.1-8B-Instruct",
|
base="meta-llama/Llama-3.1-8B-Instruct",
|
||||||
max_loras_per_batch=3,
|
max_loras_per_batch=3,
|
||||||
all_adapters=[
|
all_adapters=[
|
||||||
"Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16", # r = 4
|
"nvidia/llama-3.1-nemoguard-8b-topic-control", # r = 4
|
||||||
"pbevan11/llama-3.1-8b-ocr-correction", # r = 32
|
"pbevan11/llama-3.1-8b-ocr-correction", # r = 32
|
||||||
"philschmid/code-llama-3-1-8b-text-to-sql-lora", # r = 256
|
"philschmid/code-llama-3-1-8b-text-to-sql-lora", # r = 256
|
||||||
],
|
],
|
||||||
@@ -556,19 +541,19 @@ MAX_LORA_RANK_TESTS = [
|
|||||||
),
|
),
|
||||||
Operation(
|
Operation(
|
||||||
type=OperationType.LOAD,
|
type=OperationType.LOAD,
|
||||||
data="Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16",
|
data="nvidia/llama-3.1-nemoguard-8b-topic-control",
|
||||||
),
|
),
|
||||||
Operation(
|
Operation(
|
||||||
type=OperationType.FORWARD,
|
type=OperationType.FORWARD,
|
||||||
data=create_batch_data(
|
data=create_batch_data(
|
||||||
"Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16",
|
"nvidia/llama-3.1-nemoguard-8b-topic-control",
|
||||||
),
|
),
|
||||||
),
|
),
|
||||||
Operation(
|
Operation(
|
||||||
type=OperationType.FORWARD,
|
type=OperationType.FORWARD,
|
||||||
data=create_batch_data(
|
data=create_batch_data(
|
||||||
[
|
[
|
||||||
"Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16",
|
"nvidia/llama-3.1-nemoguard-8b-topic-control",
|
||||||
"pbevan11/llama-3.1-8b-ocr-correction",
|
"pbevan11/llama-3.1-8b-ocr-correction",
|
||||||
None,
|
None,
|
||||||
]
|
]
|
||||||
@@ -585,14 +570,14 @@ MAX_LOADED_LORAS_TESTS = [
|
|||||||
max_loaded_loras=2,
|
max_loaded_loras=2,
|
||||||
all_adapters=[
|
all_adapters=[
|
||||||
"philschmid/code-llama-3-1-8b-text-to-sql-lora",
|
"philschmid/code-llama-3-1-8b-text-to-sql-lora",
|
||||||
"Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16",
|
"nvidia/llama-3.1-nemoguard-8b-topic-control",
|
||||||
"pbevan11/llama-3.1-8b-ocr-correction",
|
"pbevan11/llama-3.1-8b-ocr-correction",
|
||||||
],
|
],
|
||||||
initial_adapters=["philschmid/code-llama-3-1-8b-text-to-sql-lora"],
|
initial_adapters=["philschmid/code-llama-3-1-8b-text-to-sql-lora"],
|
||||||
op_sequence=[
|
op_sequence=[
|
||||||
Operation(
|
Operation(
|
||||||
type=OperationType.LOAD,
|
type=OperationType.LOAD,
|
||||||
data="Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16",
|
data="nvidia/llama-3.1-nemoguard-8b-topic-control",
|
||||||
),
|
),
|
||||||
Operation(
|
Operation(
|
||||||
type=OperationType.LOAD,
|
type=OperationType.LOAD,
|
||||||
@@ -606,7 +591,7 @@ MAX_LOADED_LORAS_TESTS = [
|
|||||||
type=OperationType.FORWARD,
|
type=OperationType.FORWARD,
|
||||||
data=create_batch_data(
|
data=create_batch_data(
|
||||||
[
|
[
|
||||||
"Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16",
|
"nvidia/llama-3.1-nemoguard-8b-topic-control",
|
||||||
"philschmid/code-llama-3-1-8b-text-to-sql-lora",
|
"philschmid/code-llama-3-1-8b-text-to-sql-lora",
|
||||||
]
|
]
|
||||||
),
|
),
|
||||||
@@ -620,7 +605,7 @@ MAX_LOADED_LORAS_TESTS = [
|
|||||||
type=OperationType.FORWARD,
|
type=OperationType.FORWARD,
|
||||||
data=create_batch_data(
|
data=create_batch_data(
|
||||||
[
|
[
|
||||||
"Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16",
|
"nvidia/llama-3.1-nemoguard-8b-topic-control",
|
||||||
]
|
]
|
||||||
),
|
),
|
||||||
),
|
),
|
||||||
@@ -628,13 +613,13 @@ MAX_LOADED_LORAS_TESTS = [
|
|||||||
type=OperationType.LOAD,
|
type=OperationType.LOAD,
|
||||||
data="philschmid/code-llama-3-1-8b-text-to-sql-lora",
|
data="philschmid/code-llama-3-1-8b-text-to-sql-lora",
|
||||||
),
|
),
|
||||||
# Implicitly load "pbevan11/llama-3.1-8b-ocr-correction" and make sure that "Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16"
|
# Implicitly load "pbevan11/llama-3.1-8b-ocr-correction" and make sure that "nvidia/llama-3.1-nemoguard-8b-topic-control"
|
||||||
# isn't implicitly unloaded even though it is LRU because it is needed for this forward pass
|
# isn't implicitly unloaded even though it is LRU because it is needed for this forward pass
|
||||||
Operation(
|
Operation(
|
||||||
type=OperationType.FORWARD,
|
type=OperationType.FORWARD,
|
||||||
data=create_batch_data(
|
data=create_batch_data(
|
||||||
[
|
[
|
||||||
"Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16",
|
"nvidia/llama-3.1-nemoguard-8b-topic-control",
|
||||||
"pbevan11/llama-3.1-8b-ocr-correction",
|
"pbevan11/llama-3.1-8b-ocr-correction",
|
||||||
]
|
]
|
||||||
),
|
),
|
||||||
@@ -644,7 +629,7 @@ MAX_LOADED_LORAS_TESTS = [
|
|||||||
),
|
),
|
||||||
Operation(
|
Operation(
|
||||||
type=OperationType.UNLOAD,
|
type=OperationType.UNLOAD,
|
||||||
data="Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16",
|
data="nvidia/llama-3.1-nemoguard-8b-topic-control",
|
||||||
),
|
),
|
||||||
Operation(
|
Operation(
|
||||||
type=OperationType.LOAD,
|
type=OperationType.LOAD,
|
||||||
@@ -654,7 +639,7 @@ MAX_LOADED_LORAS_TESTS = [
|
|||||||
type=OperationType.FORWARD,
|
type=OperationType.FORWARD,
|
||||||
data=create_batch_data(
|
data=create_batch_data(
|
||||||
[
|
[
|
||||||
"Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16",
|
"nvidia/llama-3.1-nemoguard-8b-topic-control",
|
||||||
"philschmid/code-llama-3-1-8b-text-to-sql-lora",
|
"philschmid/code-llama-3-1-8b-text-to-sql-lora",
|
||||||
]
|
]
|
||||||
),
|
),
|
||||||
@@ -672,7 +657,7 @@ MAX_LOADED_LORAS_TESTS = [
|
|||||||
max_loaded_loras=2,
|
max_loaded_loras=2,
|
||||||
all_adapters=[
|
all_adapters=[
|
||||||
"philschmid/code-llama-3-1-8b-text-to-sql-lora",
|
"philschmid/code-llama-3-1-8b-text-to-sql-lora",
|
||||||
"Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16",
|
"nvidia/llama-3.1-nemoguard-8b-topic-control",
|
||||||
"pbevan11/llama-3.1-8b-ocr-correction",
|
"pbevan11/llama-3.1-8b-ocr-correction",
|
||||||
],
|
],
|
||||||
initial_adapters=[
|
initial_adapters=[
|
||||||
@@ -685,22 +670,22 @@ MAX_LOADED_LORAS_TESTS = [
|
|||||||
op_sequence=[
|
op_sequence=[
|
||||||
Operation(
|
Operation(
|
||||||
type=OperationType.LOAD,
|
type=OperationType.LOAD,
|
||||||
data="Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16",
|
data="nvidia/llama-3.1-nemoguard-8b-topic-control",
|
||||||
),
|
),
|
||||||
Operation(
|
Operation(
|
||||||
type=OperationType.LOAD,
|
type=OperationType.LOAD,
|
||||||
data="pbevan11/llama-3.1-8b-ocr-correction",
|
data="pbevan11/llama-3.1-8b-ocr-correction",
|
||||||
expected_implicit_evictions={
|
expected_implicit_evictions={
|
||||||
"Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16"
|
"nvidia/llama-3.1-nemoguard-8b-topic-control"
|
||||||
},
|
},
|
||||||
),
|
),
|
||||||
# Implicitly load "Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16"
|
# Implicitly load "nvidia/llama-3.1-nemoguard-8b-topic-control"
|
||||||
Operation(
|
Operation(
|
||||||
type=OperationType.FORWARD,
|
type=OperationType.FORWARD,
|
||||||
data=create_batch_data(
|
data=create_batch_data(
|
||||||
[
|
[
|
||||||
"philschmid/code-llama-3-1-8b-text-to-sql-lora",
|
"philschmid/code-llama-3-1-8b-text-to-sql-lora",
|
||||||
"Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16",
|
"nvidia/llama-3.1-nemoguard-8b-topic-control",
|
||||||
]
|
]
|
||||||
),
|
),
|
||||||
expected_implicit_evictions={"pbevan11/llama-3.1-8b-ocr-correction"},
|
expected_implicit_evictions={"pbevan11/llama-3.1-8b-ocr-correction"},
|
||||||
@@ -730,7 +715,7 @@ MAX_LOADED_LORAS_TESTS = [
|
|||||||
type=OperationType.FORWARD,
|
type=OperationType.FORWARD,
|
||||||
data=create_batch_data(
|
data=create_batch_data(
|
||||||
[
|
[
|
||||||
"Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16",
|
"nvidia/llama-3.1-nemoguard-8b-topic-control",
|
||||||
"pbevan11/llama-3.1-8b-ocr-correction",
|
"pbevan11/llama-3.1-8b-ocr-correction",
|
||||||
]
|
]
|
||||||
),
|
),
|
||||||
@@ -745,7 +730,7 @@ EVICTION_TESTS = [
|
|||||||
max_loras_per_batch=2,
|
max_loras_per_batch=2,
|
||||||
all_adapters=[
|
all_adapters=[
|
||||||
"lora1=philschmid/code-llama-3-1-8b-text-to-sql-lora",
|
"lora1=philschmid/code-llama-3-1-8b-text-to-sql-lora",
|
||||||
"lora2=Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16",
|
"lora2=nvidia/llama-3.1-nemoguard-8b-topic-control",
|
||||||
"lora3=pbevan11/llama-3.1-8b-ocr-correction",
|
"lora3=pbevan11/llama-3.1-8b-ocr-correction",
|
||||||
],
|
],
|
||||||
enable_lora=True,
|
enable_lora=True,
|
||||||
@@ -764,7 +749,7 @@ EVICTION_TESTS = [
|
|||||||
type=OperationType.LOAD,
|
type=OperationType.LOAD,
|
||||||
data={
|
data={
|
||||||
"lora_name": "lora2",
|
"lora_name": "lora2",
|
||||||
"lora_path": "Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16",
|
"lora_path": "nvidia/llama-3.1-nemoguard-8b-topic-control",
|
||||||
"pinned": True,
|
"pinned": True,
|
||||||
},
|
},
|
||||||
expected_error="starvation",
|
expected_error="starvation",
|
||||||
@@ -773,7 +758,7 @@ EVICTION_TESTS = [
|
|||||||
type=OperationType.LOAD,
|
type=OperationType.LOAD,
|
||||||
data={
|
data={
|
||||||
"lora_name": "lora2",
|
"lora_name": "lora2",
|
||||||
"lora_path": "Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16",
|
"lora_path": "nvidia/llama-3.1-nemoguard-8b-topic-control",
|
||||||
"pinned": False,
|
"pinned": False,
|
||||||
},
|
},
|
||||||
),
|
),
|
||||||
@@ -1492,7 +1477,7 @@ class TestLoRADynamicUpdate(CustomTestCase):
|
|||||||
"""
|
"""
|
||||||
adapters = [
|
adapters = [
|
||||||
"philschmid/code-llama-3-1-8b-text-to-sql-lora",
|
"philschmid/code-llama-3-1-8b-text-to-sql-lora",
|
||||||
"Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16",
|
"nvidia/llama-3.1-nemoguard-8b-topic-control",
|
||||||
]
|
]
|
||||||
|
|
||||||
with LoRAUpdateTestSession(
|
with LoRAUpdateTestSession(
|
||||||
|
|||||||
@@ -141,9 +141,6 @@ class TestBenchServing1GPUPart1(CustomTestCase):
|
|||||||
self.assertLess(res["median_ttft_ms"], 86)
|
self.assertLess(res["median_ttft_ms"], 86)
|
||||||
self.assertLess(res["median_itl_ms"], 10)
|
self.assertLess(res["median_itl_ms"], 10)
|
||||||
|
|
||||||
@unittest.skip(
|
|
||||||
"Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16 removed from HuggingFace"
|
|
||||||
)
|
|
||||||
def test_lora_online_latency(self):
|
def test_lora_online_latency(self):
|
||||||
if is_in_amd_ci():
|
if is_in_amd_ci():
|
||||||
pass
|
pass
|
||||||
@@ -159,9 +156,6 @@ class TestBenchServing1GPUPart1(CustomTestCase):
|
|||||||
self.assertLess(res["median_e2e_latency_ms"], 2400)
|
self.assertLess(res["median_e2e_latency_ms"], 2400)
|
||||||
self.assertLess(res["median_ttft_ms"], 58)
|
self.assertLess(res["median_ttft_ms"], 58)
|
||||||
|
|
||||||
@unittest.skip(
|
|
||||||
"Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16 removed from HuggingFace"
|
|
||||||
)
|
|
||||||
def test_lora_online_latency_with_concurrent_adapter_updates(self):
|
def test_lora_online_latency_with_concurrent_adapter_updates(self):
|
||||||
if is_in_amd_ci():
|
if is_in_amd_ci():
|
||||||
pass
|
pass
|
||||||
@@ -247,14 +241,14 @@ class TestBenchServing1GPUPart1(CustomTestCase):
|
|||||||
"--mem-fraction-static",
|
"--mem-fraction-static",
|
||||||
"0.8",
|
"0.8",
|
||||||
"--lora-paths",
|
"--lora-paths",
|
||||||
"Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16",
|
"nvidia/llama-3.1-nemoguard-8b-topic-control",
|
||||||
"--max-lora-rank",
|
"--max-lora-rank",
|
||||||
"256",
|
"256",
|
||||||
],
|
],
|
||||||
dataset_name="random",
|
dataset_name="random",
|
||||||
random_input_len=256,
|
random_input_len=256,
|
||||||
random_output_len=256,
|
random_output_len=256,
|
||||||
lora_name=["Nutanix/Meta-Llama-3.1-8B-Instruct_lora_4_alpha_16"],
|
lora_name=["nvidia/llama-3.1-nemoguard-8b-topic-control"],
|
||||||
background_task=background_task,
|
background_task=background_task,
|
||||||
)
|
)
|
||||||
|
|
||||||
|
|||||||
Reference in New Issue
Block a user