LLaMA Inference GPU Save, Migrate & Resume (SMR)
Performing an SMR of a running LLaMA inference task using HuggingFace weights.
Last updated
Was this helpful?
Was this helpful?
#!/usr/bin/env python3
import argparse
import time
from transformers import AutoModelForCausalLM, AutoTokenizer
# Load the tokenizer and model
tokenizer = AutoTokenizer.from_pretrained("meta-llama/Llama-3.1-8B")
model = AutoModelForCausalLM.from_pretrained(
"meta-llama/Llama-3.1-8B",
torch_dtype="auto",
)
model.cuda()
while True:
user_input = "some prompt"
# Tokenize input
inputs = tokenizer(user_input, return_tensors="pt").to(model.device)
# Generate tokens
tokens = model.generate(
**inputs,
max_new_tokens=64,
temperature=0.70,
top_p=0.95,
do_sample=True,
)
output = tokenizer.decode(tokens[0], skip_special_tokens=True)
print(f"Generated Output:\n{output}")
cedana run process -ga -j llama_inference -- python3 -u llama.py cedana dump job llama_inference --compression=nonecedana restore job llama_inference -a