WorksheetsPJN - LoRA, RAG, kwantyzacja
Total questions: 12
Worksheet time: 7mins
Czym jest kwantyzacja w NLP?
Procesem rozszerzania liczby parametrów
Zamianą reprezentacji wag modelu na niższą precyzję
Trenowaniem modelu na danych liczbowych
Skalowaniem embeddingów
Czym jest RAG?
Modelem do kompresji parametrów sieci neuronowych
Metodą generowania odpowiedzi z wykorzystaniem wyszukiwarki wiedzy
Algorytmem przyspieszającym trenowanie modeli językowych
Technika kwantyzacji
W podejściu LoRA zamrażane są…
Wszystkie warstwy modelu
Tylko warstwa wyjściowa
Wagi bazowego model
Warstwa embeddingów
Główną korzyścią z użycia kwantyzacji jest…
Zwiększenie liczby tokenów w promptcie
Możliwość działania tylko na CPU
Lepsza jakość generowania tekstu
Mniejsze zużycie pamięci i szybsza inferencja
Która metoda kwantyzacji jest najbardziej agresywna, ale daje największe oszczędności pamięci?
INT4
INT8
FP32
FP16
Które podejście najlepiej wykorzystać, jeśli chcemy szybko dostroić model do bardzo specyficznego zadania bez trenowania całego modelu?
Kwantyzację
RAG
Fine-tuning pełnych wag
LoRA
Jakie są główne korzyści ze stosowania RAG?
Redukcja liczby warstw transformera bez utraty accuracy
Możliwość korzystania z aktualnej wiedzy bez ponownego trenowania modelu
Zastąpienie procesu tokenizacji
Nie ma
Chcesz dostroić model do bardzo specyficznego tonu wypowiedzi (np. styl pisania konkretnego autora), ale masz mało danych oraz ograniczone zasoby obliczeniowe. Co byś zrobił?
Skwantyzował model do INT4
Dostroił model za pomocą LoRA
Użył RAG, aby dodać dokumenty autora
Pełny fine-tuning modelu
Model zwraca przestarzałe informacje o produktach w sklepie internetowym. Chcesz, by generował zawsze najnowsze dane, ale nie chcesz go trenować od nowa co tydzień. Co byś zrobił?
Fine-tuning pełnych wag
LoRA do każdej nowej wersji danych
Kwantyzacja do INT8
Użycie RAG z aktualną bazą danych produktów
Potrzebujesz szybko prototypować model dla wielu klientów z różnymi domenami tematycznymi (medycyna, finanse, szkolnictwo), ale nie chcesz utrzymywać wielu wersji gigantycznego modelu. Co byś zrobił?
Tworzył osobne adaptery LoRA, które można podmieniać w zależności od klienta
Używał RAG bez fine-tuningu
Kwantyzował model do INT4
Dla każdego klienta trenował osobny model od zera
Masz model, który po RAG zaczyna „przekłamywać” dane — halucynacje są mniejsze, ale nadal występują, a system ma działać w środowisku krytycznym (bankowość). Chcesz zwiększyć kontrolę nad generacją bez znaczącego zwiększania kosztów obliczeniowych. Co robisz?
Kwantyzujesz model, aby zmniejszyć halucynacje
Dostrajasz model LoRA na przykładach poprawnej odpowiedzi vs. halucynacji
Redesign promptów i zastosowanie chain-of-thought z kontrolą regułową
Zwiększasz liczbę dokumentów zwracanych przez retriever
Masz ograniczoną przepustowość GPU podczas inferencji. Model działa wolno, ale jakość nie może znacząco spaść. Jednocześnie część warstw modelu jest bardziej „ważna” niż inne (np. warstwy attention). Co robisz?
Kwantyzujesz tylko wybrane warstwy — np. feed-forward — pozostawiając najbardziej wrażliwe w FP16
Dostrajasz model LoRA, aby był lżejszy
Redukujesz liczbę warstw modelu
