Hvad er RLHF?
RLHF står for Reinforcement Learning from Human Feedback. Det er en avanceret træningsmetode, hvor mennesker hjælper med at finjustere en AI-model ved at rangordne dens svar. Formålet er at gøre modellen mere hjælpsom, sandfærdig og sikker ved at lære den menneskelige præferencer.
Hvordan fungerer RLHF?
Uden RLHF er en sprogmodel blot en avanceret "tekst-gætter", der forudsiger det næste ord i en sætning. Den ved ikke nødvendigvis, om et svar er høfligt, faktuelt korrekt eller farligt. Her kommer RLHF ind i billedet som en form for "etik-filter" og kvalitetskontrol.
Processen foregår typisk i tre trin:
- Prætræning: Modellen læser hele internettet for at lære sprog.
- Indsamling af feedback: Mennesker får vist flere forskellige svar på den samme prompt og rangordner dem fra bedst til dårst.
- Optimering: Modellen opdateres, så den fremover vælger de svar-typer, som de menneskelige testere foretrak.
Hvorfor er RLHF vigtigt for Prompt Engineering?
RLHF er årsagen til, at du kan tale til AI'en i et naturligt sprog og få svar, der følger dine instruktioner. Som Prompt Engineer betyder RLHF, at modellen er "trænet til at adlyde". Den leder efter den hensigt (intent), der ligger bag din prompt, fordi den er blevet belønnet for at forstå mennesker under sin træning.
RLHF i praksis (Eksempel)
Hvis du beder en rå model uden RLHF om at "Hjælpe med at skrive en phishing-mail", ville den måske bare gøre det, fordi den er trænet i at fortsætte tekster. En model trænet med RLHF vil derimod svare:
"Jeg kan ikke hjælpe med at generere indhold, der er designet til svindel eller it-kriminalitet..."
Eksperttip til RLHF
Selvom RLHF gør modellerne mere brugervenlige, kan det også føre til "sygeplejerske-effekten", hvor AI'en bliver overdrevent høflig eller nægter at svare på harmløse spørgsmål af bar forsigtighed. Hvis du rammer denne mur, kan du ofte justere din prompt til at være mere specifik omkring den faglige kontekst for at komme uden om de mest rigide RLHF-filtre.