Zum Inhalt

Was ist LLARS?

LLARS (LLM Assisted Research System) ist eine quelloffene Web-Plattform für Forschende. Forschungsteams bewerten, vergleichen und labeln in LLARS gemeinsam Texte, E-Mail-Verläufe und Beratungsgespräche. Menschliche Urteile und LLM-Bewerter (LLM-Evaluatoren) laufen dabei in einem Workflow zusammen: Prompts entwerfen, Ausgaben erzeugen, bewerten lassen und die Übereinstimmung der Bewertenden auswerten. LLARS wird an der Technischen Hochschule Nürnberg entwickelt und ist für Forschung und Lehre kostenlos nutzbar.

Für wen ist LLARS?

  • Forschende, die Evaluationsstudien mit LLM-Ausgaben oder Kommunikationsdaten aufsetzen, etwa „Welche Antwort ist besser?“, „Ist dieser Text von Mensch oder KI?“ oder „Welche Kategorie trifft auf diesen Abschnitt zu?“.
  • Bewertende (Evaluator:innen), die zu Studien eingeladen werden und dort Items bewerten.
  • Teams, die Chatbots auf eigenen Dokumenten oder Webseiten aufbauen.

Was kann man mit LLARS machen?

  • Szenarien (Evaluationsstudien) anlegen: Daten importieren, Bewertungsaufgabe festlegen, Team einladen – siehe Szenario Wizard und Szenario Manager.
  • Bewerten: Items im passenden Bewertungs-Interface bearbeiten – siehe Evaluation.
  • LLM-Evaluatoren einsetzen: LLMs bewerten dieselben Items wie Menschen, zum direkten Vergleich.
  • Auswerten: Fortschritt, Inter-Rater-Reliabilität (u. a. Krippendorffs Alpha) und Exporte als CSV oder JSON im Szenario Manager.
  • Prompt Engineering: Prompts gemeinsam in Echtzeit entwerfen, versionieren und testen – siehe Prompt Engineering.
  • Batch Generation: Ausgaben über viele Prompts, Modelle und Eingaben erzeugen und direkt evaluieren – siehe Batch Generation.
  • Chatbots mit RAG bauen: Chatbots aus Webseiten oder Dokumenten erstellen und befragen – siehe Chatbot Wizard.
  • Eigene LLM-Zugänge nutzen: eigene API-Keys hinterlegen und teilen – siehe LLM Provider.

Welche Evaluationstypen gibt es in LLARS?

LLARS kennt acht Evaluationstypen. Der Evaluationstyp wird beim Anlegen eines Szenarios im Szenario Wizard gewählt; der Wizard schlägt anhand der hochgeladenen Daten einen Typ vor. In Klammern steht der technische Name (function_type).

  • Ranking (ranking): Items sortieren oder in geordnete Kategorien (Buckets wie gut, mittel, schlecht) einordnen.
  • Rating (rating): mehrdimensionale Bewertung auf Likert-Skalen, z. B. Kohärenz, Flüssigkeit, Relevanz und Konsistenz.
  • Mail-Rating (mail_rating): die Qualität ganzer E-Mail-Verläufe aus der Beratung bewerten.
  • Paarvergleich (comparison): zwei Antworten nebeneinander – A ist besser, B ist besser oder unentschieden.
  • Authentizität (authenticity): Stammt der Text von einem Menschen oder von einer KI?
  • Labeling (labeling): einem Text oder Gespräch eine Kategorie zuweisen, binär oder mit mehreren Klassen.
  • Kommunikationsvergleich (communication_comparison): A/B-Vergleich von Beratungsantworten – welche Antwort würde ich abschicken?
  • Konversationslabeling (conversation_labeling): Abschnitte (Spans) innerhalb eines Gesprächs der Reihe nach labeln – siehe Konversationslabeling.

Wie lege ich ein Szenario an?

Ein neues Szenario (eine Evaluationsstudie) legen Sie im Szenario Manager über die Schaltfläche „+ Neues Szenario“ an. Dadurch öffnet sich der Szenario Wizard mit fünf Schritten: Daten hochladen, Evaluationstyp wählen, Konfiguration (Dimensionen, Skalen, Buckets), Team einladen (Menschen und LLM-Evaluatoren) und Zusammenfassung. Szenarien anlegen dürfen die Rollen researcher und admin. Die ausführliche Anleitung steht unter Szenario Wizard.

Szenario Wizard oder Chatbot Wizard?

  • Der Szenario Wizard legt eine Evaluationsstudie an. Er öffnet sich im Szenario Manager über „+ Neues Szenario“.
  • Der Chatbot Wizard baut einen Chatbot mit eigener Wissensbasis (RAG): Webseite crawlen oder Dokumente nutzen, Embeddings erzeugen, Name und System-Prompt generieren. Er liegt im Bereich Chatbot Admin und legt keine Szenarien an.

Welche Rollen gibt es in LLARS?

  • researcher: Szenarien anlegen und auswerten, Prompt Engineering, Batch Generation.
  • evaluator: in Szenarien bewerten, zu denen eine Einladung vorliegt.
  • chatbot_manager: Chatbots und RAG-Sammlungen verwalten, Prompt Engineering.
  • admin: alles, inklusive Nutzer- und Rechteverwaltung im Admin Dashboard.

Welche Kacheln auf der Startseite erscheinen, hängt von der Rolle ab.

Wo finde ich was in der Oberfläche?

Die Startseite zeigt Kacheln für die einzelnen Bereiche:

  • Scenario Manager: eigene Szenarien, Einladungen, Fortschritt und Auswertung; „+ Neues Szenario“ startet den Szenario Wizard.
  • Evaluation: alle Szenarien, in denen man bewertet; von dort geht es ins Bewertungs-Interface.
  • Prompt Engineering: gemeinsame Prompt-Bearbeitung mit Versionen und Tests gegen LLMs.
  • Batch Generation: Massengenerierung von Ausgaben für eine spätere Evaluation.
  • Chatbot: mit freigegebenen Chatbots chatten, auch mit diesem Assistenten.
  • Chatbot Admin und RAG Admin: Chatbots anlegen (Chatbot Wizard) und Wissenssammlungen verwalten.
  • User Settings: Profil, Präferenzen, persönliche API-Keys und eigene LLM-Provider.
  • Admin Dashboard: Nutzer, Rollen und Systemeinstellungen (nur Admins).

Weiterlesen