Jev, Laya oder LLMs: KI-Kosten und Latenz senken

KI-Suche und Chat für Ihre Website.
Askolia entdeckenJev von TypeSafe AI wählt aus, ordnet ein und bewertet. Ein LLM schreibt. Wenn jede Aufgabe dem passenden Modell zugewiesen wird, können die Kosten einer KI-Anwendung sinken und manche Antworten schneller erscheinen.
In Askolia, unserem KI-Such- und Chatwerkzeug für Websites, haben wir zwei mögliche Einsätze identifiziert und Laya getestet, eine selbst hostbare Alternative.
Wann eignet sich Jev statt eines LLM?
«Welche FAQ beantwortet diese Frage?» verlangt die Auswahl einer bestehenden Antwort. «Erkläre diese Antwort dem Kunden» verlangt neuen Text. Für diese Aufgaben können unterschiedliche Modelle eingesetzt werden.
Jev liefert strukturierte Entscheide: eine Auswahl, einen Score oder eine Ja/Nein-Einschätzung. Es formuliert keine Antworten.
| Bedarf | Geeignetes Werkzeug |
|---|---|
| Eine FAQ auswählen oder eine Anfrage weiterleiten | Jev mit dem bestehenden System vergleichen |
| Nützliche Dokumente einordnen | Jev oder ein spezialisiertes Reranking-Modell |
| Schreiben, übersetzen oder umformulieren | LLM |
| Betrag berechnen oder Berechtigung anwenden | Klassischer Code |
Ein LLM kann ebenfalls auswählen. Der Nutzen von Jev hängt deshalb von Kosten, Geschwindigkeit und Zuverlässigkeit dieses Entscheids in Ihrer Anwendung ab.
Wo entstehen Einsparungen?
Einsparungen entstehen durch vermiedene Aufrufe. Findet Jev eine bereits freigegebene Antwort in der richtigen Sprache, kann die Anwendung sie anzeigen, ohne ein LLM um eine Neuformulierung zu bitten.
Zum am 23. September 2026 geprüften Preis kosten 100’000 Jev-Entscheide mit je 1’000 Eingabetokens USD 4.20. Dieser Betrag deckt nur die Inferenz.
Ein fiktives Beispiel: 100’000 LLM-Aufrufe zu USD 0.001 kosten USD 100. Vermeidet Jev 70 % dieser Aufrufe, sinkt der Gesamtbetrag einschliesslich Jev-Entscheiden auf USD 34.20. Integration und Betrieb müssen weiterhin finanziert werden.
Wenn jede Anfrage danach mit demselben Kontext an dasselbe LLM geht, fügt Jev Kosten und einen weiteren Schritt hinzu. Bei kleinem Volumen kann die Einsparung zudem zu gering sein, um die Integration zu rechtfertigen.
Dasselbe gilt für die Geschwindigkeit: Messen Sie die Zeit bis zur angezeigten Antwort. Eine schnelle Auswahl hilft Besuchern nur, wenn sie ihre Wartezeit wirklich verkürzt.
Askolia: zwei konkrete Einsätze
Eine FAQ auswählen, ohne Text zu generieren
Im untersuchten FAQ-Ablauf von Askolia wählt ein LLM eine Antwort, wenn die automatische Zuordnung fehlschlägt. Ein zweiter Aufruf passt den Text anschliessend an die Sprache des Besuchers an.
Eine Möglichkeit ist, Jev mit der Auswahl zu betrauen. Eine andere besteht darin, gespeicherte Übersetzungen wiederzuverwenden. Beide Änderungen können unterschiedliche Aufrufe vermeiden; ihre Einsparungen müssen getrennt gemessen werden.
Wenn keine FAQ passt, muss das System weitersuchen oder an eine Person übergeben. Eine falsche Antwort schnell anzuzeigen, würde zusätzlichen Aufwand für den Support schaffen.
Bessere Quellen für RAG auswählen
Retrieval-Augmented Generation, kurz RAG, findet Dokumente, bevor ein LLM Text formuliert. Jev könnte gefundene Passagen neu gewichten, um dem LLM relevantere Quellen zu übergeben.
In Askolia wäre dies ein zusätzlicher Schritt. Sein erster Nutzen läge in der Qualität; Einsparungen bleiben möglich, wenn weniger Text an das LLM gesendet oder weniger Antworten korrigiert werden müssen.
Für die Integration würden wir mit dem offiziellen TypeScript SDK beginnen. jev-reranker bietet einen weiteren Weg für Experimente in Python.
Laya: Wann sollten Entscheide selbst gehostet werden?
Laya bietet ebenfalls Auswahlen und Scores, mit offenem Code und herunterladbaren Modellen. Damit lassen sich diese Entscheide auf eigener Infrastruktur ausführen.
Das kann Teams interessieren, die kontrollieren möchten, wo ihre Daten verarbeitet werden. Hardware, Verfügbarkeit und Wartung verursachen jedoch ebenfalls Kosten. Bei kleinem Volumen kann eine API günstiger sein.
Was uns der Laya-Test gezeigt hat
Bei einem kleinen Satz synthetischer mehrsprachiger Fälle, die von Askolia inspiriert waren, wählte Laya nach dem Laden des Modells eine FAQ in rund 18 ms im Median. Diese lokale Messung erfasst nicht die vollständige Antwortzeit.
Mit den aus dem Jev-Prototyp übernommenen Einstellungen blockierte die Filterung jedoch selbst Fragen, die eine FAQ beantworten konnte. Auch die Auswahl von Dokumentquellen war nicht zuverlässig genug.
Wir haben Laya mit diesen Einstellungen daher nicht als direkten Ersatz übernommen. Ein Modell kann schnell entscheiden und trotzdem zu viele Anfragen ohne nützliche Antwort lassen.
Dieser Test misst keinen Gewinn gegenüber Jev oder dem aktuellen LLM. Die detaillierten Ergebnisse und das Protokoll bleiben verfügbar, um die Grenzen des Tests zu prüfen.
Wo sollten Sie in Ihrer Anwendung beginnen?
Wählen Sie einen häufigen, präzisen Entscheid: eine FAQ finden, ein Ticket weiterleiten oder eine Quelle auswählen. Vergleichen Sie die Optionen anhand Ihrer eigenen Anfragen, auch mit mehrdeutigen Fällen und den Sprachen Ihrer Nutzer.
Verfolgen Sie drei Ergebnisse: Kosten pro korrekter Antwort, vollständige Antwortzeit und an Menschen übergebene Anfragen. Ein niedrigerer Tokenpreis genügt nicht, wenn die Fehler zunehmen.
In Askolia ist die FAQ-Auswahl unsere erste Möglichkeit, Jev mit dem bestehenden Ablauf zu vergleichen. RAG verdient ein separates, auf Quellenqualität konzentriertes Experiment.
Um vermeidbare Aufrufe in Ihrem Produkt zu identifizieren, entdecken Sie unsere KI-Integration oder stellen Sie uns Ihre Anwendung vor.