Zum Hauptinhalt springen
Zurück zum Blog
KI

Jev, Laya oder LLMs: KI-Kosten und Latenz senken

Von ···4 Min. Lesezeit
Eine Frage wird drei KI-Abläufen zugeordnet: Auswahl, lokale Berechnung und Texterstellung.Askolia

KI-Suche und Chat für Ihre Website.

Askolia entdecken

Jev von TypeSafe AI wählt aus, ordnet ein und bewertet. Ein LLM schreibt. Wenn jede Aufgabe dem passenden Modell zugewiesen wird, können die Kosten einer KI-Anwendung sinken und manche Antworten schneller erscheinen.

In Askolia, unserem KI-Such- und Chatwerkzeug für Websites, haben wir zwei mögliche Einsätze identifiziert und Laya getestet, eine selbst hostbare Alternative.

Wann eignet sich Jev statt eines LLM?

«Welche FAQ beantwortet diese Frage?» verlangt die Auswahl einer bestehenden Antwort. «Erkläre diese Antwort dem Kunden» verlangt neuen Text. Für diese Aufgaben können unterschiedliche Modelle eingesetzt werden.

Jev liefert strukturierte Entscheide: eine Auswahl, einen Score oder eine Ja/Nein-Einschätzung. Es formuliert keine Antworten.

BedarfGeeignetes Werkzeug
Eine FAQ auswählen oder eine Anfrage weiterleitenJev mit dem bestehenden System vergleichen
Nützliche Dokumente einordnenJev oder ein spezialisiertes Reranking-Modell
Schreiben, übersetzen oder umformulierenLLM
Betrag berechnen oder Berechtigung anwendenKlassischer Code

Ein LLM kann ebenfalls auswählen. Der Nutzen von Jev hängt deshalb von Kosten, Geschwindigkeit und Zuverlässigkeit dieses Entscheids in Ihrer Anwendung ab.

Wo entstehen Einsparungen?

Einsparungen entstehen durch vermiedene Aufrufe. Findet Jev eine bereits freigegebene Antwort in der richtigen Sprache, kann die Anwendung sie anzeigen, ohne ein LLM um eine Neuformulierung zu bitten.

Zum am 23. September 2026 geprüften Preis kosten 100’000 Jev-Entscheide mit je 1’000 Eingabetokens USD 4.20. Dieser Betrag deckt nur die Inferenz.

Ein fiktives Beispiel: 100’000 LLM-Aufrufe zu USD 0.001 kosten USD 100. Vermeidet Jev 70 % dieser Aufrufe, sinkt der Gesamtbetrag einschliesslich Jev-Entscheiden auf USD 34.20. Integration und Betrieb müssen weiterhin finanziert werden.

Wenn jede Anfrage danach mit demselben Kontext an dasselbe LLM geht, fügt Jev Kosten und einen weiteren Schritt hinzu. Bei kleinem Volumen kann die Einsparung zudem zu gering sein, um die Integration zu rechtfertigen.

Dasselbe gilt für die Geschwindigkeit: Messen Sie die Zeit bis zur angezeigten Antwort. Eine schnelle Auswahl hilft Besuchern nur, wenn sie ihre Wartezeit wirklich verkürzt.

Askolia: zwei konkrete Einsätze

Eine FAQ auswählen, ohne Text zu generieren

Im untersuchten FAQ-Ablauf von Askolia wählt ein LLM eine Antwort, wenn die automatische Zuordnung fehlschlägt. Ein zweiter Aufruf passt den Text anschliessend an die Sprache des Besuchers an.

Eine Möglichkeit ist, Jev mit der Auswahl zu betrauen. Eine andere besteht darin, gespeicherte Übersetzungen wiederzuverwenden. Beide Änderungen können unterschiedliche Aufrufe vermeiden; ihre Einsparungen müssen getrennt gemessen werden.

Wenn keine FAQ passt, muss das System weitersuchen oder an eine Person übergeben. Eine falsche Antwort schnell anzuzeigen, würde zusätzlichen Aufwand für den Support schaffen.

Bessere Quellen für RAG auswählen

Retrieval-Augmented Generation, kurz RAG, findet Dokumente, bevor ein LLM Text formuliert. Jev könnte gefundene Passagen neu gewichten, um dem LLM relevantere Quellen zu übergeben.

In Askolia wäre dies ein zusätzlicher Schritt. Sein erster Nutzen läge in der Qualität; Einsparungen bleiben möglich, wenn weniger Text an das LLM gesendet oder weniger Antworten korrigiert werden müssen.

Für die Integration würden wir mit dem offiziellen TypeScript SDK beginnen. jev-reranker bietet einen weiteren Weg für Experimente in Python.

Laya: Wann sollten Entscheide selbst gehostet werden?

Laya bietet ebenfalls Auswahlen und Scores, mit offenem Code und herunterladbaren Modellen. Damit lassen sich diese Entscheide auf eigener Infrastruktur ausführen.

Das kann Teams interessieren, die kontrollieren möchten, wo ihre Daten verarbeitet werden. Hardware, Verfügbarkeit und Wartung verursachen jedoch ebenfalls Kosten. Bei kleinem Volumen kann eine API günstiger sein.

Was uns der Laya-Test gezeigt hat

Bei einem kleinen Satz synthetischer mehrsprachiger Fälle, die von Askolia inspiriert waren, wählte Laya nach dem Laden des Modells eine FAQ in rund 18 ms im Median. Diese lokale Messung erfasst nicht die vollständige Antwortzeit.

Mit den aus dem Jev-Prototyp übernommenen Einstellungen blockierte die Filterung jedoch selbst Fragen, die eine FAQ beantworten konnte. Auch die Auswahl von Dokumentquellen war nicht zuverlässig genug.

Wir haben Laya mit diesen Einstellungen daher nicht als direkten Ersatz übernommen. Ein Modell kann schnell entscheiden und trotzdem zu viele Anfragen ohne nützliche Antwort lassen.

Dieser Test misst keinen Gewinn gegenüber Jev oder dem aktuellen LLM. Die detaillierten Ergebnisse und das Protokoll bleiben verfügbar, um die Grenzen des Tests zu prüfen.

Wo sollten Sie in Ihrer Anwendung beginnen?

Wählen Sie einen häufigen, präzisen Entscheid: eine FAQ finden, ein Ticket weiterleiten oder eine Quelle auswählen. Vergleichen Sie die Optionen anhand Ihrer eigenen Anfragen, auch mit mehrdeutigen Fällen und den Sprachen Ihrer Nutzer.

Verfolgen Sie drei Ergebnisse: Kosten pro korrekter Antwort, vollständige Antwortzeit und an Menschen übergebene Anfragen. Ein niedrigerer Tokenpreis genügt nicht, wenn die Fehler zunehmen.

In Askolia ist die FAQ-Auswahl unsere erste Möglichkeit, Jev mit dem bestehenden Ablauf zu vergleichen. RAG verdient ein separates, auf Quellenqualität konzentriertes Experiment.

Um vermeidbare Aufrufe in Ihrem Produkt zu identifizieren, entdecken Sie unsere KI-Integration oder stellen Sie uns Ihre Anwendung vor.

Quellen und Referenzen

Zurück zum BlogGaspard Chevassus · CEO, Appik Studio

KONTAKT

contact@appik-studio.ch
+41 78 693 58 72

APPIK STUDIO

Avenue de Béthusy 26,

1005, Lausanne, Schweiz.

46.52°N · 6.63°E

FacebookLinkedIn

Appik Studio SARL, Copyright © 2026|Datenschutzerklärung|Über uns

Appik Studio ist ein erfahrenes Team in Lausanne. Wir konzipieren und entwickeln Mobile-, Web- und KI-Anwendungen für Schweizer Startups, Forschungslabore und Institutionen.