119 - Token Caching

Impossible d'ajouter des articles

Désolé, nous ne sommes pas en mesure d'ajouter l'article car votre panier est déjà plein.

Veuillez réessayer plus tard

Échec de l’élimination de la liste d'envies.

Veuillez réessayer plus tard

Impossible de suivre le podcast

Impossible de ne plus suivre le podcast

119 - Token Caching

Écouter gratuitement

Voir les détails

À propos de ce contenu audio

In dieser Folge des KI-Gilde-Podcasts beleuchten wir das Thema Prompt Caching und wie sich damit die Kosten für LLM-Schnittstellen massiv senken lassen.

Wir erklären die technische Funktionsweise des sogenannten KV-Cache, der rechenintensive Zwischenergebnisse speichert, anstatt den Kontext jedes Mal neu zu verarbeiten. Erfahre, warum der Zugriff auf den Cache bis zu 90 % günstiger ist als reguläre Input-Token und wieso das erste "Schreiben" in den Cache etwas mehr kostet. Zudem diskutieren wir die unterschiedlichen Philosophien von Anbietern wie OpenAI (automatisch) und Anthropic (explizite Steuerung) und nennen die wichtigsten Regeln, um Caching erfolgreich in der Entwicklung einzusetzen.

Les membres Amazon Prime bénéficient automatiquement de 2 livres audio offerts chez Audible.

Vous êtes membre Amazon Prime ?

Bénéficiez automatiquement de 2 livres audio offerts.
Bonne écoute !

Aucun commentaire pour le moment