Text Generation Inference (TGI): Deploying Transformers with Streaming and Batching

Kieli
Englanti
Formaatti
Kategoria

Tietokirjallisuus

"Text Generation Inference (TGI): Deploying Transformers with Streaming and Batching"

This book is for engineers and platform practitioners who need to move transformer inference from demos into reliable, high-performance production systems. Rather than treating serving as a thin wrapper around model.generate(), it addresses the real tensions that emerge under live traffic: latency versus throughput, streaming responsiveness versus compute cost, and hardware efficiency versus operational simplicity. Readers building chat systems, internal AI platforms, or GPU-backed inference services will find a rigorous guide to what actually governs TGI behavior in production.

Across the book, you will build a working mental model of TGI’s runtime architecture, request flow, streaming semantics, and continuous batching scheduler. It explains prefill and decode execution, token-budget controls, time-to-first-token behavior, multi-GPU sharding, replication trade-offs, and inference optimizations such as attention and memory techniques. The result is practical decision-making skill: how to size deployments, tune throughput-latency trade-offs, expose stable APIs, integrate streaming clients, and diagnose bottlenecks with metrics and tracing.

The treatment assumes experience with transformers, GPU-based model serving, and modern infrastructure patterns such as HTTP APIs, proxies, and observability tooling. Its distinguishing strength is operational depth: the material is organized around deployment decisions, failure modes, compatibility boundaries, and performance trade-offs, making it es

© 2026 NobleTrex Press (E-kirja): 6610001219109

Julkaisupäivä

E-kirja: 8. toukokuuta 2026

Kuuntele missä ja milloin haluat

Astu tarinoiden maailmaan

  • Pohjoismaiden suosituin ääni- ja e-kirjapalvelu
  • Uppoudu suureen valikoimaan äänikirjoja ja e-kirjoja
  • Storytel Original -sisältöjä yksinoikeudella
  • Ei sitoutumisaikaa
Lunasta tarjous
Cover for Text Generation Inference (TGI): Deploying Transformers with Streaming and Batching

Valitse tilausmalli

  • Nauti yli miljoonasta tarinasta, henkilökohtaisista suosituksista, viikottaisista uutuuksista sekä turvallisesta lastentilasta. Ei sitoutumisaikaa. 

Suosituin

Flex

Kuuntele ja lue harvemmin - säästä käyttämättömät tunnit

9.99 € /kk

  • 1 käyttäjätili

  • 20 tuntia/kk

  • Säästä käyttämättömät tunnit, max 20h

  • Ei sitoutumisaikaa

Lunasta tarjous

Premium

Kuuntele ja lue usein

19.99 € /kk

  • 1 käyttäjätili

  • 100 tuntia/kk

  • Ei sitoutumisaikaa

Aloita ilmainen kokeilu

Standard

Kuuntele ja lue säännöllisesti

16.99 € /kk

  • 1 käyttäjätili

  • 50 tuntia/kk

  • Ei sitoutumisaikaa

Aloita ilmainen kokeilu

Unlimited

Kuuntele ja lue rajattomasti

29.99 € /kk

  • 1 käyttäjätili

  • Kuuntele ja lue rajattomasti

  • Ei sitoutumisaikaa

Aloita ilmainen kokeilu

Family

Jaa tarinat koko perheelle

Alkaen 26.99 € /kuukausi

  • 2-6 käyttäjätiliä

  • 100 tuntia/kk jokaiselle käyttäjälle

  • Ei sitoutumisaikaa

Sinä + 1 perheenjäsen

2 käyttäjätiliä

26.99 € /kk

Aloita ilmainen kokeilu