Słuchaj i czytaj 50% taniej przez 4 miesiące!

Znajdź swoją nową ulubioną historię - teraz za jedyne 19,95 zł miesięcznie przez pierwsze 4 miesiące

  • Czytaj i słuchaj jak chcesz i ile chcesz
  • Ponad 500 000 tytułów
  • Tytuły dostępne wyłącznie w Storytel oraz Storytel Originals
  • Łatwa rezygnacja w dowolnym momencie
Wypróbuj
PL - Details page - Device banner - 894x1036
Cover for DeepSpeed Inference: Tensor Parallelism and Memory Efficiency for Large Models

DeepSpeed Inference: Tensor Parallelism and Memory Efficiency for Large Models

Język
Angielski
Format
Kategoria

Literatura Faktu

"DeepSpeed Inference: Tensor Parallelism and Memory Efficiency for Large Models"

Serving large transformer models efficiently is no longer a matter of loading weights and hoping the hardware keeps up. This book is written for experienced ML engineers, systems practitioners, and infrastructure researchers who need a precise, production-oriented understanding of how DeepSpeed Inference scales models beyond single-device limits while preserving latency and throughput. It speaks directly to readers responsible for real deployment decisions, not simplified toy examples.

Across the book, you will learn how DeepSpeed’s inference stack is structured, how `init_inference` controls runtime behavior, and when tensor parallelism is the right scaling mechanism. It examines kernel injection, fused execution, checkpoint compatibility, automatic versus manual partitioning, ZeRO-Inference, heterogeneous memory, KV-cache offloading, and quantization as interconnected system choices rather than isolated features. The result is a rigorous framework for choosing deployment regimes, diagnosing bottlenecks, and engineering memory-efficient serving paths for very large models.

The treatment is version-aware and deliberately practical, helping readers navigate documentation drift, model support boundaries, and migration from classic DeepSpeed Inference concepts to newer FastGen-era framing. Readers should already be comfortable with transformer architectures, distributed GPU systems, and modern model-serving workflows. In return, the book offers a deeply technical, structured guide to the perfor

© 2026 NobleTrex Press (E-book): 6610001214845

Wydanie

E-book: 5 maja 2026

Tagi

    Wybierz swoją subskrypcję:

    • Ponad 500 000 tytułów w cenie jednego abonamentu

    • Słuchaj i czytaj w trybie offline

    • Ekskluzywne produkcje audio Storytel Original

    • Tryb dziecięcy Kids Mode

    • Anuluj kiedy chcesz

    Najpopularniejsze

    Unlimited

    Dla tych, którzy chcą słuchać i czytać bez limitów.

    39.90 zł /30 dni

    • 1 konto

    • Słuchanie bez limitów

    • Anuluj w dowolnym momencie

    Skorzystaj z promocji

    Unlimited na rok

    Dla tych, którzy chcą słuchać i czytać bez limitów.

    39.90 zł /30 dni

    • 1 konto

    • Słuchanie bez limitów

    • Anuluj w dowolnym momencie

    Rozpocznij subskrypcję

    Basic

    Dla tych, którzy słuchają i czytają od czasu do czasu.

    22.90 zł /30 dni

    • 1 konto

    • 10 godzin / miesiąc

    • Anuluj w dowolnym momencie

    Wypróbuj

    Family

    Dla tych, którzy chcą dzielić się historiami ze znajomymi i rodziną.

    Od 59.90 zł /30 dni

    • 2–3 konta

    • Słuchanie bez limitów

    • Anuluj w dowolnym momencie

    Ty + 1 członek rodziny2 konta

    59.90 zł /30 dni

    Wypróbuj