Dengarkan dan baca

Masuki dunia cerita tanpa batas

  • Baca dan dengarkan sebanyak yang Anda mau
  • Lebih dari 1 juta judul
  • Judul eksklusif + Storytel Original
  • Uji coba gratis 14 hari, lalu €9,99/bulan
  • Mudah untuk membatalkan kapan saja
Coba gratis
Cover for TensorRT‑LLM Optimization: Quantization, Kernel Fusion, and Throughput Engineering

TensorRT‑LLM Optimization: Quantization, Kernel Fusion, and Throughput Engineering

Bahasa
Inggris
Format
Kategori

Non Fiksi

"TensorRT‑LLM Optimization: Quantization, Kernel Fusion, and Throughput Engineering"

Built for experienced ML systems engineers, inference specialists, and GPU performance practitioners, this book is a deep guide to making large language models run faster, cheaper, and more predictably with TensorRT‑LLM. Rather than offering generic acceleration advice, it develops a precise mental model of the TensorRT‑LLM stack so readers can understand where performance is won or lost: in quantization choices, graph compilation, fused kernels, KV-cache policy, and serving scheduler behavior.

The book covers the full optimization path from precision strategy and post-training quantization pipelines to engine build configuration, plugin-enabled fusion, attention specialization, and throughput-oriented serving design. Readers will learn how to choose among FP16, BF16, FP8, INT8, and INT4 in hardware-aware ways; validate deployable quantized artifacts; realize fused execution paths in compiled engines; engineer KV-cache behavior for long-context workloads; and benchmark and profile systems with enough rigor to attribute gains to the right layer.

Structured as an advanced, implementation-minded text, the book emphasizes cross-layer tradeoffs rather than isolated tricks. It assumes solid familiarity with transformer inference, CUDA-era GPU concepts, and production deployment concerns, and rewards readers who want durable optimization judgment instead of version-fragile recipes."

© 2026 NobleTrex Press (E-book): 6610001219079

Tanggal rilis

E-book: 8 Mei 2026

Buku yang mirip dengan TensorRT‑LLM Optimization: Quantization, Kernel Fusion, and Throughput Engineering

Selalu dengan Storytel

  • Lebih dari 900.000 judul

  • Mode Anak (lingkungan aman untuk anak)

  • Unduh buku untuk akses offline

  • Batalkan kapan saja

Terpopuler

Premium

Bagi yang ingin mendengarkan dan membaca tanpa batas.

Rp39000 /bulan

  • 1 akun

  • Akses Tanpa Batas

  • Akses bulanan tanpa batas

  • Batalkan kapan saja

  • Judul dalam bahasa Inggris dan Indonesia

Coba sekarang

Premium 6 bulan

Bagi yang ingin mendengarkan dan membaca tanpa batas

Rp189000 /6 bulan

Hemat 19%
  • 1 akun

  • Akses Tanpa Batas

  • Akses bulanan tanpa batas

  • Batalkan kapan saja

  • Judul dalam bahasa Inggris dan Indonesia

Coba sekarang

Local

Bagi yang hanya ingin mendengarkan dan membaca dalam bahasa lokal.

Rp19900 /bulan

  • 1 akun

  • Judul dalam bahasa tertentu

  • Akses tidak terbatas

  • Batalkan kapan saja

  • Judul dalam bahasa Indonesia

Coba sekarang

Local 6 bulan

Bagi yang hanya ingin mendengarkan dan membaca dalam bahasa lokal.

Rp89000 /6 bulan

Hemat 25%
  • 1 akun

  • Judul dalam bahasa tertentu

  • Akses tidak terbatas

  • Batalkan kapan saja

  • Judul dalam bahasa Indonesia

Coba sekarang