quantization

27 talks

The Frontier AI Inference Cloud for AgentsByung-Gon (Gon) Chun, FriendliAI · 14:59 · Sept 2026 · 8,185 views · AI Engineer World's Fair 2026Vertical Mobility: Inference from MVP to Trillion-Parameter WorkloadsSitanshu Gupta, CoreWeave · 15:22 · Sept 2026 · 5,207 views · AI Engineer World's Fair 2026What's New in Inference EngineeringPhilip Kiely, Baseten · 19:09 · Sept 2026 · 7,424 views · AI Engineer World's Fair 2026Deep dive on LLM Inference at ScaleHarshul Jain, Audible & Tanmay Sah, Independent AI Researcher · 1:28:12 · Sept 2026 · 6,857 views · AI Engineer World's Fair 2026Compression at the EdgeChris Alexiuk, NVIDIA & Daniel Han, Unsloth & Asma Beevi, NVIDIA & Merve Noyan, Hugging Face & Parth Sareen, Ollama · 46:01 · Aug 2026 · 1,958 views · AI Engineer World's Fair 2026Why Large? Tiny LMs and Agents on Edge and RoboticsCormac Brick, Google · 21:45 · Jul 2026 · 6,229 views · AI Engineer World's Fair 2026Special Topics in Kernels, RL, Reward Hacking in AgentsDaniel Han, Unsloth · 2:20:21 · Jul 2026 · 14K views · AI Engineer World's Fair 2026Frontier Results, On DeviceRL Nabors, Arize AI · 30:52 · Jun 2026 · 4,372 views · AI Engineer World's Fair 2026You Might Not Need 50 Diffusion StepsZiv Ilan, NVIDIA · 18:46 · Jun 2026 · 3,460 views · AI Engineer Europe 2026Run Frontier AI at HomeAlex Cheema, EXO Labs · 1:45:02 · May 2026 · 7,424 views · AI Engineer Europe 2026Accelerating AI on EdgeChintan Parikh & Weiyi Wang, Google DeepMind · 23:58 · May 2026 · 6,791 views · AI Engineer Europe 2026TLMs: Tiny LLMs and Agents on Edge Devices with LiteRT-LMCormac Brick, Google · 1:20:58 · May 2026 · 34K views · AI Engineer Europe 2026Running LLMs on your iPhone: 40 tok/s Gemma 4 with MLXAdrien Grondin, Locally AI · 10:51 · Apr 2026 · 14K views · AI Engineer Europe 2026Running LLMs Locally: Practical LLM Performance on DGX SparkMozhgan Kabiri chimeh, NVIDIA · 10:16 · Apr 2026 · 4,785 views · AI Engineer Europe 2026Serving Voice AI at $1/hr: Open-Source, LoRAs, Latency, Load BalancingNeil Dwyer, Gabber · 16:09 · Jul 2025 · 6,928 views · AI Engineer World's Fair 2025Reinforcement Learning, Kernels, Reasoning, Quantization & AgentsDaniel Han, Unsloth · 2:42:28 · Jul 2025 · 155K views · AI Engineer World's Fair 2025360Brew: LLM-based Personalized Ranking and RecommendationHamed Firooz & Maziar Sanjabi, LinkedIn · 22:00 · Jul 2025 · 3,091 views · AI Engineer World's Fair 2025Teaching Gemini to Speak YouTube: Adapting LLMs for Video Recommendations to 2B+DAUDevansh Tandon, Google · 22:51 · Jul 2025 · 18K views · AI Engineer World's Fair 2025Optimizing Inference for Voice Models in ProductionPhilip Kiely, Baseten · 15:13 · Jul 2025 · 3,339 views · AI Engineer World's Fair 2025RAG at scale: production-ready GenAI apps with Azure AI SearchPablo, Microsoft · 21:53 · Feb 2025 · 1,977 views · AI Engineer World's Fair 2024Mastering LLM Inference Optimization From Theory to Cost Effective DeploymentMark Moyou, NVIDIA · 33:39 · Jan 2025 · 63K views · AI Engineer World's Fair 2024A Practical Guide to Efficient AIShelby Heinecke, Salesforce · 17:45 · Nov 2024 · 2,915 views · AI Engineer World's Fair 2024Everything You Need to Know About Fine-tuning and Merging LLMsMaxime Labonne, Liquid AI · 17:52 · Sept 2024 · 32K views · AI Engineer World's Fair 2024From Model Weights to API Endpoint with TensorRT-LLMPhilip Kiely & Pankaj Gupta, Baseten · 1:40:01 · Sept 2024 · 5,858 views · AI Engineer World's Fair 2024Low Level Technicals of LLMsDaniel Han, Unsloth · 2:52:26 · Jul 2024 · 57K views · AI Engineer World's Fair 2024Harnessing the Power of LLMs LocallyMithun Hunsur, Ambient · 17:09 · Nov 2023 · 2,443 views · AI Engineer Summit 2023AI Engineering 201: InferenceCharles Frye, Full Stack Deep Learning · 1:43:16 · Nov 2023 · 3,216 views · AI Engineer Summit 2023