<?xml version="1.0" encoding="utf-8"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>Pourquoi on implémente vLLM en production chez nos clients ? (organisme public,...)</title>
        <link>https://peertube.interhop.org/videos/watch/d42088b0-57fd-488e-80f0-a78b7324384e</link>
        <description>Pourquoi on implémente vLLM en production chez nos clients ? (organisme public,...) Par Benoit Ferrere Quand tu passes d’une démo a un usage client, les problèmes changent : mémoire GPU saturée, KV cache qui explose, requêtes concurrentes, latence, batching, tokens/s, coût d’infra… Et c’est précisément là que vLLM intervient. En tant que moteur d’inférence. Ce n’est pas “juste" un serveur qui expose un/des modèles LLM. C’est le runtime lui même qui orchestre l’inférence : Comment les requêtes passent sur le GPU ?, Comment la mémoire est utilisée ?, Comment le KV cache est géré ?, Comment on maximise le throughput sans détruire l’expérience utilisateur ?, Dans cette vidéo, je décortique l’anatomie de vLLM : 1- Pourquoi l’inférence devient vite le vrai goulot d’étranglement en prod. 2- Comment comparer vLLM, SGLang et llama.cpp selon les cas d’usage. 3- Où partent les ressources hardware pendant la génération. 4- Pourquoi PagedAttention change la gestion mémoire. 5- Pourquoi le Continuous Batching permet de mieux exploiter le GPU. N’hésites pas à partager et regarder la vidéo : )</description>
        <lastBuildDate>Sun, 13 Sep 2026 17:34:41 GMT</lastBuildDate>
        <docs>https://validator.w3.org/feed/docs/rss2.html</docs>
        <generator>PeerTube - https://peertube.interhop.org</generator>
        <image>
            <title>Pourquoi on implémente vLLM en production chez nos clients ? (organisme public,...)</title>
            <url>https://peertube.interhop.org/client/assets/images/icons/icon-1500x1500.png</url>
            <link>https://peertube.interhop.org/videos/watch/d42088b0-57fd-488e-80f0-a78b7324384e</link>
        </image>
        <copyright>All rights reserved, unless otherwise specified in the terms specified at https://peertube.interhop.org/about and potential licenses granted by each content's rightholder.</copyright>
        <atom:link href="https://peertube.interhop.org/feeds/video-comments.xml?videoId=d42088b0-57fd-488e-80f0-a78b7324384e" rel="self" type="application/rss+xml"/>
    </channel>
</rss>