[{"data":1,"prerenderedAt":1440},["ShallowReactive",2],{"blog-post-nl-\u002Fblog\u002Fpaiton-qwen38-radeon-ai-pro-r9700":3,"blog-posts-sidebar-nl":967},{"id":4,"title":5,"body":6,"categories":944,"date":954,"description":955,"extension":956,"heading":957,"image":958,"meta":959,"navigation":960,"originalUrl":961,"path":962,"seo":963,"slug":964,"stem":965,"updated":957,"__hash__":966},"blogNl\u002Fblog\u002Fpaiton-qwen38-radeon-ai-pro-r9700.md","Paiton: 21% meer Qwen3.8-doorvoer op Radeon AI PRO R9700",{"type":7,"value":8,"toc":931},"minimark",[9,16,31,38,49,56,61,64,157,160,163,167,170,173,195,198,201,207,211,214,220,223,272,339,345,348,354,357,361,364,367,370,373,377,380,383,386,390,393,396,399,403,406,515,518,536,539,559,574,584,588,591,766,769,773,883,886,889,893,908,911,915,918,921,927],[10,11,12],"p",{},[13,14,15],"strong",{},"Eén GPU. Hetzelfde publiek beschikbare modelcheckpoint. Dezelfde benchmarkverzoeken. Meer output.",[10,17,18,19,26,27,30],{},"Paiton draaide AMD's publieke\n",[20,21,25],"a",{"href":22,"rel":23},"https:\u002F\u002Fhuggingface.co\u002Famd\u002FQwen3.8-27B-Quark-Qronos-INT4-W4A16",[24],"nofollow","Qwen3.8-27B-Quark-Qronos-INT4-W4A16","\nmet ",[13,28,29],{},"39,77 outputtokens per seconde"," in onze interactieve benchmark met batchgrootte één op één AMD Radeon AI PRO R9700 met 32 GB geheugen.",[10,32,33,34,37],{},"Onze snelste gekwalificeerde standaard-vLLM-configuratie op hetzelfde systeem behaalde 32,86 outputtokens per seconde. Daardoor levert Paiton ",[13,35,36],{},"21,0% meer output per actief inferentie-uur"," uit dezelfde GPU.",[10,39,40,41,44,45,48],{},"Bij de codeerworkload liep het voordeel op tot ",[13,42,43],{},"54,3%",". Met een input van 4.096 tokens bedroeg het ",[13,46,47],{},"26,8%",".",[10,50,51],{},[52,53],"img",{"alt":54,"src":55},"Paiton levert 39,77 outputtokens per seconde voor de interactieve workload, 37,93 voor codering en 25,45 voor lange context, waarmee hij in alle drie de tests beter presteert dan de gekwalificeerde stock-vLLM-basislijn.","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-r9700\u002F01-throughput-by-workload-eliovp.webp",[57,58,60],"h2",{"id":59},"throughput-voor-drie-workloads","Throughput voor drie workloads",[10,62,63],{},"Dit zijn servingtests voor één gebruiker, met één verzoek tegelijk, één actieve modelsequentie, temperatuur nul, thinking uitgeschakeld en vaste willekeurige inputs.",[65,66,67,90],"table",{},[68,69,70],"thead",{},[71,72,73,77,81,84,87],"tr",{},[74,75,76],"th",{},"Workload",[74,78,80],{"align":79},"right","Gevraagde input \u002F output",[74,82,83],{"align":79},"Gekwalificeerde standaard-vLLM",[74,85,86],{"align":79},"Paiton",[74,88,89],{"align":79},"Voordeel met Paiton",[91,92,93,115,136],"tbody",{},[71,94,95,99,102,105,110],{},[96,97,98],"td",{},"Interactief",[96,100,101],{"align":79},"256 \u002F 256",[96,103,104],{"align":79},"32,86 tok\u002Fs",[96,106,107],{"align":79},[13,108,109],{},"39,77 tok\u002Fs",[96,111,112],{"align":79},[13,113,114],{},"+21,0%",[71,116,117,120,123,126,131],{},[96,118,119],{},"Codering",[96,121,122],{"align":79},"1.024 \u002F 512",[96,124,125],{"align":79},"24,58 tok\u002Fs",[96,127,128],{"align":79},[13,129,130],{},"37,93 tok\u002Fs",[96,132,133],{"align":79},[13,134,135],{},"+54,3%",[71,137,138,141,144,147,152],{},[96,139,140],{},"Lange context",[96,142,143],{"align":79},"4.096 \u002F 256",[96,145,146],{"align":79},"20,07 tok\u002Fs",[96,148,149],{"align":79},[13,150,151],{},"25,45 tok\u002Fs",[96,153,154],{"align":79},[13,155,156],{},"+26,8%",[10,158,159],{},"Elke workload werd twee keer uitgevoerd vanaf een nieuw gestarte server. Elke run bestond uit drie warm-ups, gevolgd door 12 gemeten verzoeken. De tabel vermeldt het gemiddelde van beide runs. Alle zes Paiton-runs verwerkten de 12 verzoeken zonder fouten en leverden telkens de volledig gevraagde outputlengte.",[10,161,162],{},"Door de chattemplates bedroegen de werkelijke promptlengtes respectievelijk 268 tot 270, 1.036 tot 1.038 en 4.108 tot 4.110 tokens.",[57,164,166],{"id":165},"latency-sneller-streamen-gemengde-resultaten-voor-het-eerste-token","Latency: sneller streamen, gemengde resultaten voor het eerste token",[10,168,169],{},"Outputthroughput is slechts één onderdeel van de gebruikerservaring. Daarom publiceren we ook de latency voor het eerste token en voor streaming.",[10,171,172],{},"Paiton verminderde de mediane tijd per uitvoertoken in elke workload:",[174,175,176,183,189],"ul",{},[177,178,179,180],"li",{},"Interactief: ",[13,181,182],{},"30 ms tot 24 ms",[177,184,185,186],{},"Codering: ",[13,187,188],{},"39 ms tot 25 ms",[177,190,191,192],{},"Lange context: ",[13,193,194],{},"37 ms tot 28 ms",[10,196,197],{},"De Time to First Token hing af van de workload. De mediane interactieve TTFT steeg van 258 ms naar 290 ms. Bij codering verbeterde die licht, van 757 ms naar 737 ms, terwijl de TTFT voor lange context daalde van 3.337 ms naar 2.984 ms.",[10,199,200],{},"Het resultaat is een duidelijke winst in streamingthroughput. We beweren niet dat elke latencymetric in elk scenario verbetert.",[10,202,203],{},[52,204],{"alt":205,"src":206},"Paiton verlaagt de tijd per uitvoertoken voor alle drie de workloads. De tijd tot het eerste token is langer voor de interactieve test, iets korter voor codering en lager voor de lange-contexttest.","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-r9700\u002F02-latency-snapshot-eliovp.webp",[57,208,210],{"id":209},"wat-de-winst-betekent-voor-de-kosten","Wat de winst betekent voor de kosten",[10,212,213],{},"Bij eigen inferentiehardware bepaalt de throughput hoeveel output een vast uur GPU-tijd oplevert. Bij gelijke systeemkosten per uur levert 21,0% meer throughput ook 21,0% meer tokens op binnen hetzelfde actieve runtimebudget.",[10,215,216,217,48],{},"Omdat de kosten per token omgekeerd evenredig zijn met de throughput, bedraagt de overeenkomstige gemodelleerde daling van de tijdsgebonden kosten per miljoen outputtokens ",[13,218,219],{},"17,4%",[10,221,222],{},"In de onderstaande voorbeelden schrijven we de GPU af over 5.000 productieve inferentie-uren. Voor beide runtimes gaan we uit van hetzelfde systeemverbruik van 450 W.",[65,224,225,238],{},[68,226,227],{},[71,228,229,232,235],{},[74,230,231],{},"Veronderstelling",[74,233,234],{"align":79},"Amerikaans voorbeeld",[74,236,237],{"align":79},"Europees voorbeeld",[91,239,240,251,262],{},[71,241,242,245,248],{},[96,243,244],{},"GPU-aankoopprijs",[96,246,247],{"align":79},"$ 1.299",[96,249,250],{"align":79},"€ 1.749",[71,252,253,256,259],{},[96,254,255],{},"Elektriciteit",[96,257,258],{"align":79},"$ 0,17\u002FkWh",[96,260,261],{"align":79},"€ 0,2558\u002FkWh",[71,263,264,267,270],{},[96,265,266],{},"Productieve inferentie levensduur",[96,268,269],{"align":79},"5.000 uur",[96,271,269],{"align":79},[65,273,274,285],{},[68,275,276],{},[71,277,278,281,283],{},[74,279,280],{},"Interactieve tokeneconomie",[74,282,83],{"align":79},[74,284,86],{"align":79},[91,286,287,300,313,326],{},[71,288,289,292,295],{},[96,290,291],{},"Uren per miljoen outputtokens",[96,293,294],{"align":79},"8,45",[96,296,297],{"align":79},[13,298,299],{},"6,98",[71,301,302,305,308],{},[96,303,304],{},"Gemodelleerde kosten per miljoen, Amerikaans voorbeeld",[96,306,307],{"align":79},"$ 2,84",[96,309,310],{"align":79},[13,311,312],{},"$ 2,35",[71,314,315,318,321],{},[96,316,317],{},"Gemodelleerde kosten per miljoen, Europees voorbeeld",[96,319,320],{"align":79},"€ 3,93",[96,322,323],{"align":79},[13,324,325],{},"€ 3,25",[71,327,328,331,334],{},[96,329,330],{},"Output over 5.000 actieve uren",[96,332,333],{"align":79},"591,5 miljoen",[96,335,336],{"align":79},[13,337,338],{},"715,8 miljoen",[10,340,341,342,48],{},"Bij de gemeten interactieve snelheden produceert dezelfde kaart over 5.000 productieve uren ongeveer ",[13,343,344],{},"124 miljoen extra outputtokens",[10,346,347],{},"Met hetzelfde gemodelleerde budget van $ 100 voor eigendom en elektriciteit produceert Paiton ongeveer 42,6 miljoen tokens in plaats van 35,2 miljoen. In het Europese voorbeeld levert € 100 ongeveer 30,8 miljoen tokens op in plaats van 25,4 miljoen.",[10,349,350],{},[52,351],{"alt":352,"src":353},"Bij 5.000 productieve inferentie-uren bedragen de gemodelleerde Europese kosten € 3,93 per miljoen outputtokens voor stock-vLLM en € 3,25 voor Paiton.","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-r9700\u002F03-economics-sensitivity-eliovp.webp",[10,355,356],{},"Deze cijfers vormen een transparant, tijdsgebonden eigendomsmodel en geen claim over gemeten energie-efficiëntie. Het model houdt geen rekening met de hostcomputer, inactieve tijd, koeling, onderhoud, financiering, belastingen of restwaarde. U kunt de aankoopprijs, het elektriciteitstarief en de productieve levensduur door uw eigen waarden vervangen. De relatieve daling van 17,4% blijft gelijk zolang beide runtimes dezelfde uurkosten hebben.",[57,358,360],{"id":359},"een-relevante-standaardbaseline","Een relevante standaardbaseline",[10,362,363],{},"We vergeleken Paiton niet met een eager- of standaardinstallatie om het resultaat vervolgens een optimalisatiewinst te noemen. We investeerden veel tijd in het kwalificeren van de snelste stabiele standaardconfiguratie die we op dit systeem konden realiseren.",[10,365,366],{},"De standaardbaseline gebruikte gecompileerde vLLM-uitvoering op optimalisatieniveau 2, volledige en gedeeltelijke HIP-graph capture, standaard hybride W4A16-kernels voor RDNA, vLLM's Triton GDN-implementatie, de ROCm-attentionbackend en het ondersteunde high-clockbeleid van de R9700.",[10,368,369],{},"Beide configuraties gebruikten dezelfde GPU, ROCm-host, modelrevisie, tokenizer, vastgezette vLLM-revisie, verzoekgegevens, random seed, outputlengtes, concurrency en hetzelfde ondersteunde GPU-klokbeleid. We bewaarden de volledige resultaatbestanden en namen per workload het gemiddelde van twee runs vanaf een nieuw gestarte server. We selecteerden dus niet één gunstig terminalresultaat.",[10,371,372],{},"De standaardlogs bevestigen de gecompileerde uitvoering en graph capture. Ze laden geen Paiton-modelartefact en geen Paiton-computekernel.",[57,374,376],{"id":375},"wat-paiton-doet","Wat Paiton doet",[10,378,379],{},"Op hoofdlijnen bouwt Paiton een gekwalificeerd, model- en hardwarespecifiek uitvoeringspad en integreert dat met de servingruntime. Het oorspronkelijke AMD-checkpoint blijft ongewijzigd op schijf.",[10,381,382],{},"Tijdens het laden van het model stelt Paiton doelspecifieke runtimeartefacten samen. Er mag daarom niet van worden uitgegaan dat het geoptimaliseerde pad output oplevert die bit voor bit identiek is aan de standaard W4-uitvoering.",[10,384,385],{},"Daar stopt de technische toelichting over de implementatie. De modelspecifieke kernels, fusie, scheduling en het runtimeontwerp zijn gesloten Paiton-IP. We publiceren wel wat klanten kunnen valideren: het ondersteunde doel, de benchmarkmethode, throughput, latency, kwaliteitscontroles, pakketidentiteit en operationele scope.",[57,387,389],{"id":388},"kwaliteitscontroles","Kwaliteitscontroles",[10,391,392],{},"We voerden een deterministische testreeks met 12 gevallen uit. Die omvatte het volgen van instructies, rekenkunde, algebra, logica, feitenkennis, vertaling, gestructureerde JSON, Python, SQL, samenvatting, formaatbeperkingen en modulair redeneren.",[10,394,395],{},"Alle 12 tests slaagden. Herhaalde antwoorden met temperatuur nul waren byte-identiek en alle geregistreerde logwaarschijnlijkheden waren eindig.",[10,397,398],{},"Dit is een praktische kwaliteitscontrole voor de vermelde lokale chatscope. Ze vervangt geen volledige academische nauwkeurigheidsevaluatie en vormt geen claim van gelijke kwaliteit voor elke taak of promptverdeling.",[57,400,402],{"id":401},"voer-de-lokale-chatbot-uit","Voer de lokale chatbot uit",[10,404,405],{},"De publieke image bevat de Paiton-runtimeplug-in en gecompileerde runtimeartefacten. De image downloadt het oorspronkelijke AMD-checkpoint van 19,9 GB rechtstreeks van Hugging Face naar een persistent Docker-volume. Paiton distribueert de modelgewichten niet opnieuw.",[407,408,413],"pre",{"className":409,"code":410,"language":411,"meta":412,"style":412},"language-bash shiki shiki-themes github-light github-dark","docker run -d \\\n  --name paiton-qwen38 \\\n  --device \u002Fdev\u002Fkfd \\\n  --device \u002Fdev\u002Fdri \\\n  --group-add video \\\n  --ipc=host \\\n  --network host \\\n  --mount type=volume,src=paiton-qwen38-cache,dst=\u002Fmodels\u002Fcache \\\n  ghcr.io\u002Feliovp\u002Fpaiton-vllm-plugin@sha256:c56baf54aca1ad229829c1de26e8792806608e65ee9d06ee210b79cd49f70bc9\n","bash","",[414,415,416,436,447,458,468,479,487,498,509],"code",{"__ignoreMap":412},[417,418,421,425,429,433],"span",{"class":419,"line":420},"line",1,[417,422,424],{"class":423},"sScJk","docker",[417,426,428],{"class":427},"sZZnC"," run",[417,430,432],{"class":431},"sj4cs"," -d",[417,434,435],{"class":431}," \\\n",[417,437,439,442,445],{"class":419,"line":438},2,[417,440,441],{"class":431},"  --name",[417,443,444],{"class":427}," paiton-qwen38",[417,446,435],{"class":431},[417,448,450,453,456],{"class":419,"line":449},3,[417,451,452],{"class":431},"  --device",[417,454,455],{"class":427}," \u002Fdev\u002Fkfd",[417,457,435],{"class":431},[417,459,461,463,466],{"class":419,"line":460},4,[417,462,452],{"class":431},[417,464,465],{"class":427}," \u002Fdev\u002Fdri",[417,467,435],{"class":431},[417,469,471,474,477],{"class":419,"line":470},5,[417,472,473],{"class":431},"  --group-add",[417,475,476],{"class":427}," video",[417,478,435],{"class":431},[417,480,482,485],{"class":419,"line":481},6,[417,483,484],{"class":431},"  --ipc=host",[417,486,435],{"class":431},[417,488,490,493,496],{"class":419,"line":489},7,[417,491,492],{"class":431},"  --network",[417,494,495],{"class":427}," host",[417,497,435],{"class":431},[417,499,501,504,507],{"class":419,"line":500},8,[417,502,503],{"class":431},"  --mount",[417,505,506],{"class":427}," type=volume,src=paiton-qwen38-cache,dst=\u002Fmodels\u002Fcache",[417,508,435],{"class":431},[417,510,512],{"class":419,"line":511},9,[417,513,514],{"class":427},"  ghcr.io\u002Feliovp\u002Fpaiton-vllm-plugin@sha256:c56baf54aca1ad229829c1de26e8792806608e65ee9d06ee210b79cd49f70bc9\n",[10,516,517],{},"Bij de eerste start wordt het checkpoint gedownload. Als de gewichten al in de cache staan, duurt de modelsamenstelling op onze R9700 ongeveer 10 tot 12 minuten. Volg het opstartproces met:",[407,519,521],{"className":409,"code":520,"language":411,"meta":412,"style":412},"docker logs -f paiton-qwen38\n",[414,522,523],{"__ignoreMap":412},[417,524,525,527,530,533],{"class":419,"line":420},[417,526,424],{"class":423},[417,528,529],{"class":427}," logs",[417,531,532],{"class":431}," -f",[417,534,535],{"class":427}," paiton-qwen38\n",[10,537,538],{},"Zodra de logs melden dat de applicatie gereed is, opent u de meegeleverde streamingchat:",[407,540,542],{"className":409,"code":541,"language":411,"meta":412,"style":412},"docker exec -it paiton-qwen38 paiton-chat\n",[414,543,544],{"__ignoreMap":412},[417,545,546,548,551,554,556],{"class":419,"line":420},[417,547,424],{"class":423},[417,549,550],{"class":427}," exec",[417,552,553],{"class":431}," -it",[417,555,444],{"class":427},[417,557,558],{"class":427}," paiton-chat\n",[10,560,561,562,565,566,569,570,573],{},"Gebruik ",[414,563,564],{},"\u002Freset"," om het gesprek te wissen en ",[414,567,568],{},"\u002Fquit"," om af te sluiten. Thinking is standaard uitgeschakeld voor een responsieve lokale chat. Geef indien nodig ",[414,571,572],{},"--thinking"," mee.",[10,575,576,577,580,581,48],{},"Dezelfde server stelt een OpenAI-compatibel eindpunt beschikbaar op\n",[414,578,579],{},"http:\u002F\u002F127.0.0.1:8000\u002Fv1\u002Fchat\u002Fcompletions"," met modelnaam ",[414,582,583],{},"qwen38",[57,585,587],{"id":586},"reproduceer-de-interactieve-benchmark","Reproduceer de interactieve benchmark",[10,589,590],{},"Nadat de server gereed is:",[407,592,594],{"className":409,"code":593,"language":411,"meta":412,"style":412},"docker exec paiton-qwen38 sh -lc '\nMODEL_DIR=\"$(find \u002Ftmp -maxdepth 2 -type d \\\n  -path \"\u002Ftmp\u002Fpaiton-qwen38-reused-*\u002Fmodel\" -print -quit)\"\nexec vllm bench serve \\\n  --backend openai-chat \\\n  --base-url http:\u002F\u002F127.0.0.1:8000 \\\n  --endpoint \u002Fv1\u002Fchat\u002Fcompletions \\\n  --model qwen38 \\\n  --tokenizer \"$MODEL_DIR\" \\\n  --dataset-name random \\\n  --seed 42 \\\n  --num-warmups 3 \\\n  --num-prompts 12 \\\n  --random-input-len 256 \\\n  --random-output-len 256 \\\n  --random-range-ratio 0 \\\n  --random-prefix-len 0 \\\n  --request-rate inf \\\n  --max-concurrency 1 \\\n  --temperature 0 \\\n  --ignore-eos \\\n  --extra-body '\\''{\"chat_template_kwargs\":{\"enable_thinking\":false}}'\\'' \\\n  --percentile-metrics ttft,tpot,itl,e2el \\\n  --metric-percentiles 50,90,95,99 \\\n  --disable-tqdm\n'\n",[414,595,596,613,618,623,628,633,638,643,648,653,659,665,671,677,683,689,695,701,707,713,719,725,742,748,754,760],{"__ignoreMap":412},[417,597,598,600,602,604,607,610],{"class":419,"line":420},[417,599,424],{"class":423},[417,601,550],{"class":427},[417,603,444],{"class":427},[417,605,606],{"class":427}," sh",[417,608,609],{"class":431}," -lc",[417,611,612],{"class":427}," '\n",[417,614,615],{"class":419,"line":438},[417,616,617],{"class":427},"MODEL_DIR=\"$(find \u002Ftmp -maxdepth 2 -type d \\\n",[417,619,620],{"class":419,"line":449},[417,621,622],{"class":427},"  -path \"\u002Ftmp\u002Fpaiton-qwen38-reused-*\u002Fmodel\" -print -quit)\"\n",[417,624,625],{"class":419,"line":460},[417,626,627],{"class":427},"exec vllm bench serve \\\n",[417,629,630],{"class":419,"line":470},[417,631,632],{"class":427},"  --backend openai-chat \\\n",[417,634,635],{"class":419,"line":481},[417,636,637],{"class":427},"  --base-url http:\u002F\u002F127.0.0.1:8000 \\\n",[417,639,640],{"class":419,"line":489},[417,641,642],{"class":427},"  --endpoint \u002Fv1\u002Fchat\u002Fcompletions \\\n",[417,644,645],{"class":419,"line":500},[417,646,647],{"class":427},"  --model qwen38 \\\n",[417,649,650],{"class":419,"line":511},[417,651,652],{"class":427},"  --tokenizer \"$MODEL_DIR\" \\\n",[417,654,656],{"class":419,"line":655},10,[417,657,658],{"class":427},"  --dataset-name random \\\n",[417,660,662],{"class":419,"line":661},11,[417,663,664],{"class":427},"  --seed 42 \\\n",[417,666,668],{"class":419,"line":667},12,[417,669,670],{"class":427},"  --num-warmups 3 \\\n",[417,672,674],{"class":419,"line":673},13,[417,675,676],{"class":427},"  --num-prompts 12 \\\n",[417,678,680],{"class":419,"line":679},14,[417,681,682],{"class":427},"  --random-input-len 256 \\\n",[417,684,686],{"class":419,"line":685},15,[417,687,688],{"class":427},"  --random-output-len 256 \\\n",[417,690,692],{"class":419,"line":691},16,[417,693,694],{"class":427},"  --random-range-ratio 0 \\\n",[417,696,698],{"class":419,"line":697},17,[417,699,700],{"class":427},"  --random-prefix-len 0 \\\n",[417,702,704],{"class":419,"line":703},18,[417,705,706],{"class":427},"  --request-rate inf \\\n",[417,708,710],{"class":419,"line":709},19,[417,711,712],{"class":427},"  --max-concurrency 1 \\\n",[417,714,716],{"class":419,"line":715},20,[417,717,718],{"class":427},"  --temperature 0 \\\n",[417,720,722],{"class":419,"line":721},21,[417,723,724],{"class":427},"  --ignore-eos \\\n",[417,726,728,731,734,737,739],{"class":419,"line":727},22,[417,729,730],{"class":427},"  --extra-body '",[417,732,733],{"class":431},"\\'",[417,735,736],{"class":427},"'{\"chat_template_kwargs\":{\"enable_thinking\":false}}'",[417,738,733],{"class":431},[417,740,741],{"class":427},"' \\\n",[417,743,745],{"class":419,"line":744},23,[417,746,747],{"class":427},"  --percentile-metrics ttft,tpot,itl,e2el \\\n",[417,749,751],{"class":419,"line":750},24,[417,752,753],{"class":427},"  --metric-percentiles 50,90,95,99 \\\n",[417,755,757],{"class":419,"line":756},25,[417,758,759],{"class":427},"  --disable-tqdm\n",[417,761,763],{"class":419,"line":762},26,[417,764,765],{"class":427},"'\n",[10,767,768],{},"Eén run is nuttig als lokale controle, maar het energiebeheer van een consumentengpu kan een cold run vertragen. Voer eerst een korte warm-up uit en controleer of de geheugenklok zijn normale belaste toestand heeft bereikt voordat u een vergelijking registreert.",[57,770,772],{"id":771},"geteste-configuratie","Geteste configuratie",[65,774,775,785],{},[68,776,777],{},[71,778,779,782],{},[74,780,781],{},"Onderdeel",[74,783,784],{},"Geteste waarde",[91,786,787,798,806,816,824,834,842,852,860,867,875],{},[71,788,789,792],{},[96,790,791],{},"GPU",[96,793,794,795],{},"AMD Radeon AI PRO R9700, 32 GB, ",[414,796,797],{},"gfx1201",[71,799,800,803],{},[96,801,802],{},"Model",[96,804,805],{},"AMD Qwen3.8 27B Qronos W4A16 INT4",[71,807,808,811],{},[96,809,810],{},"Modelrevisie",[96,812,813],{},[414,814,815],{},"649ca9d47a7de5364c6fcccc0c1b4f6e542e15e2",[71,817,818,821],{},[96,819,820],{},"ROCm",[96,822,823],{},"7.14",[71,825,826,829],{},[96,827,828],{},"vLLM-revisie",[96,830,831],{},[414,832,833],{},"39bd959b582c85e78e7e0326d49042ce7c3c07ed",[71,835,836,839],{},[96,837,838],{},"Paiton-image",[96,840,841],{},"Qwen3.8 Qronos voor Radeon AI PRO R9700",[71,843,844,847],{},[96,845,846],{},"Image-digest",[96,848,849],{},[414,850,851],{},"sha256:c56baf54aca1ad229829c1de26e8792806608e65ee9d06ee210b79cd49f70bc9",[71,853,854,857],{},[96,855,856],{},"Tensorparallellisme",[96,858,859],{},"1",[71,861,862,865],{},[96,863,864],{},"Maximaal aantal actieve sequenties",[96,866,859],{},[71,868,869,872],{},[96,870,871],{},"Maximale context",[96,873,874],{},"8.192 tokens",[71,876,877,880],{},[96,878,879],{},"Gekwalificeerd bereik",[96,881,882],{},"Alleen tekst, inferentie voor één gebruiker",[10,884,885],{},"Het pakket weigert veilig te starten bij een niet-ondersteunde GPU-identiteit, architectuur, runtimecontract, artefactchecksum, modelcontract of servingconfiguratie. Meerdere gelijktijdige verzoeken worden in een wachtrij geplaatst.",[10,887,888],{},"Dit artikel claimt geen ondersteuning voor andere GPU's, ROCm-versies, tensorparallelle configuraties, multimodale input of continuous batching in productie.",[57,890,892],{"id":891},"het-praktische-resultaat","Het praktische resultaat",[10,894,895,896,899,900,903,904,907],{},"Op één Radeon AI PRO R9700 verhoogde Paiton de interactieve Qwen3.8-outputthroughput van 32,86 naar 39,77 tokens per seconde. Dat betekent ",[13,897,898],{},"21,0% meer output per actief uur",", een ",[13,901,902],{},"daling van 17,4% in de gemodelleerde tijdsgebonden kosten per miljoen outputtokens"," en ongeveer ",[13,905,906],{},"124 miljoen extra tokens over 5.000 productieve uren"," bij de gemeten interactieve snelheid.",[10,909,910],{},"De resultaten voor codering en lange context tonen dat de winst niet beperkt blijft tot één promptvorm. De latencygegevens maken ook de nuance duidelijk: streaming werd bij alle drie de workloads sneller, terwijl de latency van het eerste token afhankelijk bleef van de workload.",[57,912,914],{"id":913},"optimaliseer-uw-inferentieworkload-met-paiton","Optimaliseer uw inferentieworkload met Paiton",[10,916,917],{},"Dit is een gekwalificeerd resultaat voor de Radeon AI PRO R9700, één model en één servingscope. Paiton's bredere commerciële werk richt zich ook op AMD Instinct CDNA-accelerators voor grotere inferentiedeployments, waar throughput, benutting van de volledige GPU-vloot en kosten per gegenereerde token elkaar op infrastructuurniveau versterken.",[10,919,920],{},"We benchmarken de echte workload, identificeren het runtimeknelpunt, bouwen het gekwalificeerde AMD-pad en meten het geleverde resultaat aan de hand van een overeengekomen baseline.",[10,922,923,924,48],{},"Meer informatie over ",[20,925,86],{"href":926},"\u002Fnl\u002Fproducts\u002Fpaiton",[928,929,930],"style",{},"html pre.shiki code .sScJk, html code.shiki .sScJk{--shiki-default:#6F42C1;--shiki-dark:#B392F0}html pre.shiki code .sZZnC, html code.shiki .sZZnC{--shiki-default:#032F62;--shiki-dark:#9ECBFF}html pre.shiki code .sj4cs, html code.shiki .sj4cs{--shiki-default:#005CC5;--shiki-dark:#79B8FF}html .default .shiki span {color: var(--shiki-default);background: var(--shiki-default-bg);font-style: var(--shiki-default-font-style);font-weight: var(--shiki-default-font-weight);text-decoration: var(--shiki-default-text-decoration);}html .shiki span {color: var(--shiki-default);background: var(--shiki-default-bg);font-style: var(--shiki-default-font-style);font-weight: var(--shiki-default-font-weight);text-decoration: var(--shiki-default-text-decoration);}html .dark .shiki span {color: var(--shiki-dark);background: var(--shiki-dark-bg);font-style: var(--shiki-dark-font-style);font-weight: var(--shiki-dark-font-weight);text-decoration: var(--shiki-dark-text-decoration);}html.dark .shiki span {color: var(--shiki-dark);background: var(--shiki-dark-bg);font-style: var(--shiki-dark-font-style);font-weight: var(--shiki-dark-font-weight);text-decoration: var(--shiki-dark-text-decoration);}",{"title":412,"searchDepth":438,"depth":438,"links":932},[933,934,935,936,937,938,939,940,941,942,943],{"id":59,"depth":438,"text":60},{"id":165,"depth":438,"text":166},{"id":209,"depth":438,"text":210},{"id":359,"depth":438,"text":360},{"id":375,"depth":438,"text":376},{"id":388,"depth":438,"text":389},{"id":401,"depth":438,"text":402},{"id":586,"depth":438,"text":587},{"id":771,"depth":438,"text":772},{"id":891,"depth":438,"text":892},{"id":913,"depth":438,"text":914},[86,945,946,947,948,949,950,951,952,953],"Kunstmatige intelligentie","AMD Radeon","AI-inferentie","GPU-prestaties","Inferentielatentie","Inferentie-optimalisatie","Grote taalmodellen","vLLM","Kostenefficiëntie","2026-09-04T09:00:00","Paiton draait AMD's Qwen3.8 27B op één Radeon AI PRO R9700 met 39,77 outputtokens per seconde. Dat levert 21% meer throughput en 17,4% lagere gemodelleerde kosten op.","md",null,"\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-r9700\u002F00-featured-paiton-r9700.webp",{},true,"https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-qwen38-radeon-ai-pro-r9700","\u002Fblog\u002Fpaiton-qwen38-radeon-ai-pro-r9700",{"title":5,"description":955},"paiton-qwen38-radeon-ai-pro-r9700","blog\u002Fpaiton-qwen38-radeon-ai-pro-r9700","wjJQ5Wpc0-ZT-tdhEuquhKBXa2dhU0aF1yP2sqh1LdM",[968,978,988,1000,1011,1020,1022,1036,1067,1079,1101,1119,1138,1157,1175,1191,1203,1219,1234,1246,1255,1263,1278,1290,1301,1312,1322,1335,1345,1358,1369,1379,1390,1399,1411,1422,1431],{"path":969,"title":970,"description":971,"date":972,"slug":973,"image":974,"originalUrl":975,"categories":976},"\u002Fblog\u002Fpaiton-qwen38-mxfp4-dflash2-r9700","Qwen3.8: 400,7 tok\u002Fs op één R9700 | Paiton","Qwen3.8 op één R9700: 400,7 tok\u002Fs met ROCm 10 en vLLM 0.29, plus publieke 200K\u002F220K-chatprofielen. Benchmarks, beperkingen en startopdrachten.","2026-09-16T07:30:00Z","paiton-qwen38-mxfp4-dflash2-r9700","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-qwen38-mxfp4\u002Fupdate-2026-09-19\u002Fhero.webp","https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-qwen38-mxfp4-dflash2-r9700",[86,946,977,947,950,951,952],"Lokale AI",{"path":979,"title":980,"description":981,"date":982,"slug":983,"image":984,"originalUrl":985,"categories":986},"\u002Fblog\u002Fpaiton-qwen38-neo-gguf-vllm-r9700","Qwen3.8 GGUF in vLLM: sneller antwoord op één Radeon","Draai de originele NEO CODER MAX GGUF met Paiton in vLLM op een R9700. Bekijk de gemeten responstijden, beeldinvoer en lokale installatie.","2026-09-14T07:30:00Z","paiton-qwen38-neo-gguf-vllm-r9700","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-neo-gguf\u002F00-hero-neo-gguf-r9700.webp","https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-qwen38-neo-gguf-vllm-r9700",[86,946,977,987,952],"GGUF",{"path":989,"title":990,"description":991,"date":992,"slug":993,"image":994,"originalUrl":995,"categories":996},"\u002Fblog\u002Fpaiton-minimax-h3-radeon-ai-pro-r9700","MiniMax H3 op Radeon: 15 seconden video met stereogeluid","Paiton genereert lokaal 15 seconden MiniMax H3-video met stereogeluid op één Radeon AI PRO R9700 in 5 min 33 s, met 16,7% minder wachttijd dan stock.","2026-09-09T07:30:00Z","paiton-minimax-h3-radeon-ai-pro-r9700","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-minimax-h3\u002F00-featured-minimax-h3-r9700.webp","https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-minimax-h3-radeon-ai-pro-r9700",[86,946,977,997,998,999],"Videogeneratie","MiniMax H3","ComfyUI",{"path":1001,"title":1002,"description":1003,"date":1004,"slug":1005,"image":1006,"originalUrl":1007,"categories":1008},"\u002Fblog\u002Fpaiton-flux2-klein-radeon-ai-pro-r9700","Lokale FLUX.2 klein op Radeon AI PRO R9700: sneller beelden genereren met minder VRAM","Paiton genereert FLUX.2 klein-beelden van 1024 × 1024 in 1,054 seconden op een R9700, met 16,2% minder generatietijd en 33,4% minder piekallocatie in Torch.","2026-09-07T09:00:00","paiton-flux2-klein-radeon-ai-pro-r9700","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-flux2-klein\u002Ffox-paiton.webp","https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-flux2-klein-radeon-ai-pro-r9700",[86,946,977,1009,1010,999],"Beeldgeneratie","FLUX",{"path":1012,"title":1013,"description":1014,"date":1015,"slug":1016,"image":1017,"originalUrl":1018,"categories":1019},"\u002Fblog\u002Fpaiton-ornith15-radeon-ai-pro-r9700","Ornith 1.5 haalt 44,6 tok\u002Fs op één Radeon AI PRO R9700","Paiton draait Ornith 1.5 35B A3B op één Radeon AI PRO R9700 met 44,63 outputtokens per seconde, 27% sneller en met 21,3% lagere gemodelleerde kosten.","2026-09-05T09:00:00","paiton-ornith15-radeon-ai-pro-r9700","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-ornith15\u002F00-featured-ornith15-r9700.webp","https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-ornith15-radeon-ai-pro-r9700",[86,945,946,947,948,949,950,951,952,953],{"path":962,"title":5,"description":955,"date":954,"slug":964,"image":958,"originalUrl":961,"categories":1021},[86,945,946,947,948,949,950,951,952,953],{"path":1023,"title":1024,"description":1025,"date":1026,"slug":1027,"image":1028,"originalUrl":957,"categories":1029},"\u002Fblog\u002Fai-data-center-power-requirements-gpu-per-megawatt","Stroomvereisten voor AI-datacenters: de GPU-per-MW-illusie","Waarom verschillen GPU-aantallen per megawatt? Lees hoe PUE, piekbelasting, opslag, netwerken en koeling de inzetbare AI-capaciteit bepalen.","2026-07-27T23:52:00","ai-data-center-power-requirements-gpu-per-megawatt","\u002Fasset\u002Fimages\u002Fblog\u002Fai-data-center-power-requirements-gpu-per-megawatt\u002Fgpu-per-megawatt-illusion.webp",[1030,1031,1032,1033,1034,1035],"Alle","AI-infrastructuur","Datacenters","ModFlex","HPC","AMD Helios",{"path":1037,"title":1038,"description":1039,"date":1040,"slug":1041,"image":1042,"originalUrl":1043,"categories":1044},"\u002Fblog\u002Fpaiton-returns-to-its-diffusion-roots-optimizing-wan2-2-t2v-a14b-on-amd-mi355x","Wan2.2-videogeneratie: Paiton op AMD MI355X","Vergelijk Wan2.2-videogeneratie op AMD MI355X met Paiton en NVIDIA B200 via Diffusers. Lees hoe we diffusiemodellen optimaliseren.","2026-06-10T14:04:04","paiton-returns-to-its-diffusion-roots-optimizing-wan2-2-t2v-a14b-on-amd-mi355x","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaitonwan2.webp","https:\u002F\u002Feliovp.com\u002Fpaiton-returns-to-its-diffusion-roots-optimizing-wan2-2-t2v-a14b-on-amd-mi355x\u002F",[1030,945,86,1045,1046,1047,1048,1049,1050,1051,1052,1053,791,1054,1055,1056,1057,1058,1059,1060,86,1061,1062,1063,1064,1065,1066],"14B","AMD","B200","Benchmarks","Blackwell","Compute","Diffusie","Eliovp","Generatieve AI","Hardware","Inferentie","Instinct","MI355x","NVIDIA","On-premises","Optimalisatie","Soevereine AI","T2V","Tekst-naar-video","Tuning","Video-generatie","Wan2.2",{"path":1068,"title":1069,"description":1070,"date":1071,"slug":1072,"image":1073,"originalUrl":1074,"categories":1075},"\u002Fblog\u002Ffrom-the-attic-to-the-front-page-eliovp-recognized-as-a-pioneer-in-chip-optimization-data-center-infrastructure","ElioVP in De Tijd: chipoptimalisatie en datacenters","Lees hoe De Tijd ElioVP belicht, van de oorsprong in chipoptimalisatie tot het werk aan modulaire datacenters en koeling voor hoge vermogensdichtheid.","2026-02-10T20:48:12","from-the-attic-to-the-front-page-eliovp-recognized-as-a-pioneer-in-chip-optimization-data-center-infrastructure","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fphysicalnewspaper.webp","https:\u002F\u002Feliovp.com\u002Ffrom-the-attic-to-the-front-page-eliovp-recognized-as-a-pioneer-in-chip-optimization-data-center-infrastructure\u002F",[1030,945,1076,1077,1046,1078,1076,1058],"Modulaire DC","Niet gecategoriseerd","De Tijd",{"path":1080,"title":1081,"description":1082,"date":1083,"slug":1084,"image":1085,"originalUrl":1086,"categories":1087},"\u002Fblog\u002Fprivacy-is-geen-it-probleem-meer-het-is-een-strategische-prioriteit","AI en privacy: een strategische prioriteit in de Benelux","Privacyrisico's van generatieve AI, vertrouwen, dataopslag en governance. Waarom bedrijven in de Benelux veilige AI strategisch moeten benaderen.","2026-01-29T13:51:11","privacy-is-geen-it-probleem-meer-het-is-een-strategische-prioriteit","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fheaderimage.webp","https:\u002F\u002Feliovp.com\u002Fprivacy-is-geen-it-probleem-meer-het-is-een-strategische-prioriteit\u002F",[1030,945,1088,1077,1089,1090,1091,1092,1093,1094,1095,1096,1052,1097,1053,1098,1099,1100],"Trending","AI Act","Antropomorfisme","AVG","Benelux","ChatGPT","Cyberbeveiliging","Databeheer","Gegevensbeveiliging","GDPR","Microsoft Copilot","Privacy","Shadow AI",{"path":1102,"title":1103,"description":1104,"date":1105,"slug":1106,"image":1107,"originalUrl":1108,"categories":1109},"\u002Fblog\u002Fitsme-bij-ons-is-het-its-not-me-en-dit-is-waarom","Waarom wij itsme niet gebruiken: privacy en soevereiniteit","Waarom ElioVP itsme niet gebruikt: onze afwegingen rond identiteitsmetadata, cloudafhankelijkheid, privacy en datasoevereiniteit.","2025-11-27T09:32:14","itsme-bij-ons-is-het-its-not-me-en-dit-is-waarom","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ffrontimage.webp","https:\u002F\u002Feliovp.com\u002Fitsme-bij-ons-is-het-its-not-me-en-dit-is-waarom\u002F",[1030,1110,1111,1112,1094,1113,1114,1115,1097,1116,1117,1118,1099],"AWS","Belgian Mobile ID","CLOUD Act","Datasoevereiniteit","Digitale identiteit","eIDAS","itsme","Liberty Global","MyGov.be",{"path":1120,"title":1121,"description":1122,"date":1123,"slug":1124,"image":1125,"originalUrl":1126,"categories":1127},"\u002Fblog\u002Ffield-report-the-reality-of-building-agentic-ai-in-2025","Praktijkrapport: de realiteit van Agentic AI bouwen in 2025","Praktijklessen over lokale AI-agents in 2025 gaan in op workflowontwerp, observability, modeltraining, hallucinaties en GPU-geheugenlimieten.","2025-11-25T14:03:39","field-report-the-reality-of-building-agentic-ai-in-2025","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ffieldreport.webp","https:\u002F\u002Feliovp.com\u002Ffield-report-the-reality-of-building-agentic-ai-in-2025\u002F",[1030,945,1128,1088,1129,1130,1131,1132,1133,1134,1135,1136,1061,1137],"Oplossingen","Agentic AI","AI-techniek","AI-strategie","Autonome agenten","Bedrijfs-AI","Lokale LLM","Modelverfijning","AI op locatie","VRAM-optimalisatie",{"path":1139,"title":1140,"description":1141,"date":1142,"slug":1143,"image":1144,"originalUrl":1145,"categories":1146},"\u002Fblog\u002Fthe-synthetic-unicorn-bubble","De synthetische unicornzeepbel","Een analyse van investeringsrisico’s bij AI-neoclouds: circulaire financiering, infrastructuurclaims, contractvoorwaarden en due diligence.","2025-11-24T19:22:28","the-synthetic-unicorn-bubble","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fsyntheticunicorn.webp","https:\u002F\u002Feliovp.com\u002Fthe-synthetic-unicorn-bubble\u002F",[1030,945,1088,1147,1148,1149,1150,1151,1152,1153,1154,1155,1156],"AI Infrastructure","AI Neocloud","Circulaire financiering","GPU Cloud","Beleggingsrisico's","Opstartwaardering","Synthetische bubbel","Technische analyse","Vaporware","Durfkapitaal",{"path":1158,"title":1159,"description":1160,"date":1161,"slug":1162,"image":1163,"originalUrl":1164,"categories":1165},"\u002Fblog\u002Fbuilding-the-engine-for-the-ai-race-the-4-month-path-to-nvidia-gb300-nvl72-power","NVIDIA GB300 NVL72: modulair datacenter in vier maanden","Ontdek een modulair datacenterontwerp voor NVIDIA GB300 NVL72, met redundante voeding, hybride koeling en een bouwplanning van vier maanden.","2025-11-20T14:10:19","building-the-engine-for-the-ai-race-the-4-month-path-to-nvidia-gb300-nvl72-power","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fsuperpodmodflexfrontimage.webp","https:\u002F\u002Feliovp.com\u002Fbuilding-the-engine-for-the-ai-race-the-4-month-path-to-nvidia-gb300-nvl72-power\u002F",[1030,1076,1077,1166,1031,1167,1168,1169,1170,1171,1172,1173,1174],"150 kW-rack","DLC","Hoge dichtheid","Vloeistofkoeling","Modulair datacenter","NVIDIA Blackwell Ultra","NVIDIA GB300","NVL72","Snelle implementatie",{"path":1176,"title":1177,"description":1178,"date":1179,"slug":1180,"image":1181,"originalUrl":1182,"categories":1183},"\u002Fblog\u002Fwhy-cuda-translation-wont-unlock-amds-real-potential","CUDA-vertaling versus AMD-gerichte optimalisatie","Waarom CUDA-compatibiliteit niet hetzelfde is als AMD-prestaties: over ROCm, HIP, kerneloptimalisatie en hardwaregerichte afstemming.","2025-11-12T14:48:37","why-cuda-translation-wont-unlock-amds-real-potential","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fchatgpt-image-nov-11-2025-09_16_10-pm-1.webp","https:\u002F\u002Feliovp.com\u002Fwhy-cuda-translation-wont-unlock-amds-real-potential\u002F",[1030,945,86,1077,1184,945,1185,1186,1187,1188,1189,1190,86,820],"AMD MI300X","CUDA-vertaling","FP8","GPU-optimalisatie","High-performance computing","HIP","Kerneltuning",{"path":1192,"title":1193,"description":1194,"date":1195,"slug":1196,"image":1197,"originalUrl":1198,"categories":1199},"\u002Fblog\u002Fpaiton-the-simplest-way-to-supercharge-ai-inference","Paiton: snellere AI-inferentie in uw bestaande stack","Lees hoe Paiton aansluit op bestaande inferentiestacks, met AMD MI300X-benchmarks en vergelijkingen van prestaties per dollar.","2025-11-11T10:31:22","paiton-the-simplest-way-to-supercharge-ai-inference","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaiton-powaaah.webp","https:\u002F\u002Feliovp.com\u002Fpaiton-the-simplest-way-to-supercharge-ai-inference\u002F",[1030,945,86,947,1200,1184,953,1201,950,1190,86,1202,952],"AMD Instinct","Hoge throughput","SGLang",{"path":1204,"title":1205,"description":1206,"date":1207,"slug":1208,"image":1209,"originalUrl":1210,"categories":1211},"\u002Fblog\u002Fstop-overpaying-paiton-mi300x-moe-beats-h200-b200-on-1m-tokens","Paiton MoE-benchmarks: MI300X versus H200 en B200","Vergelijk Qwen3-30B-A3B MoE-benchmarks van MI300X met Paiton, H200 en B200: throughput en kosten per miljoen tokens.","2025-09-26T13:36:18","stop-overpaying-paiton-mi300x-moe-beats-h200-b200-on-1m-tokens","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fhulkvshulkpaitonwins.webp","https:\u002F\u002Feliovp.com\u002Fstop-overpaying-paiton-mi300x-moe-beats-h200-b200-on-1m-tokens\u002F",[1030,945,86,1212,1184,1213,950,1214,1215,1216,1217,86,1218],"AI-benchmarks","Kosten per token","Mixture of Experts","MoE","NVIDIA B200","NVIDIA H200","Qwen3",{"path":1220,"title":1221,"description":1222,"date":1223,"slug":1224,"image":1225,"originalUrl":1226,"categories":1227},"\u002Fblog\u002Fagentic-ai-but-make-it-local-from-inbox-to-insight-to-action-en","Lokale Agentic AI: van inbox naar actie","Lokale AI-agents zetten e-mails, documenten en beelden om in tickets, rapporten en acties, met modellen op maat van uw gegevens en systemen.","2025-09-16T13:09:00","agentic-ai-but-make-it-local-from-inbox-to-insight-to-action-en","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ffrontfotoblog.webp","https:\u002F\u002Feliovp.com\u002Fagentic-ai-but-make-it-local-from-inbox-to-insight-to-action-en\u002F",[1030,945,1128,1077,1129,1228,1229,1230,1231,1134,1136,1061,1232,1233],"Schadedetectie","Documentverwerking","E-mailautomatisering","Factuurextractie","Ticketautomatisering","Workflowautomatisering",{"path":1235,"title":1236,"description":1237,"date":1238,"slug":1239,"image":1240,"originalUrl":1241,"categories":1242},"\u002Fblog\u002Fmi300x-fp8-data-parallel-benchmarks-8-64-gpus-h200-left-behind-b200-within-reach","MI300X FP8-benchmarks: GPU-partitionering met Paiton","Bekijk hoe Paiton presteert met Llama 3.1 8B FP8 op gepartitioneerde MI300X-GPU's, vergeleken met NVIDIA H200 en B200.","2025-07-31T13:32:57","mi300x-fp8-data-parallel-benchmarks-8-64-gpus-h200-left-behind-b200-within-reach","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fimage-2-1.webp","https:\u002F\u002Feliovp.com\u002Fmi300x-fp8-data%e2%80%91parallel-benchmarks-8-64-gpus-h200-left-behind-b200-within-reach\u002F",[1030,945,86,1077,1243,1046,1047,1244,1245,1057,1058,86,952],"AI","H200","MI300X",{"path":1247,"title":1248,"description":1249,"date":1250,"slug":1251,"image":1252,"originalUrl":1253,"categories":1254},"\u002Fblog\u002Fapplicable-ai-for-businesses","Toepasbare AI voor bedrijven","Ontdek hoe ElioVP lokale AI voor bedrijfsprocessen bouwt, met modeltraining op maat en automatische schadedetectie voor de logistiek.","2025-07-09T21:35:30","applicable-ai-for-businesses","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fscherm_afbeelding-2025-07-09-om-23.30.17.webp","https:\u002F\u002Feliovp.com\u002Fapplicable-ai-for-businesses\u002F",[1030,945,1128,1129,1228,1229,1230,1231,1134,1136,1061,1232,1233],{"path":1256,"title":1257,"description":1258,"date":1259,"slug":1260,"image":412,"originalUrl":1261,"categories":1262},"\u002Fblog\u002Fintroducing-paitons-free-evaluation-models","Maak kennis met de gratis evaluatiemodellen van Paiton","Test Paiton met gratis evaluatiemodellen voor AMD-GPU's. Vergelijk de prestaties voor tekst, beeldanalyse en beeldgeneratie met uw eigen workloads.","2025-07-07T11:26:13","introducing-paitons-free-evaluation-models","https:\u002F\u002Feliovp.com\u002Fintroducing-paitons-free-evaluation-models\u002F",[1030,945,86],{"path":1264,"title":1265,"description":1266,"date":1267,"slug":1268,"image":1269,"originalUrl":1270,"categories":1271},"\u002Fblog\u002Fpaiton-dramatically-faster-startup-and-performance-for-llama-3-1-405b","Llama 3.1 405B: sneller starten met Paiton op MI300X","Bekijk Paiton-benchmarks voor Llama 3.1 405B op acht AMD MI300X-GPU's, met opstarttijd, tensorparallelisme, throughput en latency.","2025-06-12T20:15:23","paiton-dramatically-faster-startup-and-performance-for-llama-3-1-405b","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fservingscreenshot.webp","https:\u002F\u002Feliovp.com\u002Fpaiton-dramatically-faster-startup-and-performance-for-llama-3-1-405b\u002F",[1030,945,86,1077,947,1184,1272,1186,1273,1274,1275,86,1276,1277],"Koude start","Grafiekcompilatie","Llama 3.1 405B","LLM-optimalisatie","Opstartlatentie","Tensor-parallellisme",{"path":1279,"title":1280,"description":1281,"date":1282,"slug":1283,"image":1284,"originalUrl":1285,"categories":1286},"\u002Fblog\u002Fpaiton-fp8-beats-nvidias-h200-on-amds-mi300x","Paiton FP8 verslaat NVIDIA's H200 op AMD's MI300X","Vergelijk Paiton op AMD MI300X met NVIDIA H200 voor Llama 3.1 70B FP8: throughput, wachttijd tot het eerste token en latency bij diverse batchgroottes.","2025-06-08T19:12:40","paiton-fp8-beats-nvidias-h200-on-amds-mi300x","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fblognewfp8.webp","https:\u002F\u002Feliovp.com\u002Fpaiton-fp8-beats-nvidias-h200-on-amds-mi300x\u002F",[1030,945,86,1077,1184,1287,1133,1053,948,949,951,1274,1288,1289],"Koude startoptimalisatie","Model serving","vLLM-optimalisatie",{"path":1291,"title":1292,"description":1293,"date":1294,"slug":1295,"image":1296,"originalUrl":1297,"categories":1298},"\u002Fblog\u002Fmi300x-vs-h200-vs-rx-7900-xtx-vs-tenstorrent-n300s-with-vllm","MI300X, H200, RX 7900 XTX en n300s: vLLM-benchmarks","Vergelijk MI300X, H200, RX 7900 XTX en Tenstorrent n300s met vLLM: throughput, gemodelleerde tokenkosten en hardwarebeperkingen voor Llama 3 8B.","2025-05-09T14:03:58","mi300x-vs-h200-vs-rx-7900-xtx-vs-tenstorrent-n300s-with-vllm","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fcomparisontenstor.webp","https:\u002F\u002Feliovp.com\u002Fmi300x-vs-h200-vs-rx-7900-xtx-vs-tenstorrent-n300s-with-vllm\u002F",[1030,945,86,1128,1077,1046,1245,1058,1299,1300],"RX7900XTX","tenstorrent",{"path":1302,"title":1303,"description":1304,"date":1305,"slug":1306,"image":1307,"originalUrl":1308,"categories":1309},"\u002Fblog\u002Fclusterpl-empowering-gpu-cluster-investors-with-real-world-financial-insights","ClusterP&L: financiële modellen voor GPU-clusters","Ontdek hoe ClusterP&L kosten, rendement en investeringsscenario's voor GPU-clusters modelleert, met risicoanalyses en exporteerbare rapporten.","2025-05-03T10:52:22","clusterpl-empowering-gpu-cluster-investors-with-real-world-financial-insights","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fcomparisonscenarios.webp","https:\u002F\u002Feliovp.com\u002Fclusterpl-empowering-gpu-cluster-investors-with-real-world-financial-insights\u002F",[1030,945,1076,1128,1047,1244,1310,1058,1311],"MI325X","P&L-calculator",{"path":1313,"title":1314,"description":1315,"date":1316,"slug":1317,"image":1318,"originalUrl":1319,"categories":1320},"\u002Fblog\u002Fcranking-out-faster-tokens-for-fewer-dollars-amd-mi300x-vs-nvidia-h200","AMD MI300X versus NVIDIA H200: Qwen3-32B met Paiton","Vergelijk Qwen3-32B-benchmarks op AMD MI300X met Paiton en NVIDIA H200, met resultaten voor throughput, latency en hardwarekosten.","2025-05-02T21:10:30","cranking-out-faster-tokens-for-fewer-dollars-amd-mi300x-vs-nvidia-h200","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002F3ac59a73-2466-4422-b7e5-ef2e4a8ca58e.webp","https:\u002F\u002Feliovp.com\u002Fcranking-out-faster-tokens-for-fewer-dollars-amd-mi300x-vs-nvidia-h200\u002F",[1030,945,86,1243,1046,1244,1321,1058,86,952],"MI300",{"path":1323,"title":1324,"description":1325,"date":1326,"slug":1327,"image":1328,"originalUrl":1329,"categories":1330},"\u002Fblog\u002Fpower-meets-precision-high-density-modular-data-center-for-nvidia-nvl-deployments-1-2-mw","Modulaire datacenters voor NVIDIA NVL: 1 tot 2 MW","Ontdek modulaire datacenterontwerpen voor NVIDIA NVL-systemen, met aandacht voor vermogen, vloeistofkoeling, redundantie en uitrolplanning.","2025-05-02T14:09:59","power-meets-precision-high-density-modular-data-center-for-nvidia-nvl-deployments-1-2-mw","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Feliovp_critical-1mw-pod_rev-2_transparent.webp","https:\u002F\u002Feliovp.com\u002Fpower-meets-precision-high-density-modular-data-center-for-nvidia-nvl-deployments-1-2-mw\u002F",[1030,1076,1331,1147,1168,1034,1169,1170,1332,1333,1173,1334],"1-2MW datacenter","NVIDIA Blackwell","NVIDIA NVL","Precisiekoeling",{"path":1336,"title":1337,"description":1338,"date":1339,"slug":1340,"image":1341,"originalUrl":1342,"categories":1343},"\u002Fblog\u002Fexamining-ai-agents-in-the-medical-field-ai-that-speaks-dicom","AI-agents in de medische wereld: AI die DICOM spreekt","Ontdek een lokale AI-agent die DICOM-gegevens opzoekt en bekijk tests van beeldmodellen met geanonimiseerde medische beelden.","2025-04-11T14:45:48","examining-ai-agents-in-the-medical-field-ai-that-speaks-dicom","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fhealthcareblog-1.webp","https:\u002F\u002Feliovp.com\u002Fexamining-ai-agents-in-the-medical-field-ai-that-speaks-dicom\u002F",[1030,945,1128,1077,1243,1046,1344],"Zorg",{"path":1346,"title":1347,"description":1348,"date":1349,"slug":1350,"image":1351,"originalUrl":1352,"categories":1353},"\u002Fblog\u002Feliovp-bv-your-trusted-partner-for-supply-chain-resilience-amidst-new-u-s-tariffs","Amerikaanse invoerheffingen en AI-leveringszekerheid in 2025","Lees ElioVP's visie uit april 2025 op Amerikaanse invoerheffingen en leveringszekerheid voor AI-servers, HPC-systemen en modulaire datacenters.","2025-04-04T10:01:27","eliovp-bv-your-trusted-partner-for-supply-chain-resilience-amidst-new-u-s-tariffs","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ftariffsshipping.webp","https:\u002F\u002Feliovp.com\u002Feliovp-bv-your-trusted-partner-for-supply-chain-resilience-amidst-new-u-s-tariffs\u002F",[1030,1088,1243,1046,1354,1355,1356,1357],"Invoer","Taiwan","Invoerheffingen","Trump",{"path":1359,"title":1360,"description":1361,"date":1362,"slug":1363,"image":1364,"originalUrl":1365,"categories":1366},"\u002Fblog\u002Fwhy-ai-agents-are-the-future","Waarom AI-agenten de toekomst zijn","Ontdek AI-agents voor ERP, CRM, financiën en klantondersteuning, met praktijkvoorbeelden en een traject van procesanalyse tot pilot en uitrol.","2025-03-23T22:06:59","why-ai-agents-are-the-future","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ferp2.jpeg","https:\u002F\u002Feliovp.com\u002Fwhy-ai-agents-are-the-future\u002F",[1030,945,1128,1243,1367,1368],"AI-agenten","ERP",{"path":1370,"title":1371,"description":1372,"date":1373,"slug":1374,"image":1375,"originalUrl":1376,"categories":1377},"\u002Fblog\u002Fthe-rise-of-open-source-ai-model-optimization","De opkomst van open-source AI-modeloptimalisatie","Verken trends in opensource-AI-optimalisatie: kwantisatie, mixture-of-experts-modellen, hardwaregerichte afstemming, RAG en edge-AI.","2025-03-22T20:59:23","the-rise-of-open-source-ai-model-optimization","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Friseofopensource.jpeg","https:\u002F\u002Feliovp.com\u002Fthe-rise-of-open-source-ai-model-optimization\u002F",[1030,945,1088,1378,1046,791,1058],"AI-nieuws",{"path":1380,"title":1381,"description":1382,"date":1383,"slug":1384,"image":1385,"originalUrl":1386,"categories":1387},"\u002Fblog\u002Fintroducing-our-benchmarking-tool-powered-by-dstack","Maak kennis met onze benchmarktool, gebouwd op dstack","Ontdek onze benchmarktool met dstack: herhaalbare vLLM-tests, automatische parameterreeksen en prestatierapporten voor lokale GPU's en de cloud.","2025-03-20T14:21:59","introducing-our-benchmarking-tool-powered-by-dstack","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fbenchmarktool.jpeg","https:\u002F\u002Feliovp.com\u002Fintroducing-our-benchmarking-tool-powered-by-dstack\u002F",[1030,945,86,1243,1046,1388,1389,1245,86],"benchmark","LLM",{"path":1391,"title":1392,"description":1393,"date":1394,"slug":1395,"image":1396,"originalUrl":1397,"categories":1398},"\u002Fblog\u002Foptimizing-qwq-32b-by-qwen-amd-mi300x-vs-nvidia-h200","QwQ-32B optimaliseren (door Qwen): AMD MI300X versus NVIDIA H200","Vergelijk throughput en latency van QwQ-32B op AMD MI300X met Paiton en NVIDIA H200, bij kleine batches en meer gelijktijdige aanvragen.","2025-03-19T21:41:44","optimizing-qwq-32b-by-qwen-amd-mi300x-vs-nvidia-h200","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaiton4.jpeg","https:\u002F\u002Feliovp.com\u002Foptimizing-qwq-32b-by-qwen-amd-mi300x-vs-nvidia-h200\u002F",[1030,945,86],{"path":1400,"title":1401,"description":1402,"date":1403,"slug":1404,"image":1405,"originalUrl":1406,"categories":1407},"\u002Fblog\u002Feliovp-featured-on-amd-tech-talk-podcast","Eliovp te gast in de AMD Tech Talk-podcast","Beluister Elio Van Puyvelde en Jim Greene in de AMD Tech Talk-podcast over het ontstaan van ElioVP en de hardware- en softwarediensten voor AI.","2025-03-19T07:53:39","eliovp-featured-on-amd-tech-talk-podcast","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ftechtalkjimgreene.jpeg","https:\u002F\u002Feliovp.com\u002Feliovp-featured-on-amd-tech-talk-podcast\u002F",[1030,1046,1408,1409,1410],"Jim Greene","Podcast","Tech Talk",{"path":1412,"title":1413,"description":1414,"date":1415,"slug":1416,"image":1417,"originalUrl":1418,"categories":1419},"\u002Fblog\u002Ffurther-optimizing-amd-powered-inference-with-paiton","AMD-inferentie verder optimaliseren met Paiton","Bekijk Paiton-benchmarks voor DeepSeek R1 Distill Llama 8B op AMD MI300X, gericht op throughput en latency bij kleinere batchgroottes.","2025-03-13T06:18:30","further-optimizing-amd-powered-inference-with-paiton","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaitonpost3.webp","https:\u002F\u002Feliovp.com\u002Ffurther-optimizing-amd-powered-inference-with-paiton\u002F",[1030,945,86,1046,1420,1421,1244,1245,1310,86,952],"DeepSeek","H100",{"path":1423,"title":1424,"description":1425,"date":1426,"slug":1427,"image":1428,"originalUrl":1429,"categories":1430},"\u002Fblog\u002Fa-first-look-at-paiton-in-action-deepseek-r1-distill-llama-3-1-8b","Paiton-benchmarks: DeepSeek R1 Distill Llama 3.1 8B","Vergelijk standaard- en Paiton-versies van DeepSeek R1 Distill Llama 3.1 8B op AMD MI300X, met benchmarks voor throughput en latency.","2025-01-31T09:11:02","a-first-look-at-paiton-in-action-deepseek-r1-distill-llama-3-1-8b","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaitonpost2.webp","https:\u002F\u002Feliovp.com\u002Fa-first-look-at-paiton-in-action-deepseek-r1-distill-llama-3-1-8b\u002F",[1030,945,86,1046,1420,1421,1244,1245,1310,86,952],{"path":1432,"title":1433,"description":1434,"date":1435,"slug":1436,"image":1437,"originalUrl":1438,"categories":1439},"\u002Fblog\u002Fai-model-optimization-with-paiton","AI-modeloptimalisatie met Paiton","Lees hoe Paiton modelcompilatie, aangepaste kernels en kernelfusie inzet om AI-inferentie op AMD GPU's te optimaliseren.","2025-01-30T19:53:25","ai-model-optimization-with-paiton","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaitonpost1.webp","https:\u002F\u002Feliovp.com\u002Fai-model-optimization-with-paiton\u002F",[1030,945,86,1046,1421,1244,1245,1310,86,952],1789853167831]