MacBook Pro M5 Max: Výkon 32 lokálních AI modelů 

ByLudvík Eckerman

4 září, 2026 , ,
MacBook Pro AI modely testZdroj: Ludík Eckerman
  • Vzali jsme nejvýkonnější MacBook a vyzkoušeli jsme v testu, jaký výkon podává v lokálních AI modelech
  • Původně jsme chtěli vyzkoušet jen 3, nakonec jsme jich otestovali 32

MacBook Pro M5 Max je AI workstation

Výkon, kterého se Applu daří dosahovat v AI, je dechberoucí. Efektivitou poráží většinu konkurence a může si dovolit nacpat velmi výkonné čipy i do laptopů. My jsme na test měli k dispozici v podstatě přenosnou AI stanici, jestli se to tak dá nazvat. Konfigurace je ta vůbec nejsilnější, jakou si lze zvolit, navíc s druhým největším úložištěm:

  • Čip M5 Max (18 jader CPU a 40 jader GPU)
  • 128 GB RAM
  • 4 TB SSD
  • Úhlopříčka displeje je 16 palců

Srovnání 32 lokálních AI modelů na MacBooku Pro M5 Max

Níže jsou naměřené výsledky. Srovnali jsme je od nejvýkonnějšího modelu po ten nejméně výkonný. Samotné měření ukázalo, že počet parametrů není pro rychlost lokálního jazykového modelu zdaleka rozhodující. Je dobré také vnímat rozdíl mezi rychlostí a kvalitou. Modely jsme nechali generovat text na zadané téma, kvalitu výstupů však pro potřeby tohoto srovnání zcela pomíjíme. Šlo nám čistě o surový výkon.

ModelPrůměrný výkon
qwen3.5:35b-mlx124,13 tok/s
qwen3:4b121,39 tok/s
qwen3:30b112,63 tok/s
gpt-oss:20b100,94 tok/s
gemma4:e4b93,12 tok/s
qwen2.5:7b81,36 tok/s
qwen3-coder-next:latest75,91 tok/s
gpt-oss:120b73,15 tok/s
qwen3-next:80b73,14 tok/s
gemma4:26b68,07 tok/s
qwen3.5:9b68,06 tok/s
gemma4:26b-mlx-bf1658,76 tok/s
gemma3:12b47,00 tok/s
qwen3.5:122b-a10b46,91 tok/s
gemma4:12b46,62 tok/s
qwen3.8-flash-next:125b-mlx45,26 tok/s
ministral-3:14b44,61 tok/s
qwen3.8:27b-mlx37,90 tok/s
phi4-reasoning:plus36,83 tok/s
llama4:scout34,12 tok/s
gemma4:12b-mlx-bf1627,70 tok/s
mistral-small3.2:24b26,42 tok/s
qwen3.5:27b21,98 tok/s
gemma3:27b21,32 tok/s
gemma4:31b18,72 tok/s
qwen3:32b18,52 tok/s
qwen3.8:27b-mlx-bf1618,06 tok/s
gemma4:31b-mlx-bf1612,94 tok/s
llama3.3:70b8,93 tok/s
deepseek-r1:70b8,82 tok/s
command-a:111b5,58 tok/s
mistral-large:123b5,20 tok/s

Na stejném hardwaru se průměrná rychlost pohybovala od přibližně 5 do více než 124 tokenů za sekundu, tedy v rozpětí téměř 24násobku. Významnou roli hraje architektura modelu, počet parametrů skutečně využívaných při generování, kvantizace i optimalizace pro daný hardware. Překvapivě malý byl rozdíl mezi jednotlivými běhy, který se u většiny modelů vešel do jednotek procent a u žádného z nich výrazně nevybočoval.

Jak jsme testovali

Test proběhl přes Ollamu. To je nástroj pro lokální provoz jazykových modelů. Nejde tedy o samotný AI model, ale o prostředí, které model stáhne, načte do paměti a zajistí jeho běh na konkrétním počítači. V našem případě přes Ollamu běžely všechny testované modely přímo na MacBooku Pro a Ollama nám zároveň poskytovala údaje o době výpočtu, počtu zpracovaných tokenů a rychlosti generování.

Modely, které jsme testovali

  • Qwen: qwen3.5:35b-mlx, qwen3:4b, qwen3:30b, qwen2.5:7b, qwen3-coder-next, qwen3-next:80b, qwen3.5:9b, qwen3.5:122b-a10b, qwen3.8-flash-next:125b-mlx, qwen3.8:27b-mlx, qwen3.5:27b, qwen3:32b, qwen3.8:27b-mlx-bf16
  • Gemma: gemma4:e4b, gemma4:26b, gemma4:26b-mlx-bf16, gemma3:12b, gemma4:12b, gemma4:12b-mlx-bf16, gemma3:27b, gemma4:31b, gemma4:31b-mlx-bf16
  • GPT-OSS: gpt-oss:20b, gpt-oss:120b
  • Meta/Llama: llama4:scout, llama3.3:70b
  • Mistral: ministral-3:14b, mistral-small3.2:24b, mistral-large:123b
  • Microsoft: phi4-reasoning:plus
  • DeepSeek: deepseek-r1:70b
  • Cohere: command-a:111b

Test samotný probíhal na čerstvém MacBooku s nainstalovanou Ollamou a staženými modely. Abychom si ušetřili práci, spustili jsme skript v Pythonu, který jednotlivé modely spouštěl a výsledky zapisoval do tabulky. Pro všechny modely jsme použili stejné zadání a maximální délku výstupu 2 000 tokenů. Teplota generování byla nastavena na 0, aby se omezila náhodnost mezi jednotlivými běhy, a velikost kontextového okna byla při hlavním rychlostním testu nastavena na 8 192 tokenů. Hlavní sledovanou veličinou byla rychlost generování udávaná v tokenech za sekundu (tok/s).

Každý model prošel celkem jedenácti měřeními. První běh jsme do výsledku nezapočítávali, protože se jeho chování může lišit od následující dlouhodobější zátěže. Výsledná hodnota v tabulce proto představuje průměrnou rychlost z běhů 2 až 11, tedy z deseti samostatných měření.

Do výsledného srovnání jsme zařadili pouze modely, které při všech deseti započítaných měřeních skutečně vygenerovaly celých 2 000 tokenů (původně jich totiž mělo být 40). Pokud model některý z výstupů ukončil předčasně, ze srovnávací tabulky jsme jej vyřadili. Tím jsme zabránili tomu, aby byl krátký výstup neprávem zvýhodněn proti modelům, které absolvovaly celý test.

Před měřením byl každý model načten do paměti a následně proběhlo samotné testování. Mezi jednotlivými modely jsme nechávali krátkou prodlevu a pořadí modelů bylo promícháno, aby výsledky co nejméně ovlivňovalo například postupné zahřívání počítače.

Naměřený počet tokenů za sekundu vyjadřuje pouze rychlost inference, tedy rychlost vytváření odpovědi. Nejde o hodnocení inteligence, přesnosti nebo celkové kvality daného modelu. Vyšší hodnota proto znamená rychlejší generování textu, nikoliv automaticky lepší jazykový model.

Ještě krátká poznámka k okolnostem testu. Probíhal samozřejmě s adaptérem zapojeným do zásuvky, na baterii by MacBook těch několik hodin práce samozřejmě nedal. Abych se přes noc vyspal (test začínal večer), umístil jsem laptop na chodbu, protože prakticky celou dobu běžel ventilátor téměř naplno. Mezi testy byla 30sekundová pauza na krátké ochlazení. MacBooku to pomohlo, na 140W adaptéru se však nedala udržet ruka.

Zdroj: autorský text, llmcheck
Obrázky: screenshot, vygenerováno Midjourney

Napsat komentář

Vaše e-mailová adresa nebude zveřejněna. Vyžadované informace jsou označeny *