HARDWARE / IA LOCAL

RTX 5060 · 8 GB de VRAM

A RTX 5060 desktop tem 8 GB de GDDR7 dedicada. A RAM do host é separada; checkpoints maiores podem exigir offload para CPU.

Memória
8 GB · VRAM
Plataforma
CUDA · host PC
Especificações e fontes ↓
Imagem de referência da família NVIDIA GeForce RTX 5060 8 GB
Imagem oficial NVIDIA · design de referência; placas parceiras variam.

Algumas fontes indisponíveis; últimos dados válidos preservados. Consulta do catálogo: 2026-09-30.

Sua configuração

Modelos candidatos

Explore modelos dentro do seu limite de memória, priorizando os que têm score.

Capacidade de planejamento8 GB
Configuração

Ajustes da estimativa

Documentação de instalação do llama.cpp · Requer arquitetura compatível e checkpoint GGUF; escolha o backend de hardware correto. Escolher um runtime não confirma a compatibilidade do modelo. A RAM do sistema não estima picos de carregamento nem transferência para CPU.

O planejamento soma pesos quantizados, 20% de margem de trabalho, o cache informado e uma reserva do sistema. O cache não é calculado pelo número de tokens. Compatibilidade do runtime, picos de carregamento e qualidade local precisam de verificação.

As alterações são aplicadas imediatamente.

A RAM do host é registrada separadamente. Ela não aumenta a VRAM dedicada nesta estimativa; offload para CPU exige software compatível e pode ser mais lento.

Recomendações

Modelos dentro desta estimativa de memória

62 candidatos dentro da estimativa · 247 conferidos · 8 GB

Memória estimada, sem compatibilidade testada. Este LiveBench não cobre estes candidatos; a ordem não é um ranking de inteligência.

Exibindo 6 de 62
Modelos de linguagem · mesmos ajustes de estimativa para todas as linhas
Q4 · GBLimite de contextoSeleção / fonte
Qwen · 4,02B elementos · automáticoEstimativa de memória · Sem resultado no LiveBenchMargem: 0 GB32.768Fonte ↗
meta-llama · 3,21B elementos · automático · acesso condicionadoEstimativa de memória · Sem resultado no LiveBenchMargem: 1 GB128.000Fonte ↗
Qwen · 4,02B elementos · automáticoEstimativa de memória · Sem resultado no LiveBenchMargem: 0 GBFicha do modelo ↗Fonte ↗
Qwen · 4,02B elementos · automáticoEstimativa de memória · Sem resultado no LiveBenchMargem: 0 GBFicha do modelo ↗Fonte ↗
Qwen · 4,02B elementos · automáticoEstimativa de memória · Sem resultado no LiveBenchMargem: 0 GBFicha do modelo ↗Fonte ↗
Qwen · 4,41B elementos · automáticoEstimativa de memória · Sem resultado no LiveBenchMargem: 0 GBFicha do modelo ↗Fonte ↗
Composição da memória

Medições locais

Confira a velocidade local · importe um benchmark

Execute um teste opcional no seu computador e importe o arquivo JSON. Este site não executa inferência nem envia o arquivo. Os resultados ficam nesta aba e não são associados automaticamente às recomendações.

llama-bench -m /path/to/model.gguf -p 512 -n 128 -d 8192 -r 5 -o json > benchmark.json

Substitua o caminho de exemplo por um checkpoint GGUF existente. Requer llama-bench instalado localmente. Tokenização e amostragem não entram na medição de tempo.

Velocidade neste hardware

Ainda não incluímos uma medição verificável desta configuração exata. As estimativas de memória acima não indicam tokens por segundo ou tempo até o primeiro token.

Consultar ensaios da comunidade llama.cpp ↗

Imagem, vídeo e áudio

Requisitos de memória documentados pelos publicadores abaixo desta capacidade. Arquitetura exata da GPU, suporte a ARM64, precisão e runtime ainda precisam de conferência.

Não há caminho documentado correspondente neste recorte revisado. Isso não prova incompatibilidade.

Especificações do hardware

Chip
Blackwell · RTX 5060
Memória física
8 GB GDDR7 · 128-bit
Plataforma de execução
CUDA · host PC

RTX 5060 de desktop com 8 GB GDDR7. Esta não é a RTX 5060 Ti nem a RTX 5060 Laptop. Modelos maiores podem exigir offload para CPU.

Especificações oficiais ↗

A banda é uma especificação teórica do hardware, não uma medição de velocidade do modelo. Compatibilidade de runtime e checkpoint precisa ser conferida separadamente.

Fontes, atualizações e estimativa

Candidatos revisados usam contagens publicadas do modelo. Candidatos automáticos usam contagens de tensores em ponto flutuante de repositórios oficiais no Hugging Face, com a revisão da fonte preservada. Pesos quantizados empacotados, arquiteturas não reconhecidas e metadados multimodais ficam fora da estimativa automática. Nenhum desses critérios comprova que existe um checkpoint quantizado ou que ele roda nesta máquina.

A rotina de descoberta adiciona modelos elegíveis sem criar outra página de hardware. A página consulta o catálogo salvo a cada cinco minutos enquanto está visível. Metadados incompletos continuam no catálogo geral; uma falha de atualização preserva os últimos dados válidos.

Planejamento = pesos estimados + 20% de margem de trabalho + cache informado + reserva heurística (8 GB unificados ou 2 GB por GPU dedicada). As reservas são hipóteses de planejamento, não mínimos do fabricante. Tokens de contexto não calculam automaticamente o cache KV.

Catálogo completo de modelos · Dados e metodologia

Especificação de hardware revisada: 2026-09-26. Fontes de modelos e medições têm datas próprias.