HARDWARE / IA LOCAL

RTX 5060 Ti · 16 GB de VRAM

Use o SKU de 16 GB, não a opção de mesmo nome com 8 GB.

Memória
16 GB · VRAM
Plataforma
CUDA · host PC
Especificações e fontes ↓
Imagem oficial da família RTX 5060 Ti 16 GB
Foto oficial da família.

Algumas fontes indisponíveis; últimos dados válidos preservados. Consulta do catálogo: 2026-09-26.

Sua configuração

Modelos candidatos

Explore modelos dentro do seu limite de memória, priorizando os que têm score.

Capacidade de planejamento16 GB
Configuração

Ajustes da estimativa

Documentação de instalação do llama.cpp · Requer arquitetura compatível e checkpoint GGUF; escolha o backend de hardware correto. Escolher um runtime não confirma a compatibilidade do modelo. A RAM do sistema não estima picos de carregamento nem transferência para CPU.

O planejamento soma pesos quantizados, 20% de margem de trabalho, o cache informado e uma reserva do sistema. O cache não é calculado pelo número de tokens. Compatibilidade do runtime, picos de carregamento e qualidade local precisam de verificação.

As alterações são aplicadas imediatamente.

Recomendações

Modelos dentro desta estimativa de memória

116 candidatos dentro da estimativa · 197 conferidos · 16 GB

Memória estimada, sem compatibilidade testada. Este LiveBench não cobre estes candidatos; a ordem não é um ranking de inteligência.

Modelos de linguagem · mesmos ajustes de estimativa para todas as linhas
Q4 · GBLimite de contextoSeleção / fonte
Alibaba · 9B parâmetros · revisadoMargem: 5 GB262.144
Qwen · 14,77B elementos · automáticoMargem: 0 GB32.768Fonte ↗
meta-llama · 8,03B elementos · automático · acesso condicionadoMargem: 5 GB128.000Fonte ↗
Qwen · 8,19B elementos · automáticoMargem: 5 GB32.768Fonte ↗
Qwen · 4,02B elementos · automáticoMargem: 8 GB32.768Fonte ↗
Composição da memória

Medições locais

Confira a velocidade local · importe um benchmark

Execute um teste opcional no seu computador e importe o arquivo JSON. Este site não executa inferência nem envia o arquivo. Os resultados ficam nesta aba e não são associados automaticamente às recomendações.

llama-bench -m /path/to/model.gguf -p 512 -n 128 -d 8192 -r 5 -o json > benchmark.json

Substitua o caminho de exemplo por um checkpoint GGUF existente. Requer llama-bench instalado localmente. Tokenização e amostragem não entram na medição de tempo.

Medições publicadas

Resultados publicados, não reproduzidos independentemente

Resultados do checkpoint e da configuração indicados. Decode mede tokens gerados por segundo; TTFT mede o tempo até o primeiro token. Ausência de medição não significa desempenho zero.

Medições publicadas de tokens por segundo em decode, com protocolo e fonte
Modelo / checkpointHardwareDecode informadoProtocoloFonte
Llama 2 7B Q4_0TheBloke/Llama-2-7B-GGUF:Q4_0NVIDIA GeForce RTX 5060 Ti · 16 GB GDDR7Q4_0 · CUDA93.46 ± 0.01decode tok/s · Single llama-bench process; server concurrency not measured0 entrada → 128 saídatg128 decode-only run; pp512 is a separate prefill test

Protocolo e ambiente

Llama 2 7B Q4_0 · NVIDIA GeForce RTX 5060 Ti · 16 GB GDDR7

Checkpoint
TheBloke/Llama-2-7B-GGUF · llama-2-7b.Q4_0.gguf
Quantização
Q4_0
Backend
CUDA
Prompt → saída
0 → 128 tokens
Contexto
tg128 decode-only run; pp512 is a separate prefill test
Concorrência
Single llama-bench process; server concurrency not measured
Protocolo
llama.cpp CUDA scoreboard; tg128 decode-only; Flash Attention enabled
Build
llama.cpp commit 89d1029
Data do ensaio
Não informada pela fonte
Fonte consultada
2026-09-26
llama.cpp CUDA scoreboard · community result ↗Consultada 2026-09-26

Processamento do prompt (prefill), geração de tokens (decode), TTFT e throughput agregado sob concorrência são métricas diferentes. Ausência de resultado significa ‘não medido aqui’, não desempenho zero. As datas indicam a última consulta da fonte.

Imagem, vídeo e áudio

Requisitos de memória documentados pelos publicadores abaixo desta capacidade. Arquitetura exata da GPU, suporte a ARM64, precisão e runtime ainda precisam de conferência.

Especificações do hardware

Chip
Blackwell · RTX 5060 Ti
Memória física
16 GB GDDR7
Plataforma de execução
CUDA · host PC

A RTX 5060 Ti Blackwell tem variantes de 16 GB e 8 GB GDDR7. Esta ficha representa somente a placa de 16 GB; confira o SKU e o runtime antes de escolher um checkpoint.

Especificações oficiais ↗

A banda é uma especificação teórica do hardware, não uma medição de velocidade do modelo. Compatibilidade de runtime e checkpoint precisa ser conferida separadamente.

Fontes, atualizações e estimativa

Candidatos revisados usam contagens publicadas do modelo. Candidatos automáticos usam contagens de tensores em ponto flutuante de repositórios oficiais no Hugging Face, com a revisão da fonte preservada. Pesos quantizados empacotados, arquiteturas não reconhecidas e metadados multimodais ficam fora da estimativa automática. Nenhum desses critérios comprova que existe um checkpoint quantizado ou que ele roda nesta máquina.

A rotina de descoberta adiciona modelos elegíveis sem criar outra página de hardware. A página consulta o catálogo salvo a cada cinco minutos enquanto está visível. Metadados incompletos continuam no catálogo geral; uma falha de atualização preserva os últimos dados válidos.

Planejamento = pesos estimados + 20% de margem de trabalho + cache informado + reserva heurística (8 GB unificados ou 2 GB por GPU dedicada). As reservas são hipóteses de planejamento, não mínimos do fabricante. Tokens de contexto não calculam automaticamente o cache KV.

Catálogo completo de modelos · Dados e metodologia

Especificação de hardware revisada: 2026-09-26. Fontes de modelos e medições têm datas próprias.