HARDWARE / IA LOCAL

RTX 4060 Ti · 16 GB de VRAM

Use a versão de 16 GB, não a placa de 8 GB. O computador e a RAM do sistema são requisitos adicionais.

Memória
16 GB · VRAM
Plataforma
CUDA · host PC
Banda de memória
288 GB/s
Especificações e fontes ↓
Imagem oficial da família RTX 4060 Ti 16GB
Foto oficial da família.

Algumas fontes indisponíveis; últimos dados válidos preservados. Consulta do catálogo: 2026-09-26.

Sua configuração

Modelos candidatos

Explore modelos dentro do seu limite de memória, priorizando os que têm score.

Capacidade de planejamento16 GB
Configuração

Ajustes da estimativa

Documentação de instalação do llama.cpp · Requer arquitetura compatível e checkpoint GGUF; escolha o backend de hardware correto. Escolher um runtime não confirma a compatibilidade do modelo. A RAM do sistema não estima picos de carregamento nem transferência para CPU.

O planejamento soma pesos quantizados, 20% de margem de trabalho, o cache informado e uma reserva do sistema. O cache não é calculado pelo número de tokens. Compatibilidade do runtime, picos de carregamento e qualidade local precisam de verificação.

As alterações são aplicadas imediatamente.

Recomendações

Modelos dentro desta estimativa de memória

116 candidatos dentro da estimativa · 197 conferidos · 16 GB

Memória estimada, sem compatibilidade testada. Este LiveBench não cobre estes candidatos; a ordem não é um ranking de inteligência.

Modelos de linguagem · mesmos ajustes de estimativa para todas as linhas
Q4 · GBLimite de contextoSeleção / fonte
Alibaba · 9B parâmetros · revisadoMargem: 5 GB262.144
Qwen · 14,77B elementos · automáticoMargem: 0 GB32.768Fonte ↗
meta-llama · 8,03B elementos · automático · acesso condicionadoMargem: 5 GB128.000Fonte ↗
Qwen · 8,19B elementos · automáticoMargem: 5 GB32.768Fonte ↗
Qwen · 4,02B elementos · automáticoMargem: 8 GB32.768Fonte ↗
Composição da memória

Medições locais

Confira a velocidade local · importe um benchmark

Execute um teste opcional no seu computador e importe o arquivo JSON. Este site não executa inferência nem envia o arquivo. Os resultados ficam nesta aba e não são associados automaticamente às recomendações.

llama-bench -m /path/to/model.gguf -p 512 -n 128 -d 8192 -r 5 -o json > benchmark.json

Substitua o caminho de exemplo por um checkpoint GGUF existente. Requer llama-bench instalado localmente. Tokenização e amostragem não entram na medição de tempo.

Velocidade neste hardware

Ainda não incluímos uma medição verificável desta configuração exata. As estimativas de memória acima não indicam tokens por segundo ou tempo até o primeiro token.

Consultar ensaios da comunidade llama.cpp ↗

Imagem, vídeo e áudio

Requisitos de memória documentados pelos publicadores abaixo desta capacidade. Arquitetura exata da GPU, suporte a ARM64, precisão e runtime ainda precisam de conferência.

Especificações do hardware

Chip
Ada Lovelace · RTX 4060 Ti
Memória física
16 GB GDDR6 · 128-bit
Plataforma de execução
CUDA · host PC
Banda de memória
288 GB/s · fabricante ↗

A NVIDIA lista uma configuração da RTX 4060 Ti com 16 GB de memória GDDR6 dedicada. Confira abaixo os checkpoints candidatos e suas contagens de parâmetros; reserve espaço adicional para contexto maior, componentes de mídia e sobrecarga do runtime.

Especificações oficiais ↗

A banda é uma especificação teórica do hardware, não uma medição de velocidade do modelo. Compatibilidade de runtime e checkpoint precisa ser conferida separadamente.

Fontes, atualizações e estimativa

Candidatos revisados usam contagens publicadas do modelo. Candidatos automáticos usam contagens de tensores em ponto flutuante de repositórios oficiais no Hugging Face, com a revisão da fonte preservada. Pesos quantizados empacotados, arquiteturas não reconhecidas e metadados multimodais ficam fora da estimativa automática. Nenhum desses critérios comprova que existe um checkpoint quantizado ou que ele roda nesta máquina.

A rotina de descoberta adiciona modelos elegíveis sem criar outra página de hardware. A página consulta o catálogo salvo a cada cinco minutos enquanto está visível. Metadados incompletos continuam no catálogo geral; uma falha de atualização preserva os últimos dados válidos.

Planejamento = pesos estimados + 20% de margem de trabalho + cache informado + reserva heurística (8 GB unificados ou 2 GB por GPU dedicada). As reservas são hipóteses de planejamento, não mínimos do fabricante. Tokens de contexto não calculam automaticamente o cache KV.

Catálogo completo de modelos · Dados e metodologia

Especificação de hardware revisada: 2026-09-26. Fontes de modelos e medições têm datas próprias.