HARDWARE / IA LOCAL

RTX 5070 Ti · 16 GB de VRAM

Esta ficha representa a RTX 5070 Ti desktop de 16 GB. A RAM do sistema é separada; especificações de placas parceiras podem variar.

Memória
16 GB · VRAM
Plataforma
CUDA · host PC
Banda de memória
896 GB/s
Especificações e fontes ↓
Imagem de referência da família NVIDIA GeForce RTX 5070 Ti 16 GB
Imagem oficial NVIDIA · design de referência; placas parceiras variam.

Algumas fontes indisponíveis; últimos dados válidos preservados. Consulta do catálogo: 2026-09-30.

Sua configuração

Modelos candidatos

Explore modelos dentro do seu limite de memória, priorizando os que têm score.

Capacidade de planejamento16 GB
Configuração

Ajustes da estimativa

Documentação de instalação do llama.cpp · Requer arquitetura compatível e checkpoint GGUF; escolha o backend de hardware correto. Escolher um runtime não confirma a compatibilidade do modelo. A RAM do sistema não estima picos de carregamento nem transferência para CPU.

O planejamento soma pesos quantizados, 20% de margem de trabalho, o cache informado e uma reserva do sistema. O cache não é calculado pelo número de tokens. Compatibilidade do runtime, picos de carregamento e qualidade local precisam de verificação.

As alterações são aplicadas imediatamente.

A RAM do host é registrada separadamente. Ela não aumenta a VRAM dedicada nesta estimativa; offload para CPU exige software compatível e pode ser mais lento.

Recomendações

Modelos dentro desta estimativa de memória

156 candidatos dentro da estimativa · 247 conferidos · 16 GB

Memória estimada, sem compatibilidade testada. Este LiveBench não cobre estes candidatos; a ordem não é um ranking de inteligência.

Exibindo 6 de 156
Modelos de linguagem · mesmos ajustes de estimativa para todas as linhas
Q4 · GBLimite de contextoSeleção / fonte
Alibaba · 9B parâmetros · revisadoEstimativa de memória · Sem resultado no LiveBenchMargem: 5 GB262.144
Qwen · 14,77B elementos · automáticoEstimativa de memória · Sem resultado no LiveBenchMargem: 0 GB32.768Fonte ↗
meta-llama · 8,03B elementos · automático · acesso condicionadoEstimativa de memória · Sem resultado no LiveBenchMargem: 5 GB128.000Fonte ↗
Qwen · 8,19B elementos · automáticoEstimativa de memória · Sem resultado no LiveBenchMargem: 5 GB32.768Fonte ↗
Qwen · 4,02B elementos · automáticoEstimativa de memória · Sem resultado no LiveBenchMargem: 8 GB32.768Fonte ↗
meta-llama · 3,21B elementos · automático · acesso condicionadoEstimativa de memória · Sem resultado no LiveBenchMargem: 9 GB128.000Fonte ↗
Composição da memória

Medições locais

Confira a velocidade local · importe um benchmark

Execute um teste opcional no seu computador e importe o arquivo JSON. Este site não executa inferência nem envia o arquivo. Os resultados ficam nesta aba e não são associados automaticamente às recomendações.

llama-bench -m /path/to/model.gguf -p 512 -n 128 -d 8192 -r 5 -o json > benchmark.json

Substitua o caminho de exemplo por um checkpoint GGUF existente. Requer llama-bench instalado localmente. Tokenização e amostragem não entram na medição de tempo.

Velocidade neste hardware

Ainda não incluímos uma medição verificável desta configuração exata. As estimativas de memória acima não indicam tokens por segundo ou tempo até o primeiro token.

Consultar ensaios da comunidade llama.cpp ↗

Imagem, vídeo e áudio

Requisitos de memória documentados pelos publicadores abaixo desta capacidade. Arquitetura exata da GPU, suporte a ARM64, precisão e runtime ainda precisam de conferência.

Especificações do hardware

Chip
Blackwell · RTX 5070 Ti
Memória física
16 GB GDDR7 · 256-bit
Plataforma de execução
CUDA · host PC
Banda de memória
896 GB/s · fabricante ↗

RTX 5070 Ti de desktop com 16 GB GDDR7. A capacidade sozinha não determina velocidade local; confira runtime e formato do checkpoint.

Especificações oficiais ↗

A banda é uma especificação teórica do hardware, não uma medição de velocidade do modelo. Compatibilidade de runtime e checkpoint precisa ser conferida separadamente.

Fontes, atualizações e estimativa

Candidatos revisados usam contagens publicadas do modelo. Candidatos automáticos usam contagens de tensores em ponto flutuante de repositórios oficiais no Hugging Face, com a revisão da fonte preservada. Pesos quantizados empacotados, arquiteturas não reconhecidas e metadados multimodais ficam fora da estimativa automática. Nenhum desses critérios comprova que existe um checkpoint quantizado ou que ele roda nesta máquina.

A rotina de descoberta adiciona modelos elegíveis sem criar outra página de hardware. A página consulta o catálogo salvo a cada cinco minutos enquanto está visível. Metadados incompletos continuam no catálogo geral; uma falha de atualização preserva os últimos dados válidos.

Planejamento = pesos estimados + 20% de margem de trabalho + cache informado + reserva heurística (8 GB unificados ou 2 GB por GPU dedicada). As reservas são hipóteses de planejamento, não mínimos do fabricante. Tokens de contexto não calculam automaticamente o cache KV.

Catálogo completo de modelos · Dados e metodologia

Especificação de hardware revisada: 2026-09-26. Fontes de modelos e medições têm datas próprias.