Início rápido para usuários da Ollama
Comece com a API Ollama sem censura em minutos. Use nossa URL base e chave para enviar requisições com seu código SDK OpenAI existente.
Pré-requisitos
Para usar esta API, você precisa de uma conta ativa com uma chave de API válida. Entre na página Obter chave de API usando Google ou e-mail e senha. Não é necessário número de telefone. Você também precisa de um SDK de linguagem suportado instalado. Este guia cobre Python e Node.js, os clientes mais comuns para endpoints compatíveis com OpenAI. A API serve um único modelo sem censura identificado por uncensored. Aceita texto e retorna texto. Não há embeddings, imagens ou áudio. Todas as requisições vão para https://api.ollamaapi.cc/v1.
Instalar SDK
Instale o SDK oficial para sua linguagem preferida. Para Python, use pip. Para Node.js, use npm. Essas bibliotecas lidam com protocolo HTTP, serialização JSON e streaming automaticamente. Você não precisa escrever requisições HTTP brutas, a menos que prefira esse nível de controle. Os SDKs são bem documentados e amplamente usados em produção. Certifique-se de que seu ambiente atenda aos requisitos do SDK. Python 3.8+ e Node.js 18+ são recomendados. Mantenha suas dependências atualizadas para evitar problemas de compatibilidade com novos parâmetros do modelo.
Configurar Cliente
Defina a URL base para nosso endpoint. Esta é a única alteração de configuração necessária para alternar da OpenAI para nosso serviço sem censura. Passe sua chave de API como cabeçalho de autorização. O SDK cuidará do resto. Não altere o nome do modelo para gpt-4 ou similar; use uncensored. A API segue estritamente o protocolo de chat-completions da OpenAI. Qualquer cliente que funcione com OpenAI funcionará aqui com essas duas alterações. Isso torna a migração ou testes A/B simples. Você pode executar ambas as APIs lado a lado para comparar saídas.
Enviar Primeira Requisição
Faça uma requisição POST para /v1/chat/completions. Inclua o ID do modelo, prompt do sistema e mensagem do usuário. A API retorna uma resposta de texto. Se você tiver crédito, a requisição é bem-sucedida. Se faltar crédito, você recebe um erro 402. Se sua chave for inválida, você recebe 401. Esses erros são padrão e fáceis de tratar no código. O modelo não recusa conteúdo adulto lícito, sendo útil para escrita criativa, pesquisa de segurança ou chat sem censura. Verifique seu saldo no painel se tiver dúvidas sobre créditos restantes.
Respostas em Streaming
Ative o streaming definindo stream: true. A API retorna tokens conforme são gerados. Isso reduz a latência percebida para os usuários. O fragmento final contém o uso total de tokens para faturamento. Streaming é suportado por todos os SDKs oficiais. É essencial para interfaces de chat onde você deseja mostrar o texto conforme é escrito. O servidor envia Server-Sent Events (SSE). Sua biblioteca cliente trata a análise. Você não precisa gerenciar o fluxo de eventos manualmente, a menos que esteja construindo um cliente personalizado.
Limites, Erros e Contexto
A janela de contexto tem 100.000 tokens no total, com saída máxima de 32.000 tokens. As requisições são limitadas a 300 por minuto e 8 requisições simultâneas por chave. O corpo da requisição deve ter menos de 8 MB. Os erros incluem 401 para chaves inválidas, 402 para crédito insuficiente e 429 para limites de taxa. Estes são códigos HTTP padrão. Trate-os elegantemente em sua aplicação. O modelo bloqueia conteúdo sexual envolvendo menores. Todo o outro conteúdo é permitido. O crédito nunca expira, então você pode pausar o uso sem perder fundos. Use a página de suporte para questões de reembolso.
cURL
curl https://api.ollamaapi.cc/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'Python
from openai import OpenAI
client = OpenAI(base_url="https://api.ollamaapi.cc/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)Node.js
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.ollamaapi.cc/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);Streaming
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)Comece com o crédito de teste
E-mail e senha; a chave aparece na hora na tela.
Perguntas e respostas
Esta é a API oficial da Ollama?
Não. Somos um serviço independente que hospeda um único modelo sem censura. Não temos afiliação com a Ollama, OpenAI ou qualquer outro fornecedor. Usamos o protocolo compatível com OpenAI para facilitar o uso.
Quais métodos de pagamento são aceitos?
Aceitamos apenas criptomoedas: USDT (TRC20) ou USDC (Base). O valor mínimo de recarregar é $10. Não são aceitos cartões de crédito, PayPal ou transferências bancárias. O crédito nunca expira.
Posso usar isso para projetos comerciais?
Sim. Não há restrições de uso além dos limites de requisições. O modelo não recusa conteúdo lícito, sendo adequado para aplicações comerciais. Consulte a página de preços para as taxas atuais de token.
Sua chave está a um formulário de distância
Crie uma conta, copie a chave, altere a URL base. Essa é toda a configuração.
Ficha técnica da API
Todos os limites e recursos reais da API em um só lugar — confira antes de recarregar.
| Item | Valor |
|---|---|
| Formato | compatível com OpenAI: qualquer SDK da OpenAI funciona trocando a base URL e a chave |
| Autenticação | Authorization: Bearer YOUR_KEY |
| ID do modelo | uncensored |
| Endpoints | POST /v1/chat/completions · GET /v1/models |
| Base URL | https://api.ollamaapi.cc/v1 |
| Parâmetros | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Janela de contexto | 100.000 tokens (entrada + saída) |
| Chamada de funções | sim — tools, tool_choice; resposta com tool_calls, inclusive em streaming; resultados como role: tool |
| Saída máxima | até o restante da janela de 100.000 tokens; max_tokens opcional (sem limite separado) |
| Streaming | sim — server-sent events; o último bloco traz o uso de tokens |
| Modo JSON | response_format: {"type": "json_object"} |
| Concorrência | 8 requisições ao mesmo tempo por chave |
| Limite de taxa | 300 requisições por minuto por chave |
| Cabeçalhos | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Tamanho | até 8 MB por requisição |
| Cobrança | crédito pré-pago pelo uso real; erros e recusas são grátis |
| Bônus | +5% a partir de $50, +10% a partir de $100 |
| Preço | $0,25 por 1M tokens de entrada · $1,00 por 1M de saída |
| Teste grátis | $0,50 por 7 dias, sem cartão · Chave de teste: 2 requisições paralelas, 60 por minuto; limites totais (8 e 300) após a primeira recarga |
| Validade | crédito pago não expira, sem assinatura |
| Recarga | USDT (TRC20) ou USDC (Base), qualquer valor inteiro de $10 a $500 |
| Chaves | uma chave ativa por conta; uma nova substitui a anterior |
| Conteúdo | conteúdo adulto permitido; conteúdo sexual com menores é recusado |
| Login | Google ou e-mail e senha |
Códigos de erro
Erros chegam em JSON com um type fixo; requisições com falha ou recusadas não são cobradas.
| Código | Tipo | Significado |
|---|---|---|
400 | bad_request | JSON inválido, mensagens vazias, parâmetro errado ou contexto longo demais |
401 | missing_key · invalid_key · key_revoked | chave ausente, errada ou substituída |
402 | no_credit | sem crédito — recarregue e continue na hora |
403 | content_blocked | conteúdo sexual com menores — recusado, sem cobrança |
404 | not_found | endpoint desconhecido |
413 | request_too_large | corpo acima de 8 MB |
429 | rate_limited · concurrency | acima de 300/min ou 8 em paralelo — aguarde e tente de novo |
503 | upstream_busy | modelo ocupado — tente em alguns segundos |