LLM Routing
Same API call. Same response format. Same streaming interface. Change the model field to route to any of 10 providers — Claude, GPT, Gemini, Llama, DeepSeek, and more. Always 10% below OpenRouter prices.
Neureus routes by model ID prefix — no configuration needed.
claude-sonnet-4-6gpt-4ometa/llama-3.3-70bgemini-2.5-flashdeepseek-r1claude-* → Anthropicgpt-*/o1/o3/o4 → OpenAImeta/* / qwen/* / deepseek/* → Built-in (free)gemini-* → Googleauto → task-classified routingconst models = {
free: 'meta/llama-3.3-70b', // $0 — built-in
balanced: 'claude-sonnet-4-6', // $2.70/1M tokens
reasoning: 'deepseek-r1', // $0.135/1M tokens
premium: 'gpt-4o', // $4.50/1M tokens
};
const response = await fetch('https://app.neureus.ai/ai/chat', {
method: 'POST',
headers: { 'Authorization': `Bearer ${'{API_KEY}'}` },
body: JSON.stringify({
model: models.balanced, // ← change this
messages: [{ role: 'user', content: prompt }],
stream: false,
}),
});
const { text, inputTokens, outputTokens, costUsd } = await response.json();const stream = await fetch('https://app.neureus.ai/ai/chat', {
method: 'POST',
headers: { 'Authorization': `Bearer ${'{API_KEY}'}` },
body: JSON.stringify({
model: 'claude-sonnet-4-6', // or any model
messages: [{ role: 'user', content: prompt }],
stream: true,
}),
});
const reader = stream.body.getReader();
const decoder = new TextDecoder();
while (true) {
const { done, value } = await reader.read();
if (done) break;
process.stdout.write(decoder.decode(value));
}await fetch('https://app.neureus.ai/ai/providers/openai', {
method: 'PUT',
headers: { 'Authorization': `Bearer ${'{API_KEY}'}` },
body: JSON.stringify({ apiKey: 'sk-your-key' }),
});
const providers = await fetch('https://app.neureus.ai/ai/providers', {
headers: { 'Authorization': `Bearer ${'{API_KEY}'}` },
}).then(r => r.json());
// → [{ provider: 'openai', hasKey: true, rotatedAt: '...' }]import { NeureuClient } from '@neureus/sdk';
const client = new NeureuClient({ apiKey: process.env.NEUREUS_API_KEY });
const result = await client.ai.chat({
model: 'deepseek-r1',
messages: [{ role: 'user', content: 'Solve: 2x + 5 = 13' }],
});
console.log(result.text, result.costUsd);
const stream = client.ai.stream({
model: 'claude-haiku-4-5',
messages: [{ role: 'user', content: 'Write a haiku' }],
});
for await (const chunk of stream) process.stdout.write(chunk);All token prices are 10% below OpenRouter list. Built-in models are always free.
prefix: meta/meta/llama-3.3-70bdeepseek/r1-32bqwen/coder-32bprefix: claude-claude-opus-4-8claude-sonnet-4-6claude-haiku-4-5prefix: gpt-/o*gpt-4ogpt-4o-minio3o4-miniprefix: gemini-gemini-3.5-flashgemini-3-flash-previewprefix: deepseek-deepseek-r1deepseek-v34 passes run before every /ai/chat request. Cuts token count 10–30% — your provider bills for fewer tokens on every call.
Trim whitespace, normalize CRLF→LF, collapse repeated blank lines, remove zero-width characters.
Move system messages to index 0 — providers require system messages first. Fixes ordering issues silently.
When token estimate exceeds 6K: keep system message + last 4 non-system turns. Replace middle with a compact summary message.
LLM compression via Workers AI Llama 3.2 3B. Send x-neureus-options: compress=true to activate.
x-neureus-debug: true header to see preprocessing stats in the response body.500 Neurons/month free. No credit card. OpenAI-compatible response format from every provider.