LLM Routing

Switch Providers by
Changing a String

Same API call. Same response format. Same streaming interface. Change the model field to route to any of 10 providers — Claude, GPT, Gemini, Llama, DeepSeek, and more. Always 10% below OpenRouter prices.

How routing works

Neureus routes by model ID prefix — no configuration needed.

Model ID
claude-sonnet-4-6gpt-4ometa/llama-3.3-70bgemini-2.5-flashdeepseek-r1
→
Neureus router
claude-* → Anthropic
gpt-*/o1/o3/o4 → OpenAI
meta/* / qwen/* / deepseek/* → Built-in (free)
gemini-* → Google
auto → task-classified routing
→
Response
OpenAI-compatible format
SSE streaming (all providers)
Consistent error handling
Switch providers — change one field
const models = {
  free:      'meta/llama-3.3-70b',  // $0 — built-in
  balanced:  'claude-sonnet-4-6',   // $2.70/1M tokens
  reasoning: 'deepseek-r1',         // $0.135/1M tokens
  premium:   'gpt-4o',              // $4.50/1M tokens
};

const response = await fetch('https://app.neureus.ai/ai/chat', {
  method: 'POST',
  headers: { 'Authorization': `Bearer ${'{API_KEY}'}` },
  body: JSON.stringify({
    model: models.balanced,  // ← change this
    messages: [{ role: 'user', content: prompt }],
    stream: false,
  }),
});
const { text, inputTokens, outputTokens, costUsd } = await response.json();
SSE streaming — all providers
const stream = await fetch('https://app.neureus.ai/ai/chat', {
  method: 'POST',
  headers: { 'Authorization': `Bearer ${'{API_KEY}'}` },
  body: JSON.stringify({
    model: 'claude-sonnet-4-6',  // or any model
    messages: [{ role: 'user', content: prompt }],
    stream: true,
  }),
});
const reader = stream.body.getReader();
const decoder = new TextDecoder();
while (true) {
  const { done, value } = await reader.read();
  if (done) break;
  process.stdout.write(decoder.decode(value));
}
BYOK — bring your own keys (Scale plan+)
await fetch('https://app.neureus.ai/ai/providers/openai', {
  method: 'PUT',
  headers: { 'Authorization': `Bearer ${'{API_KEY}'}` },
  body: JSON.stringify({ apiKey: 'sk-your-key' }),
});

const providers = await fetch('https://app.neureus.ai/ai/providers', {
  headers: { 'Authorization': `Bearer ${'{API_KEY}'}` },
}).then(r => r.json());
// → [{ provider: 'openai', hasKey: true, rotatedAt: '...' }]
TypeScript SDK
import { NeureuClient } from '@neureus/sdk';

const client = new NeureuClient({ apiKey: process.env.NEUREUS_API_KEY });

const result = await client.ai.chat({
  model: 'deepseek-r1',
  messages: [{ role: 'user', content: 'Solve: 2x + 5 = 13' }],
});
console.log(result.text, result.costUsd);

const stream = client.ai.stream({
  model: 'claude-haiku-4-5',
  messages: [{ role: 'user', content: 'Write a haiku' }],
});
for await (const chunk of stream) process.stdout.write(chunk);

Provider reference

All token prices are 10% below OpenRouter list. Built-in models are always free.

Neureus-hosted
prefix: meta/
Free
Cost-sensitive, low latency, no quota
meta/llama-3.3-70bdeepseek/r1-32bqwen/coder-32b
Anthropic
prefix: claude-
$0.27–$15/1M
Instruction following, long context, safety
claude-opus-4-8claude-sonnet-4-6claude-haiku-4-5
OpenAI
prefix: gpt-/o*
$0.15–$15/1M
General purpose, function calling, vision
gpt-4ogpt-4o-minio3o4-mini
Google
prefix: gemini-
$0.075–$10/1M
Long context (2M tokens), multimodal
gemini-3.5-flashgemini-3-flash-preview
DeepSeek
prefix: deepseek-
$0.135–$0.55/1M
Reasoning (R1), code (V3), cost-efficient
deepseek-r1deepseek-v3

The prompt preprocessor

4 passes run before every /ai/chat request. Cuts token count 10–30% — your provider bills for fewer tokens on every call.

Pass 1
Normalize

Trim whitespace, normalize CRLF→LF, collapse repeated blank lines, remove zero-width characters.

Pass 2
Structure

Move system messages to index 0 — providers require system messages first. Fixes ordering issues silently.

Pass 3
Trim

When token estimate exceeds 6K: keep system message + last 4 non-system turns. Replace middle with a compact summary message.

Pass 4
Compress (opt-in)

LLM compression via Workers AI Llama 3.2 3B. Send x-neureus-options: compress=true to activate.

Debug mode: Add x-neureus-debug: true header to see preprocessing stats in the response body.

Route to any provider today

500 Neurons/month free. No credit card. OpenAI-compatible response format from every provider.