Technologie

KI, die im Betrieb besteht.

Wir kombinieren führende Sprachmodelle mit sauberem Retrieval und diszipliniertem MLOps – damit aus Prototypen verlässliche Systeme werden.

Abstrakte Visualisierung eines neuronalen Netzes

Drei Säulen

Unser Technologie-Stack

Nicht das neueste Buzzword, sondern das, was zuverlässig liefert.

LLMs

Wir wählen pro Aufgabe das passende Sprachmodell – von grossen Cloud-Modellen bis zu kompakten, lokal betriebenen. Kein Vendor-Lock-in, Modelle sind austauschbar.

RAG

Retrieval-Augmented Generation verankert Antworten in deinen Daten. Das Modell zitiert Quellen statt zu raten – die Grundlage für vertrauenswürdige Assistenten.

MLOps

Versionierung, automatische Tests, Monitoring und Rollbacks. Damit läuft KI nicht nur in der Demo, sondern jeden Tag – nachvollziehbar und wartbar.

RAG im Kern

So findet die KI die richtige Antwort

Deine Dokumente werden in Vektoren zerlegt und in einer Datenbank gespeichert. Zu jeder Frage holen wir die relevantesten Passagen und geben sie dem Modell als Kontext mit – so bleibt die Antwort belegbar.

Vektor-DBEmbeddingsRe-RankingZitate
rag_pipeline.py
from neuron import Retriever, LLM

store = Retriever.from_docs("./wissen/")
llm   = LLM(model="neuron-r1", temperature=0.2)

def frage(text):
    docs = store.search(text, k=5)   # relevante Passagen
    return llm.answer(
        query=text,
        context=docs,
        cite=True,                # Quellen mitgeben
    )

frage("Wie lange ist die Kündigungsfrist?")
# -> "3 Monate zum Quartalsende [Vertrag §7]"

Architektur

Vom Rohdokument zur Antwort

Ein durchgängiger, überwachter Datenfluss – jede Stufe testbar.

QuellenPDF · DB · API · Mail
IngestionParsing & Chunking
EmbeddingsVektorisierung
Vektor-DBSpeicher & Suche
RetrieverTop-k · Re-Ranking
LLMAntwort + Zitate
GuardrailsPrüfung & Filter
API / AppAusgabe
MonitoringLatenz · Qualität
deploy.sh
# Modell versionieren, testen, ausrollen
$ neuron eval --suite qa-regression
  ✓ 248/250 tests bestanden (99.2%)

$ neuron deploy --model neuron-r1 --canary 10
  → 10% Traffic auf neue Version
  → Latenz p95: 480ms  ·  Fehlerrate: 0.0%

$ neuron promote --to production
  ✓ live  ·  Rollback jederzeit möglich

MLOps

Ausrollen ohne Bauchweh

Jede Modell-Version durchläuft automatische Qualitäts-Tests, bevor sie live geht. Wir starten mit einem kleinen Anteil des Traffics (Canary), beobachten die Kennzahlen und rollen erst dann vollständig aus – mit Rollback auf Knopfdruck.

  • Automatische Evaluierung vor jedem Deploy
  • Canary-Releases statt Big-Bang
  • Monitoring von Latenz, Kosten und Qualität
  • Vollständige Nachvollziehbarkeit jeder Version

Werkzeuge

Womit wir arbeiten

PythonTypeScriptPyTorch TransformerspgvectorQdrant DockerKubernetesTerraform FastAPIPrometheusGrafana

Tiefer eintauchen?

Wir zeigen dir gern anhand deines Use-Cases, wie unsere Architektur bei dir aussehen würde.

Technisches Gespräch buchen