// projekt ·
Project Aeon: Local-First-Assistentenplattform
Ein privater, lokaler KI-Assistent, der keine Arbeit in die Cloud schickt. Stack: FastAPI, ChromaDB, Ollama, Vue.
Rolle: Privatprojekt · Jahr: 2025 · Status: ausgeliefert
kurz: Eine Local-First-RAG-Plattform, damit deine Dokumente nie den Rechner verlassen. FastAPI orchestriert, ChromaDB speichert und durchsucht Embeddings, Ollama führt das Modell aus. Die Verkabelung war einfach. Die Arbeit lag in guter Retrieval-Qualität mit kleinen lokalen Modellen.
Problem
Cloud-KI-Assistenten brauchen deine Dokumente auf fremden Servern. Ich wollte RAG-Gespräche über lokale Dateien, alles auf meinem Rechner: keine API-Keys, keine Daten, die das Gerät verlassen.
Rahmenbedingungen
- Lokale Modelle sind klein. Sie können Relevanz nicht mit riesigem Kontextfenster erzwingen wie gehostete Modelle.
- Kontext ist knapp. Jeder gefundene Abschnitt konkurriert um dasselbe begrenzte Prompt-Budget.
- Modelle wechseln. Ein anderes LLM soll Konfiguration sein, keine Codeänderung.
Entscheidungen
- FastAPI als Orchestrator. Es nimmt die Anfrage, durchsucht den Vektorspeicher, baut den Prompt und reicht die Generierung an das lokale Modell weiter.
- ChromaDB für Vektorspeicherung und Ähnlichkeitssuche über Dokument-Embeddings.
- Ollama führt das LLM aus, die Modellwahl ist also eine Deployment-Frage.
- Vue 3 mit Naive UI für die Chat-Oberfläche. Die meiste Arbeit steckt hinter der API.
Ergebnis
Der Chunker war die tragende Entscheidung. Zu kleine Abschnitte zerreißen zusammenhängende Inhalte. Zu große füllen das Kontextfenster mit Rauschen. Das Projekt ist abgeschlossen: Es hat die Fragen zu lokalem Retrieval beantwortet, für die ich es gebaut habe.