Vervollständigt oder erzeugt Text aus einem Prompt. Ähnlich wie ein lokales LLM (Stil Ollama).
Lade und führe KI-Modelle (LLMs) direkt im Browser aus, ohne Server. Wähle in den Tabs eine Aufgabe, wähle das Modell und klicke auf Modell herunterladen und laden; beim ersten Mal wird es vom Hugging Face Hub heruntergeladen und im Cache gespeichert (IndexedDB). Im Chat wird der Gesprächsverlauf bei jeder Inferenz einbezogen: je mehr Kontext, desto länger die Verarbeitungszeit.
Jeder Tab ist eine andere Aufgabe: Chat / Generierung, Zusammenfassen, Übersetzen, Sentiment-Analyse, Fragen und Antworten, Entitäten erkennen (NER) und ohne Training klassifizieren (Zero-Shot). Jede Aufgabe bietet ihre eigenen Modelle und Beispiele mit einem Klick.
Es verwendet Transformers.js + ONNX Runtime Web, um die Modelle im Browser über WebAssembly oder WebGPU auszuführen. Kein von dir eingegebener Text wird an einen Server gesendet. Die Geschwindigkeit hängt von deiner Hardware ab: kleine Modelle (<100 MB) sind selbst auf der CPU schnell; große benötigen eine dedizierte GPU oder mehrere Minuten.
Vervollständigt oder erzeugt Text aus einem Prompt. Ähnlich wie ein lokales LLM (Stil Ollama).