Wie sind da die Response-Zeiten? Geht das noch vernünftig als Chat durch (also ich sag mal maximal 4 Sekunden Wartezeit)? Die neuen Copilot-PCs mit NPU sollen das ja auch vernünftig können. Da gibts aber nach meinem Wissen noch keine Hardware, die günstig genug ist, dass man sie mal eben als Homeserver laufen lassen könnte. Im RZ haben wir eine Maschine mit einer Tesla T4 (in dem Zusammenhang eine Empfehlung für „primcast“ - hab keinen Anbieter gefunden, wo man GPU-Server günstiger im DSGVO-Raum mieten kann). Ich weiss - auch nicht mehr State-of-the-Art und müsste mal aktualisiert werden. Aber die llama3-Modelle laufen damit sehr flüssig. Wir nutzen das für Inhaltsanalyse von Dokumenten. Der Context ist da schon groß genug, dass es für die meisten Dokumente reicht.
Beim Chat geht es so einigermaßen. Aber wenn ich mit mcp etwas mache, wird es sehr langsam und da langt der Context dann nicht mehr. Ich hab relativ schnell gemerkt, dass qwen für die meisten Aufgaben auch zu dumm ist. Aber Textanalyse und Text schreiben geht gut. Interessant ist natürlich die unzensierte Version ![]()
(Ich schätze mal dass in 5 Jahren der Besitz von unzensierten LLMs streng verboten ist und ähnlich reglementiert sein wird wie Schusswaffen)
Ich habe heute morgen claude gefragt, warum gestern abend die Schlafzimmerrolladen nicht runter gefahren wurde. Das hat die relativ schnell raus bekommen.
2 „Gefällt mir“