Gestern, 09:52
1. Eine LLM ist ausschließlich zum chatten verfügbar. Sie kann dir Ton Skripte erstellen, aber sie kann nur antworten wenn du ihr etwas schreibst.
2. Jede LLM hat einen begrenzten Speicher. Jeder Buchstabe oder jede Zahl ist 1 Token. Wenn diese Anzahl überschritten wird, dann vergisst sie den Anfang. Bei einer Web Version sind die maximalen Tokens festgelegt und diese kann man auch nicht selbst ändern, dient zum Schutz das die Server am Ende überlasten und abstürzen. Bei der lokalen Version funktioniert das ganze etwas anders, man kann dort die maximale Anzahl an Tokens selbst festlegen, aber wie bereits gesagt, die Tokens werden in diesem Fall alle auf der Festplatte(Nicht verwechseln mit RAM/Arbeitsspeicher) in einem Ordner gespeichert. Das Problem hinter all dem ist, wenn man die lokale LLM öffnet dann werden alle Tokens auf den RAM(Arbeitsspeicher) gezogen, wenn nicht genug RAM vorhanden ist stürzt entweder die lokale LLM ab oder der Bildschirm friert ein. Wenn man natürlich 200 GB+ an RAM hat kann man das Gespräch sehr weit in die Länge ziehen.
3. Wenn man eine lokale LLM betreibt, dann muss die entweder über die GPU, CPU oder Hybrid(GPU + CPU) laufen. Die beste Wahl um die schnellstmögliche Antwort zu erhalten ist die GPU, aber wenn die lokale LLM auf der GPU läuft wird ebenfalls VRAM in Anspruch genommen. Wenn man sie auf der CPU laufen lassen würde, dauert es einige Zeit bis man eine Antwort bekommt
4. Eine lokale LLM ist für das beschriebene Vorhaben tatsächlich die beste Wahl. Man kann selbst die maximale Anzahl an Token eingeben und auch den Style wie die lokale LLM schreibt entweder Locker, Ernst, Chaotisch oder what ever.
5. Qwen ist zur Zeit die beste lokale LLM. Habe gehört davon kommt auch bald eine neue Version raus.
2. Jede LLM hat einen begrenzten Speicher. Jeder Buchstabe oder jede Zahl ist 1 Token. Wenn diese Anzahl überschritten wird, dann vergisst sie den Anfang. Bei einer Web Version sind die maximalen Tokens festgelegt und diese kann man auch nicht selbst ändern, dient zum Schutz das die Server am Ende überlasten und abstürzen. Bei der lokalen Version funktioniert das ganze etwas anders, man kann dort die maximale Anzahl an Tokens selbst festlegen, aber wie bereits gesagt, die Tokens werden in diesem Fall alle auf der Festplatte(Nicht verwechseln mit RAM/Arbeitsspeicher) in einem Ordner gespeichert. Das Problem hinter all dem ist, wenn man die lokale LLM öffnet dann werden alle Tokens auf den RAM(Arbeitsspeicher) gezogen, wenn nicht genug RAM vorhanden ist stürzt entweder die lokale LLM ab oder der Bildschirm friert ein. Wenn man natürlich 200 GB+ an RAM hat kann man das Gespräch sehr weit in die Länge ziehen.
3. Wenn man eine lokale LLM betreibt, dann muss die entweder über die GPU, CPU oder Hybrid(GPU + CPU) laufen. Die beste Wahl um die schnellstmögliche Antwort zu erhalten ist die GPU, aber wenn die lokale LLM auf der GPU läuft wird ebenfalls VRAM in Anspruch genommen. Wenn man sie auf der CPU laufen lassen würde, dauert es einige Zeit bis man eine Antwort bekommt
4. Eine lokale LLM ist für das beschriebene Vorhaben tatsächlich die beste Wahl. Man kann selbst die maximale Anzahl an Token eingeben und auch den Style wie die lokale LLM schreibt entweder Locker, Ernst, Chaotisch oder what ever.
5. Qwen ist zur Zeit die beste lokale LLM. Habe gehört davon kommt auch bald eine neue Version raus.

