Fonte
GitHub
3 item
Un LLM da 28,9 milioni di parametri gira su un ESP32-S3 da 8 dollari: 9 token al secondo, gran parte del modello in flash, niente cloud
OpenAI riduce il context size di Codex da 372k a 272k token
Fonte
3 item
Un LLM da 28,9 milioni di parametri gira su un ESP32-S3 da 8 dollari: 9 token al secondo, gran parte del modello in flash, niente cloud
OpenAI riduce il context size di Codex da 372k a 272k token