Store AI Ufficiale

Dataset per
i tuoi modelli AI

Siamo un laboratorio di modelli AI e curiamo dataset per ogni fase del training: dal pretraining al supervised fine-tuning.

Dataset

Dati di qualità per addestrare modelli

Dataset proprietari sviluppati dal team Egomnia. Puliti, strutturati, pronti all'uso.

Progetto Talia dataset cover
Pretraining

Progetto Talia

Corpus di testo grezzo in italiano. Oltre 360 contenuti del Progetto Talia, la piattaforma di crescita personale e professionale fondata da Matteo Achilli. Materiale autentico per il pretraining di modelli linguistici.

Scarica un campione gratuito →
Formato
.txt (testo grezzo)
Dimensione
774 Kb
Lingua
Italiano
Categoria
Contenuti di crescita personale, professionale e finanza personale
Commercial AI Dataset License

Chi acquista il dataset può utilizzarlo per addestrare, fine-tuning e valutare modelli di intelligenza artificiale e machine learning e può utilizzare liberamente e anche a fini commerciali i modelli così ottenuti, inclusi servizi, API o prodotti basati su tali modelli. Non è consentita la rivendita, la sublicenza o la redistribuzione del dataset o di sue parti sostanziali a terzi. È obbligatorio indicare Egomnia S.p.A. come fonte del dataset in ogni documentazione tecnica, scheda del modello o descrizione pubblica del sistema sviluppato.

Userprompt.ai dataset cover
Pretraining

Userprompt.ai

Corpus di testo grezzo in ambito AI tratto dal corso di divulgazione sull'intelligenza artificiale realizzato da Matteo Achilli. Contenuti per trasferire conoscenza sul mondo dell'AI a un pubblico ampio.

Scarica un campione gratuito →
Formato
.txt (testo grezzo)
Dimensione
78 Kb
Lingua
Italiano
Categoria
Intelligenza Artificiale, Machine Learning e Deep Learning
Commercial AI Dataset License

Chi acquista il dataset può utilizzarlo per addestrare, fine-tuning e valutare modelli di intelligenza artificiale e machine learning e può utilizzare liberamente e anche a fini commerciali i modelli così ottenuti, inclusi servizi, API o prodotti basati su tali modelli. Non è consentita la rivendita, la sublicenza o la redistribuzione del dataset o di sue parti sostanziali a terzi. È obbligatorio indicare Egomnia S.p.A. come fonte del dataset in ogni documentazione tecnica, scheda del modello o descrizione pubblica del sistema sviluppato.

Progetto Italia dataset cover
Pretraining

Progetto Italia

Corpus di testo grezzo in italiano dedicato alla promozione delle eccellenze e della cultura italiana. Un progetto curato da Matteo Achilli per valorizzare il patrimonio culturale, artistico e imprenditoriale del nostro Paese.

Scarica un campione gratuito →
Formato
.txt (testo grezzo)
Dimensione
25 Kb
Lingua
Italiano
Categoria
Cultura, curiosità ed eccellenze italiane
Commercial AI Dataset License

Chi acquista il dataset può utilizzarlo per addestrare, fine-tuning e valutare modelli di intelligenza artificiale e machine learning e può utilizzare liberamente e anche a fini commerciali i modelli così ottenuti, inclusi servizi, API o prodotti basati su tali modelli. Non è consentita la rivendita, la sublicenza o la redistribuzione del dataset o di sue parti sostanziali a terzi. È obbligatorio indicare Egomnia S.p.A. come fonte del dataset in ogni documentazione tecnica, scheda del modello o descrizione pubblica del sistema sviluppato.

Egomnia.com dataset cover
Pretraining

Egomnia.com

Corpus testuale grezzo composto da oltre 100.000 lettere di presentazione generate dall'AI di frontiera, realizzate utilizzando dati anonimizzati provenienti dal data entry di Egomnia.com, il primo social network italiano dedicato al matching tra aziende e candidati, lanciato nel 2012.

Formato
.txt (testo grezzo)
Dimensione
31 MB
Lingua
Italiano
Categoria
Risorse Umane
Commercial AI Dataset License

Chi acquista il dataset può utilizzarlo per addestrare, fine-tuning e valutare modelli di intelligenza artificiale e machine learning e può utilizzare liberamente e anche a fini commerciali i modelli così ottenuti, inclusi servizi, API o prodotti basati su tali modelli. Non è consentita la rivendita, la sublicenza o la redistribuzione del dataset o di sue parti sostanziali a terzi. È obbligatorio indicare Egomnia S.p.A. come fonte del dataset in ogni documentazione tecnica, scheda del modello o descrizione pubblica del sistema sviluppato.

EmmaSFT 6.0 dataset cover
Supervised Fine‑Tuning

EmmaSFT 6.0

Dataset di oltre 27 mila coppie prompt‑response in formato .json usato per il parziale fine‑tuning di Emma 6, il modello open source di Egomnia. Progettato per capacità conversazionali e allineamento alle istruzioni.

Scarica un campione gratuito →
Formato
.json (prompt‑response)
Modello target
Emma 6
Lingua
Italiano
Categoria
Fine‑tuning conversazionale
Commercial AI Dataset License

Chi acquista il dataset può utilizzarlo per addestrare, fine-tuning e valutare modelli di intelligenza artificiale e machine learning e può utilizzare liberamente e anche a fini commerciali i modelli così ottenuti, inclusi servizi, API o prodotti basati su tali modelli. Non è consentita la rivendita, la sublicenza o la redistribuzione del dataset o di sue parti sostanziali a terzi. È obbligatorio indicare Egomnia S.p.A. come fonte del dataset in ogni documentazione tecnica, scheda del modello o descrizione pubblica del sistema sviluppato.

Convenzione accademica

Sei un'università?

Crediamo nella ricerca. Tutti i dataset sono gratuiti per università ed enti di ricerca accreditati. I docenti possono richiedere accesso completo per didattica e ricerca scientifica.

Contattaci per l'accesso ai Dataset

«Vogliamo che i dataset Egomnia siano utilizzati in progetti di ricerca accademica in tutta Italia.»