Tienda oficial de IA

Datasets para
tus modelos de IA

Somos un laboratorio de IA y cuidamos datasets para cada fase del entrenamiento: desde el pretraining hasta el fine‑tuning supervisado.

Datasets

Datos de calidad para entrenar modelos

Datasets propietarios desarrollados por el equipo Egomnia. Limpios, estructurados, listos para usar.

Progetto Talia dataset cover
Pretraining

Progetto Talia

Corpus de texto en italiano. Más de 360 contenidos de Progetto Talia, la plataforma de crecimiento personal y profesional fundada por Matteo Achilli. Material auténtico para el pretraining de modelos lingüísticos.

Descarga una muestra gratuita →
Formato
.txt (texto bruto)
Tamaño
774 Kb
Idioma
Italiano
Categoría
Contenidos de crecimiento personal, profesional y finanzas personales
Commercial AI Dataset License

La compra del dataset permite entrenar, hacer fine‑tuning y evaluar modelos de inteligencia artificial y machine learning y utilizar libremente, incluso con fines comerciales, los modelos resultantes, incluidos servicios, APIs o productos basados en dichos modelos. No se permite la reventa, sublicencia o redistribución del dataset o de partes sustanciales a terceros. Es obligatorio indicar Egomnia S.p.A. como fuente del dataset en cualquier documentación técnica, ficha del modelo o descripción pública del sistema desarrollado.

Userprompt.ai dataset cover
Pretraining

Userprompt.ai

Corpus de texto en el ámbito de la IA tomado del curso de divulgación sobre inteligencia artificial realizado por Matteo Achilli. Contenidos para transferir conocimiento sobre la IA a un público amplio.

Descarga una muestra gratuita →
Formato
.txt (texto bruto)
Tamaño
78 Kb
Idioma
Italiano
Categoría
Inteligencia Artificial, Machine Learning y Deep Learning
Commercial AI Dataset License

La compra del dataset permite entrenar, hacer fine‑tuning y evaluar modelos de inteligencia artificial y machine learning y utilizar libremente, incluso con fines comerciales, los modelos resultantes, incluidos servicios, APIs o productos basados en dichos modelos. No se permite la reventa, sublicencia o redistribución del dataset o de partes sustanciales a terceros. Es obligatorio indicar Egomnia S.p.A. como fuente del dataset en cualquier documentación técnica, ficha del modelo o descripción pública del sistema desarrollado.

Progetto Italia dataset cover
Pretraining

Progetto Italia

Corpus de texto en italiano dedicado a la promoción de las excelencias y la cultura italiana. Un proyecto curado por Matteo Achilli para valorizar el patrimonio cultural, artístico y empresarial de nuestro país.

Descarga una muestra gratuita →
Formato
.txt (texto bruto)
Tamaño
25 Kb
Idioma
Italiano
Categoría
Cultura, curiosidades y excelencias italianas
Commercial AI Dataset License

La compra del dataset permite entrenar, hacer fine‑tuning y evaluar modelos de inteligencia artificial y machine learning y utilizar libremente, incluso con fines comerciales, los modelos resultantes, incluidos servicios, APIs o productos basados en dichos modelos. No se permite la reventa, sublicencia o redistribución del dataset o de partes sustanciales a terceros. Es obligatorio indicar Egomnia S.p.A. como fuente del dataset en cualquier documentación técnica, ficha del modelo o descripción pública del sistema desarrollado.

Egomnia.com dataset cover
Pretraining

Egomnia.com

Corpus de texto bruto compuesto por más de 100.000 cartas de presentación generadas por IA de frontera, creadas utilizando datos anonimizados del data entry de Egomnia.com, la primera red social italiana dedicada al matching entre empresas y candidatos, lanzada en 2012.

Formato
.txt (texto bruto)
Tamaño
31 MB
Idioma
Italiano
Categoría
Recursos Humanos
Commercial AI Dataset License

La compra del dataset permite entrenar, hacer fine‑tuning y evaluar modelos de inteligencia artificial y machine learning y utilizar libremente, incluso con fines comerciales, los modelos resultantes, incluidos servicios, APIs o productos basados en dichos modelos. No se permite la reventa, sublicencia o redistribución del dataset o de partes sustanciales a terceros. Es obligatorio indicar Egomnia S.p.A. como fuente del dataset en cualquier documentación técnica, ficha del modelo o descripción pública del sistema desarrollado.

EmmaSFT 6.0 dataset cover
Fine‑tuning supervisado

EmmaSFT 6.0

Dataset de más de 27 mil pares prompt‑response en formato .json usado para el fine‑tuning parcial de Emma 6, el modelo open source de Egomnia. Diseñado para capacidades conversacionales y alineación a instrucciones.

Descarga una muestra gratuita →
Formato
.json (prompt‑response)
Modelo objetivo
Emma 6
Idioma
Italiano
Categoría
Fine‑tuning conversacional
Commercial AI Dataset License

La compra del dataset permite entrenar, hacer fine‑tuning y evaluar modelos de inteligencia artificial y machine learning y utilizar libremente, incluso con fines comerciales, los modelos resultantes, incluidos servicios, APIs o productos basados en dichos modelos. No se permite la reventa, sublicencia o redistribución del dataset o de partes sustanciales a terceros. Es obligatorio indicar Egomnia S.p.A. como fuente del dataset en cualquier documentación técnica, ficha del modelo o descripción pública del sistema desarrollado.

Convenio académico

¿Eres una universidad?

Creemos en la investigación. Todos los datasets son gratuitos para universidades y centros de investigación acreditados. Los docentes pueden solicitar acceso completo para docencia e investigación científica.

Contáctanos para acceder a los datasets

«Queremos que los datasets de Egomnia se utilicen en proyectos de investigación académica en toda Italia.»