
Linkup Research lanzó SPARSEUP — una versión de acceso abierto de una embedding dispersa basada en ModernBERT con 149 millones de parámetros. Según los datos proporcionados por MarkTechPost, la modelo obtuvo 56,4 nDCG@10 en BEIR-13; Linkup Research describe este resultado como el mejor conocido para un codificador disperso público con menos de 150 millones de parámetros.
Para la dispersión, la modelo utiliza un desplazamiento de logits, una expansión a 12 elementos por token y una normalización. En conjunto con el índice Seismic, alcanza más de 97% de exhaustividad y aproximadamente 380 microsegundos por consulta, según el mismo resumen. La distribución se realiza bajo la licencia Apache 2.0.
El interés práctico aquí está relacionado con la búsqueda: la combinación de tamaño compacto, representaciones dispersas y la latencia anunciada podría facilitar la adopción de estos modelos en sistemas prácticos. Sin embargo, la fuente se presenta como un resumen independiente de metadatos y no como una publicación primaria ni una verificación por fuentes independientes.
comentario editorial
Por qué importa
Una consecuencia probable es un mayor interés en modelos dispersos compactos para búsqueda aplicada, si los indicadores reportados pueden reproducirse. La señal futura será la publicación de resultados primarios, código o comparaciones independientes. Una incertidumbre sustancial es que actualmente solo hay una relectura de metadatos disponible.