ArXiv cs.AI
Visión editorial CMadrid
FindStatBench: Evaluación de modelos de lenguaje grandes en síntesis de código combinatorio
arXiv:2607.18260v1 Tipo de anuncio: nuevo Resumen: Presentamos FindStatBench, un punto de referencia de ejecución para evaluar modelos de lenguaje grandes en síntesis de código combinatorio. Construido a partir de FindStat, contiene 2329 tareas en 24 colecciones y 5,52 millones de instancias ocultas, que cubren la síntesis estadística, que asigna objetos a números enteros, y la síntesis de mapas, que asigna objetos.
Por qué importa para Chile y Latam
Lectura CMadrid: esta señal es relevante para equipos en Chile porque puede impactar cumplimiento, respuesta a incidentes y continuidad operativa.
Leer fuente original Volver al inicio
Como Afiliados de Amazon, podemos recibir comisiones por compras calificadas sin costo extra para ti.