ArXiv cs.AI
Visión editorial CMadrid
Espacio de acción discreto como requisito previo para la convergencia de GRPO en el control continuo de modelos pequeños
arXiv:2607.21626v1 Tipo de anuncio: nuevo Resumen: Estudiamos si la optimización de políticas relativas a grupos (GRPO) puede ajustar modelos de lenguaje pequeño para tareas simuladas de control continuo de cuadrotor. En nuestro punto de referencia, el ajuste fino GRPO básico de Qwen-0.5B para el control de velocidad del cuadrotor de 25 Hz colapsa hasta la trivial acción cero: tasa de éxito del 0 por ciento, con entropía
Por qué importa para Chile y Latam
Lectura CMadrid: los cambios en IA suelen trasladarse a costos, empleo y competencia en la región; vale evaluar impacto en estrategia digital local.
Leer fuente original Volver al inicio
Como Afiliados de Amazon, podemos recibir comisiones por compras calificadas sin costo extra para ti.