Tu Transformer puede tener dos pensamientos a la vez: evidencia de superposición lineal en los LLM
Aunque los modelos de lenguaje grandes (LLM) dependen de componentes altamente no lineales, en este trabajo demostramos que exhiben una linealidad fundamental: cuando las entradas de distintos flujos de texto se combinan linealmente, el modelo produce una superposición de los…
Traducción automática · Título original: Your Transformer Can Hold Two Thoughts at Once: Evidence of Linear Superposition in LLMs
Autores: Pavel Tikhonov, Anton Korznikov, Matvey Mikhalchuk y 6 más
Rufus-Air: Una receta de posentrenamiento de LLM abierta
Rufus-Air es una receta de posentrenamiento abierta y reproducible en GLM-4.5-Air-Base (106B-A12B), organizada como una tubería serial de ocho etapas: SFT, Reasoning RL, Coding RL, Instruction-Following RL, General Agent, Coding Agent, Search Agent y RLHF. Documentamos los…
Traducción automática · Título original: Rufus-Air: An Open LLM Post-Training Recipe
Autores: Chia-Yuan Chang, Renyuan Cheng, Rui Feng y 19 más
El pasado enmarca el futuro: memoria para la generación autorregresiva de video
Los avances en modelos generativos han mejorado la fidelidad del video, permitiendo la generación de largo horizonte, el modelado interactivo del mundo y entornos visuales en evolución. La generación autorregresiva (AR) de video extiende las secuencias visuales mediante…
Traducción automática · Título original: The Past Frames the Future: Memory for Autoregressive Video Generation
Autores: Harold Haodong Chen, Rongjin Guo, Disen Lan y 22 más