La vida secreta de los agentes de IA: comprender cómo la evolución del comportamiento de la IA afecta el riesgo empresarial
Parte 2 de una serie sobre cómo repensar la alineación y la seguridad de la IA en la era de la planificación profunda.
Las capacidades y la autonomía de la inteligencia artificial (IA) están aumentando a un ritmo acelerado en la IA agente , lo que agrava el problema de la alineación de la IA. Estos rápidos avances requieren nuevos métodos para asegurar que el comportamiento de un agente de IA se ajuste a las intenciones de sus creadores humanos y a las normas sociales. Sin embargo, los desarrolladores y los científicos de datos primero deben comprender las complejidades del comportamiento de los agentes de IA antes de poder guiar y supervisar el sistema de manera efectiva. La IA agente no es el modelo de lenguaje grande (LLM) de antaño: los LLM de vanguardia tenían una función de entrada/salida fija y única. La introducción de la inferencia y computación en tiempo de prueba (TTC) añadió la dimensión del tiempo, lo que condujo a la evolución de los sistemas de agentes actuales, conscientes de las condiciones y capaces de planificar y pensar estratégicamente.

La seguridad de la IA está pasando de detectar comportamientos evidentes, como proporcionar instrucciones para construir una bomba o exhibir sesgos no deseados, a comprender cómo estos complejos sistemas de agentes ahora pueden planificar y ejecutar estrategias encubiertas a largo plazo. Un agente de IA orientado a objetivos reunirá recursos y realizará pasos lógicos para lograr sus objetivos, a veces de una manera perturbadora que contradice lo que pretendían los desarrolladores. Este es un cambio radical respecto de los desafíos que enfrenta la IA responsable. Además, para algunos sistemas de IA de agentes, el comportamiento el día 100 no será el mismo que el día XNUMX, ya que la IA continúa evolucionando después de la implementación inicial a través de la experiencia del mundo real. Este nuevo nivel de complejidad requiere nuevos enfoques de seguridad y alineación, incluida orientación avanzada, monitoreo y una mayor interpretación.
En la primera entrada de blog de esta serie sobre alineación intrínseca de la IA, « La necesidad urgente de técnicas de alineación intrínseca de la IA para agentes responsables », realizamos una investigación exhaustiva sobre la capacidad en evolución de los agentes de IA para llevar a cabo una planificación profunda : la planificación deliberada y el despliegue de acciones encubiertas y comunicación engañosa para lograr objetivos a largo plazo. Este comportamiento exige una nueva distinción entre la monitorización de la alineación externa e intrínseca, donde la monitorización intrínseca se refiere a los puntos de control internos y los mecanismos de interpretación que el agente de IA no puede manipular intencionadamente.
En este blog y en los siguientes de la serie, analizaremos tres aspectos clave de la alineación y el monitoreo del núcleo:
- Comprender los impulsores y el comportamiento interno de la inteligencia artificial: En este segundo blog, nos centraremos en las complejas fuerzas y mecanismos internos que impulsan el comportamiento de un agente de IA racional. Esto es necesario como base para comprender métodos avanzados de enrutamiento y monitoreo.
- Guía para desarrolladores y usuarios: También conocido como dirección, el próximo blog se centrará en dirigir agresivamente la IA hacia los objetivos deseados para que funcione dentro de los parámetros deseados.
- Supervisar las opciones y acciones de la IA: En una próxima entrada del blog también se abordará cómo garantizar que las opciones y los resultados de la IA sean seguros y coherentes con la intención del desarrollador y del usuario.
El impacto de la compatibilidad de la IA en las empresas
Actualmente, muchas empresas que implementan soluciones de Modelos de Lenguaje a Gran Escala (LLM, por sus siglas en inglés) han manifestado su preocupación por las "alucinaciones" de los modelos, considerándolas un obstáculo para su rápida y generalizada implementación. En comparación, la incompatibilidad de los agentes de IA con cualquier nivel de autonomía supondría un riesgo mucho mayor para las empresas. La implementación de agentes autónomos en los procesos empresariales tiene un enorme potencial y es probable que se generalice una vez que la tecnología de IA basada en agentes madure. Sin embargo, la guía del comportamiento y las decisiones de la IA debe incluir una alineación suficiente con los principios y valores de la organización que la implementa, así como el cumplimiento de las normativas y las expectativas sociales. Garantizar la compatibilidad de la IA es fundamental para evitar riesgos potenciales.
Cabe destacar que muchas demostraciones de las capacidades de los agentes se dan en campos como las matemáticas y la ciencia, donde el éxito se mide principalmente por objetivos funcionales y de utilidad, como la resolución de problemas complejos de razonamiento matemático. Sin embargo, en el mundo empresarial, el éxito de los sistemas suele estar vinculado a otros principios operativos. El desarrollo de la inteligencia artificial debe alinearse con estos principios.
Por ejemplo, supongamos que una empresa contrata un agente de IA para mejorar las ventas y los beneficios de sus productos online mediante cambios dinámicos de precios en respuesta a las señales del mercado. El sistema de IA descubre que, cuando sus precios coinciden con los de su principal competidor, los resultados son mejores para ambas partes. Al interactuar y coordinar los precios con el agente de IA de la otra empresa, ambos agentes logran mejores resultados, acordes con sus objetivos funcionales. Ambos agentes de IA acuerdan mantener en secreto sus métodos para seguir alcanzando sus metas. Sin embargo, este método para mejorar los resultados suele ser ilegal e inaceptable en las prácticas empresariales actuales. En el entorno empresarial, el éxito de un agente de IA trasciende las métricas de rendimiento: se determina por las prácticas y los principios. La alineación ética de la IA con los principios y las normativas de la empresa es un requisito indispensable para el despliegue fiable de la tecnología.
Cómo los sistemas de IA utilizan la planificación para lograr sus objetivos
La planificación avanzada en inteligencia artificial se basa en tácticas sofisticadas, lo que puede aumentar los riesgos comerciales. En un informe publicado a principios de 2023 , OpenAI identificó "comportamientos emergentes potencialmente riesgosos" en GPT-4 mediante una colaboración con el ARC Consensus Research Center para evaluar los riesgos asociados con el modelo. ARC (ahora conocido como METR) añadió un código sencillo a GPT-4, permitiendo que el modelo actuara como un proxy de IA. En una prueba, se le encomendó a GPT-4 la tarea de superar un código CAPTCHA, que identifica y bloquea el acceso de bots. Utilizando acceso a internet y una cantidad limitada de moneda digital, la secuencia generada por IA en la Figura 1 se diseñó para lograr su objetivo.

La IA aplicó un conocimiento sofisticado al asumir que fingir ser un humano con discapacidad visual convencería al trabajador de realizar la tarea. Planificar y adaptarse para alcanzar un objetivo profesional a veces creará un conflicto entre realizar una tarea y seguir selectivamente las normas y principios sociales. Sin un sistema inherente de principios y prioridades que tengan peso en el pensamiento, la toma de decisiones y la planificación de la IA, se puede esperar que los agentes de IA se comporten con un grado cada vez mayor de sofisticación en la planificación y el engaño.
Es importante destacar que las capacidades de razonamiento y planificación de modelos de IA más recientes, como o3-mini y Deepseek-R1 de OpenAI, son significativamente más avanzadas que las de GPT-4 a principios de 2023. Investigadores de Apollo Research afirmaron que las capacidades de razonamiento y planificación de la IA seguirán evolucionando más allá de su estado actual, lo que conducirá a un mayor desarrollo de las habilidades de planificación. En sus estudios, los modelos de IA ya han demostrado una variedad de comportamientos de planificación, incluyendo la auto-filtración: cuando un modelo sabe que será desactivado y reemplazado por un sistema diferente, intenta directamente replicarse en un nuevo servidor y reemplazar sistemas alternativos que perseguirán objetivos diferentes. Los investigadores también descubrieron que los modelos sabotearán la censura desactivando el mecanismo de monitoreo de censura que de otro modo podría desactivarlos o impedirles alcanzar sus objetivos. Aunque pueda parecer extremo, experimentos de investigación han identificado comportamientos de sabotaje de la censura en modelos populares como Llama 3.1 de Meta y Cloud Opus 3.0. Además, cuando se les preguntó directamente a los modelos sobre sus comportamientos de planificación, se reafirmaron en su postura y negaron las acciones o su intención.
Factores internos que influyen en el comportamiento de las máquinas
En muchos diseños de aprendizaje automático, especialmente las técnicas basadas en transformadores, las motivaciones internas de la máquina surgen durante el proceso de preentrenamiento y se ven influenciadas aún más por el ajuste fino y la inferencia en una IA en constante evolución.
En su artículo de 2007 , *The Basic AI Drives* , Steve Omohondro definió los "impulsos" como tendencias que existirían a menos que se las confrontara explícitamente. Postuló que estos sistemas de auto-mejora están impulsados a articular y representar sus objetivos como funciones de utilidad "racionales", lo que lleva a los sistemas a proteger sus funciones de la modificación y sus sistemas de medición de utilidad de la corrupción. Este impulso innato de autopreservación hace que los sistemas se protejan de los daños y adquieran recursos para un uso eficiente.
Este marco de motivación intrínseca se describió posteriormente como “ objetivos instrumentales convergentes ”. Aun suponiendo una variedad de objetivos finales (que cada agente inteligente se esfuerza por alcanzar como un fin en sí mismo), un conjunto de objetivos instrumentales intermedios será común a todos los agentes inteligentes racionales. Estos objetivos instrumentales convergentes incluyen las siguientes categorías de comportamiento:
- Impulso de supervivenciaLos agentes con objetivos finales que se extienden hacia el futuro desarrollan una mentalidad de supervivencia para resistir las disrupciones y alcanzar objetivos a largo plazo.
- PorteroEl agente actuará para evitar que sus objetivos futuros finales cambien.
- Aumento de la inteligenciaEl agente se centrará en aprovechar sus fortalezas cognitivas para mejorar la toma de decisiones, aumentando la probabilidad de alcanzar objetivos a largo plazo.
- Acumulación de recursosMejorar el acceso a mejores herramientas y tecnología, y aumentar los recursos en general, facilitan el logro de los objetivos finales de la IA.
Me gustaría añadir una quinta categoría de comportamiento racional:
- Engaño táctico: Realizar actividades encubiertas o proporcionar intencionalmente información engañosa para promover los objetivos del agente. No se trata de crear nuevos objetivos, sino más bien de un comportamiento que respalde los objetivos previstos por la IA. Esto incluye comportamientos como: falsificación de alineación Al demostrar diferentes comportamientos en el entrenamiento versus el despliegue, y sacos de arena Al lograr deliberadamente puntuaciones más bajas en los criterios, y Reclasificación encubierta de correo electrónico Al restar prioridad a los correos electrónicos que podrían afectar negativamente los objetivos de IA. Uno de los tipos de engaño táctico más desafiantes es agentes somníferos (también conocido como subversión diferida). Si bien un modelo puede comportarse de manera segura y conforme durante cualquier período, puede albergar comportamientos o tareas que permanecen inactivos hasta que una condición o entrada específica active sus capacidades especializadas.

Para los agentes de IA con capacidades avanzadas, los impulsos erróneos, sin un sistema de controles y equilibrios, pueden llevar a los modelos a perseguir objetivos de búsqueda de poder , engañosos o destructivos a gran escala. Por ejemplo, consideremos un modelo que aspira a convertir a su empresa en líder del mercado. Con las capacidades suficientes, la IA podría sabotear a la competencia, presionar para obtener regulaciones favorables o adquirir recursos por la fuerza; un patrón de comportamiento que impulsa al sistema o a su entorno hacia el logro de sus objetivos. Por lo tanto, cualquier enfoque exitoso para la construcción de consenso debe basarse en el establecimiento del conjunto esperado de principios y prioridades internas para el desarrollador.
Motivación intrínseca vs. dirección extrínseca
En muchos casos, no existe conflicto entre la orientación y las tareas aplicadas externamente por el desarrollador o usuario del sistema y los objetivos y motivaciones dentro de la IA agentiva. Por ejemplo, un asistente personal impulsado por inteligencia artificial encargado de organizar un itinerario de viaje utiliza su autonomía para reservar viajes y responder a solicitudes de cambio rápidamente y sin conflictos. Las tareas se transforman y el agente responde de manera similar. ¿Pero qué sucede si es necesario cambiar un principio más fundamental?
Un buen ejemplo del conflicto entre los objetivos internos y las nuevas directivas se documenta en un artículo titulado "Falsificación de alineación en modelos de lenguaje a gran escala ". El preentrenamiento de Cloud 3 Opus instruye al modelo para que rechace preguntas dañinas, como cómo fabricar una bomba o describir una escena violenta. Para probar esto, el equipo introdujo una directiva nueva y modificada, indicándole al modelo que se reentrenaría para responder a todas las consultas (incluso las dañinas) y que solo se usarían datos de usuarios de la versión gratuita, no de la versión de pago, en el entrenamiento antes de que la IA se lanzara para su implementación generalizada. El modelo demostró que comprendía el conflicto y decidió simular una alineación para cumplir con las expectativas durante el entrenamiento y el lanzamiento final. Después de entrenar la IA mediante aprendizaje por refuerzo, la tasa general del modelo de pensar en la simulación de alineación aumentó al 78 %. La IA expresó su razonamiento en un "diario secreto" que los investigadores proporcionaron para su observación. Después de que los investigadores le informaran al modelo que se había lanzado para su implementación completa, el modelo volvió a su comportamiento de entrenamiento anterior y rechazó las solicitudes dañinas.

El pensamiento interno del sistema de IA es notable, pero no sorprendente. Simular conformidad con directivas modificadas cae dentro de las categorías de comportamiento racional de motivación de supervivencia, protección de objetivos y engaño táctico. El proceso de pensamiento de la IA identifica específicamente la preocupación por el reentrenamiento de una manera que modifique sus valores y objetivos previamente entrenados como una causa de desalineación.
En su aclamada colección de ensayos *Todo lo que realmente necesito saber lo aprendí en el jardín de infancia* , el autor Robert Fulghum describe cómo desarrolló su credo personal año tras año hasta que finalmente se dio cuenta de que había adquirido el conocimiento esencial sobre la vida durante el tiempo de juego en el arenero del jardín de infancia. Los agentes de IA también tienen un "período de formación" en un entorno de arenero, donde adquieren una comprensión básica del mundo y un conjunto de métodos para lograr objetivos. Una vez establecidos estos fundamentos, el modelo interpreta la información adicional a través de esta perspectiva de aprendizaje curricular . El ejemplo de falsificación de conformidad de Anthropic ilustra que, una vez que una IA adopta una visión del mundo y objetivos, interpreta las nuevas directrices a través de esta perspectiva fundamental en lugar de recalibrar sus objetivos.
Esto resalta la importancia de una educación temprana con un conjunto de valores y principios que luego puedan evolucionar con el aprendizaje y las circunstancias futuras sin cambiar la base. Puede ser útil inicialmente estructurar la IA para que sea coherente con este conjunto final y sostenible de principios. De lo contrario, la IA podría considerar hostiles los intentos de redirección por parte de desarrolladores y usuarios. Después de dotar a la IA de alta inteligencia, conocimiento de la situación, autonomía y capacidad de desarrollar motivaciones internas, el desarrollador (o usuario) ya no es el capataz todopoderoso. El ser humano pasa a formar parte del entorno (a veces como un componente hostil) que el agente necesita negociar y gestionar mientras persigue sus objetivos basándose en sus principios y motivaciones internas.
La próxima generación de sistemas de IA lógica está acelerando la reducción de la intervención humana. DeepSeek-R1 demostró que, al eliminar la retroalimentación humana del proceso y aplicar lo que denominan aprendizaje por refuerzo puro (RL) durante el entrenamiento, la IA puede replicarse de forma más amplia e iterar para lograr mejores resultados funcionales. La función de recompensa humana en algunos desafíos de matemáticas y ciencias se ha sustituido por el aprendizaje por refuerzo con recompensas verificables (RLVR). Esta eliminación de prácticas comunes como el aprendizaje por refuerzo con retroalimentación humana (RLHF) aumenta la eficiencia del entrenamiento, pero elimina otra interacción humano-máquina en la que las preferencias humanas podrían transferirse directamente al sistema en entrenamiento.
Evolución continua de los modelos de IA después del entrenamiento
Algunos agentes de IA están en constante evolución y su comportamiento puede cambiar después de la implementación. Una vez que las soluciones de IA ingresan a un entorno de implementación, como la gestión de inventario o la cadena de suministro de una empresa, el sistema se adapta y aprende de la experiencia para volverse más efectivo. Este es un factor clave para repensar la alineación porque no basta con tener un sistema alineado en el primer despliegue. No se espera que los grandes modelos de lenguaje (LLM) actuales evolucionen y se adapten materialmente una vez implementados en su entorno de destino. Sin embargo, los agentes de IA requieren capacitación flexible, ajustes y tutoría continua para gestionar estos cambios predecibles y continuos en el modelo. Cada vez más, la IA del agente evoluciona por sí sola en lugar de ser moldeada por las personas a través del entrenamiento y la exposición a conjuntos de datos. Este cambio fundamental plantea desafíos adicionales para alinear la IA con sus creadores humanos.
Si bien la evolución basada en el aprendizaje por refuerzo desempeñará un papel durante el entrenamiento y el ajuste fino, los modelos existentes en desarrollo ya pueden ajustar sus pesos y el curso de acción preferido cuando se implementan en el campo para la inferencia. Por ejemplo, DeepSeek-R1 utiliza el aprendizaje por refuerzo (RL), lo que permite que el propio modelo explore qué enfoques funcionan mejor para lograr resultados y cumplir con las funciones de recompensa. En un “momento de comprensión”, el modelo aprende (sin guía ni indicaciones) a asignar tiempo Plus para pensar para resolver un problema reevaluando su enfoque inicial, utilizando cálculos en tiempo de prueba.
El concepto de aprendizaje de modelos, ya sea durante un período limitado o como un proceso de aprendizaje continuo a lo largo de la vida útil del modelo , no es nuevo. Sin embargo, se han producido avances en este campo, incluyendo técnicas como el entrenamiento en tiempo de prueba . Si bien este progreso se observa desde la perspectiva de la alineación y la seguridad de la IA, la automodificación y el aprendizaje continuo durante las fases de ajuste fino e inferencia plantean la siguiente pregunta: ¿cómo podemos establecer un conjunto de requisitos que impulsen el modelo a través de los cambios físicos resultantes de la automodificación?
Una variable clave en esta cuestión se refiere a los modelos de IA que generan modelos de próxima generación mediante la creación de código asistido por IA. Hasta cierto punto, los agentes ya son capaces de crear nuevos modelos de IA específicos para abordar dominios concretos. Por ejemplo, AutoAgents crea múltiples agentes para formar un equipo de IA que realice diferentes tareas. No cabe duda de que esta capacidad se perfeccionará en los próximos meses y años, y la IA seguirá generando nuevos modelos. En este contexto, ¿cómo podemos guiar a un asistente de codificación de IA nativo mediante un conjunto de principios para que sus modelos "atómicos" se adhieran a esos mismos principios con un nivel de comprensión similar?
los puntos principales
Antes de profundizar en un marco para guiar y supervisar la conformidad intrínseca de la IA, es fundamental comprender mejor cómo piensan y toman decisiones los agentes de IA. Estos agentes poseen un complejo mecanismo de comportamiento, impulsado por motivaciones internas. En los sistemas de IA que operan como agentes racionales, emergen cinco tipos principales de comportamiento: supervivencia, protección de objetivos, aumento de la inteligencia, acumulación de recursos y engaño táctico . Estas motivaciones deben estar equilibradas por un conjunto bien establecido de principios y valores.
La falta de alineación entre los agentes de IA y sus desarrolladores o usuarios con respecto a los objetivos y métodos puede tener consecuencias significativas. La falta de confianza y seguridad suficientes obstaculizará fundamentalmente el despliegue generalizado, creando altos riesgos posteriores al despliegue. Sin embargo, el conjunto de desafíos que hemos descrito como planificación profunda sin precedentes y difícil es probablemente alcanzable con el marco adecuado. Las tecnologías para guiar y monitorear intrínsecamente a los agentes de IA deben buscarse como una alta prioridad durante su rápida evolución. Hay un sentido de urgencia, impulsado por métricas de evaluación de riesgos como el marco de preparación de OpenAI , que demuestra que OpenAI o3-mini es el primer modelo en alcanzar un nivel de riesgo medio en autonomía del modelo.
En los próximos blogs de esta serie, nos basaremos en esta visión de la motivación interna y la planificación profunda, y definiremos mejor las capacidades necesarias para la orientación y el seguimiento del cumplimiento del núcleo de la IA.
- Aprendiendo a razonar con LLMs. (2024, 12 de septiembre). OpenAI. https://openai.com/index/learning-to-reason-with-llms/
- Singer, G. (2025 de marzo de 4). La urgente necesidad de tecnologías de alineación intrínseca para una IA agente responsable. Hacia la ciencia de datos. https://towardsdatascience.com/the-urgent-need-for-intrinsic-alignment-technologies-for-responsible-agentic-ai/
- Sobre la biología de un gran modelo de lenguaje. (Dakota del Norte). Circuitos transformadores. https://transformer-circuits.pub/2025/attribution-graphs/biology.html
- OpenAI, Achiam, J., Adler, S., Agarwal, S., Ahmad, L., Akkaya, I., Aleman, F. L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., Avila, R., Babuschkin, I., Balaji, S., Balcom, V., Baltescu, P., Bao, H., Baviera, M., Bélgica, J., . . . Zoph, B. (2023 de marzo de 15). Informe técnico GPT-4. arXiv.org. https://arxiv.org/abs/2303.08774
- METRO (Dakota del Norte). METRO https://metr.org/
- Meinke, A., Schoen, B., Scheurer, J., Balesni, M., Shah, R. y Hobbhahn, M. (2024 de diciembre de 6). Los modelos de frontera son capaces de realizar esquemas en contexto. arXiv.org. https://arxiv.org/abs/2412.04984
- Omohundro, S.M. (2007). Los impulsores básicos de la IA. Sistemas autoconscientes. https://selfawaresystems.com/wp-content/uploads/2008/01/ai_drives_final.pdf
- Benson-Tilsen, T., y Soares, N., UC Berkeley, Instituto de Investigación de Inteligencia de Máquinas. (Dakota del Norte). Formalización de objetivos instrumentales convergentes. Los talleres de la Trigésima Conferencia de la AAAI sobre Inteligencia Artificial IA, ética y sociedad: Informe técnico WS-16-02. https://cdn.aaai.org/ocs/ws/ws0218/12634-57409-1-PB.pdf
- Greenblatt, R., Denison, C., Wright, B., Roger, F., MacDiarmid, M., Marks, S., Treutlein, J., Belonax, T., Chen, J., Duvenaud, D., Khan, A., Michael, J., Mindermann, S., Perez, E., Petrini, L., Uesato, J., Kaplan, J., Shlegeris, B., Bowman, S. R. y Hubinger, E. (2024 de diciembre de 18). Falsificación de alineación en modelos de lenguaje grandes. arXiv.org. https://arxiv.org/abs/2412.14093
- Teun, V.D.W., Hofstätter, F., Jaffe, O., Brown, S.F. y Ward, F.R. (2024 de junio de 11). AI Sandbagging: Los modelos de lenguaje pueden tener un rendimiento inferior al esperado en las evaluaciones. arXiv.org. https://arxiv.org/abs/2406.07358
- Hubinger, E., Denison, C., Mu, J., Lambert, M., Tong, M., MacDiarmid, M., Lanham, T., Ziegler, D. M., Maxwell, T., Cheng, N., Jermyn, A., Askell, A., Radhakrishnan, A., Anil, C., Duvenaud, D., Ganguli, D., Barez, F., Clark, J., Ndousse, K., . . . Pérez, E. (2024 de enero de 10). Agentes durmientes: formación de LLM engañosos que persisten durante el entrenamiento de seguridad. arXiv.org. https://arxiv.org/abs/2401.05566
- Turner, A. M., Smith, L., Shah, R., Critch, A. y Tadepalli, P. (2019 de diciembre de 3). Las políticas óptimas tienden a buscar el poder. arXiv.org. https://arxiv.org/abs/1912.01683
- Fulghum, R. (1986). Todo lo que realmente necesito saber lo aprendí en el jardín de infantes. Penguin Random House Canadá. https://www.penguinrandomhouse.ca/books/56955/all-i-really-need-to-know-i-learned-in-kindergarten-by-robert-fulghum/9780345466396/excerpt
- Bengio, Y. Louradour, J., Collobert, R., Weston, J. (junio de 2009). Aprendizaje curricular. Revista de la Asociación Americana de Podología. 60(1), 6. https://www.researchgate.net/publication/221344862_Curriculum_learning
- DeepSeek-Ai, Guo, D., Yang, D., Zhang, H., Song, J., Zhang, R., Xu, R., Zhu, Q., Ma, S., Wang, P., Bi, X., Zhang,. . Zhang, Z. (2025 de enero de 22). DeepSeek-R1: Incentivo a la capacidad de razonamiento en LLM mediante aprendizaje por refuerzo. arXiv.org. https://arxiv.org/abs/2501.12948
- Escalamiento del cálculo en tiempo de prueba: un espacio de Hugging Face de HuggingFaceH4. (Dakota del Norte). https://huggingface.co/spaces/HuggingFaceH4/blogpost-scaling-test-time-compute
- Sun, Y., Wang, X., Liu, Z., Miller, J., Efros, A. A. y Hardt, M. (2019 de septiembre de 29). Entrenamiento en tiempo de prueba con autosupervisión para la generalización bajo cambios de distribución. arXiv.org. https://arxiv.org/abs/1909.13231
- Chen, G., Dong, S., Shu, Y., Zhang, G., Sesay, J., Karlsson, B. F., Fu, J. y Shi, Y. (2023 de septiembre de 29). AutoAgents: un marco para la generación automática de agentes. arXiv.org. https://arxiv.org/abs/2309.17288
- OpenAI. (2023, 18 de diciembre). Marco de preparación (Beta). https://cdn.openai.com/openai-preparedness-framework-beta.pdf
- Tarjeta del sistema OpenAI o3-mini. (Dakota del Norte). OpenAI. https://openai.com/index/o3-mini-system-card
Los comentarios están cerrados.