a2a mcp
Español
Back to AI Agents
autoresearch logo
ai-agent361

autoresearch

El agente de IA de código abierto de Andrej Karpathy que ejecuta de forma autónoma experimentos de entrenamiento de LLM durante la noche en una sola GPU, editando código, evaluando mejoras e iterando mientras duermes.

Descripción general

autoresearch es un proyecto experimental de código abierto creado por Andrej Karpathy que demuestra el poder de los agentes de IA autónomos para realizar investigación real en aprendizaje automático. Proporciona un entorno de entrenamiento minimalista para una sola GPU basado en una implementación simplificada de nanochat, donde un agente de IA de codificación toma el control total del ciclo de experimentación.

En lugar de ajustar manualmente el código Python, los investigadores escriben instrucciones de alto nivel en un archivo Markdown llamado program.md. El agente luego edita iterativamente el script de entrenamiento (train.py), ejecuta experimentos de entrenamiento de tiempo fijo (típicamente 5 minutos), evalúa las mejoras basándose en una métrica de validación (por ejemplo, val_bpb), y solo confirma los cambios ganadores en una rama de funcionalidad de Git.

Características principales

  • Ciclo de agente autónomo: El agente de IA planifica experimentos, modifica el código (arquitectura, hiperparámetros, optimizador, etc.), ejecuta el entrenamiento y decide qué mantener.
  • Eficiencia para una sola GPU: Diseñado para hardware accesible; cada experimento se ejecuta durante una duración fija corta (~5 minutos), permitiendo ~12 experimentos por hora.
  • Control de versiones basado en Git: Las mejoras se rastrean mediante confirmaciones en una rama de funcionalidad, facilitando la revisión y reversión de cambios.
  • Configuración minimalista: Una base de código pequeña (~630 1000 líneas en unos pocos archivos) centrada en una métrica clara para evaluación objetiva.
  • Supervisión humana mediante prompts: Los usuarios definen la "organización de investigación" a través de instrucciones en lenguaje natural en Markdown, permitiendo comportamientos sofisticados del agente sin tocar código de bajo nivel.
  • Extensible: Fácil de añadir más agentes, mejorar el prompt en program.md o adaptarlo para diferentes modelos/tareas.

Cómo funciona

  1. El usuario configura el repositorio y proporciona un objetivo de investigación en program.md.
  2. Se lanza un agente de IA de codificación (por ejemplo, impulsado por Claude, GPT o modelos locales).
  3. El agente crea/usa una rama de funcionalidad de Git y comienza a iterar:
    • Edita train.py.
    • Ejecuta un experimento de entrenamiento cronometrado.
    • Mide la métrica clave de validación.
    • Si hay mejora, confirma el cambio; de lo contrario, lo descarta e intenta de nuevo.
  4. Durante la noche o a lo largo de días, el sistema acumula docenas a cientos de experimentos, descubriendo mejores configuraciones del modelo.

El proyecto hace hincapié en la ingeniería del prompt del agente (el "código de la organización de investigación") para maximizar la velocidad de investigación a largo plazo sin intervención humana.

Casos de uso

  • Investigación en ML personal: Permita que un agente explore hiperparámetros, arquitecturas u optimizaciones mientras usted duerme o se enfoca en ideas de alto nivel. i Demostración educativa: Comprenda los flujos de trabajo de IA agentica en un contexto real y ejecutable de ML.
  • Enjambres distribuidos: Las extensiones comunitarias permiten que múltiples agentes o máquinas colaboren (por ejemplo, proyectos autoresearch@home).
  • Prototipado rápido: Pruebe ideas para el descubrimiento científico autónomo en entrenamiento de LLM a pequeña escala. . Evaluación de capacidades del agente: Evalúe qué tan bien diferentes LLMs se desempeñan como investigadores autónomos.

Comenzando

Clona el repositorio, instala las dependencias mediante pyproject.toml, configura tu proveedor de IA (claves API), prepara un archivo program.md con tus instrucciones de investigación y lanza el bucle del agente. Funciona en una sola GPU y requiere una configuración mínima.

El repositorio incluye una línea base program.md que se puede iterar para obtener mejores resultados.

Por qué es importante

autoresearch representa un vistazo temprano de un futuro donde los agentes de IA manejan el trabajo pesado de la investigación empírica, liberando a los humanos para la dirección creativa. Ha generado un enorme interés en la comunidad, bifurcaciones, adaptaciones (AMD, Apple Silicon, etc.), y discusiones sobre enjambres de agentes y la "singularidad temprana" de la ciencia automatizada.

Limitaciones

  • Los experimentos comienzan desde cero cada vez (sin memoria persistente entre ejecuciones en la versión base).
  • Se centra en una sola métrica simple y modelos pequeños.
  • El éxito depende en gran medida de la calidad del agente de codificación subyacente y de la ingeniería de prompts.

Para obtener los últimos detalles, código y debates de la comunidad, visita el repositorio oficial en GitHub.

Tags

agente-iallmaprendizaje-automáticoinvestigación-autónomapytorchnanochatkarpathybucle-agenteexperimentaciónpython

Related Entries

Keep exploring similar tools and resources in this category.

Browse AI Agents
autoresearch logo

autoresearch

AI Agents

Andrej Karpathy's open-source AI agent that autonomously runs LLM training experiments overnight on a single GPU, editing code, evaluating improvements, and iterating while you sleep.

Agente Hermes logo

Agente Hermes

AI Agents

Hermes Agent, desarrollado por Nous Research, es un agente de IA autónomo, de código abierto y auto-mejorable que aprende de la experiencia, crea habilidades reutilizables, mantiene una memoria persistente entre sesiones y evoluciona para volverse más capaz con el tiempo.

Open SWE logo

Open SWE

AI Agents

Open SWE es un agente de codificación asíncrono de código abierto creado por LangChain. Maneja de forma autónoma incidencias de GitHub investigando bases de código, planificando tareas, escribiendo y probando código, realizando auto-revisiones y abriendo solicitudes de extracción — actuando como un ingeniero de software a tiempo completo en tu equipo.

Agentes de Workspace logo

Agentes de Workspace

AI Agents

Agentes de IA compartidos impulsados por Codex en ChatGPT para equipos. Automatiza flujos de trabajo complejos y de larga duración a través de herramientas como Slack, Google Drive y CRM, funcionando en la nube con controles empresariales.

Hermes Agent logo

Hermes Agent

AI Agents

Hermes Agent is an open-source, self-improving autonomous AI agent by Nous Research that learns from experience, builds reusable skills, maintains persistent cross-session memory, and evolves to become more capable over time.

Open SWE logo

Open SWE

AI Agents

Open SWE is an open-source asynchronous coding agent built by LangChain. It autonomously handles GitHub issues by researching codebases, planning tasks, writing and testing code, self-reviewing, and opening pull requests — acting like a full-time software engineer on your team.

a2a mcp

Search the directory

Find entries, skills, articles, and categories. Use arrow keys to select and Enter to open.