> ## Documentation Index
> Fetch the complete documentation index at: https://private-7c7dfe99-postgresql-tls-support.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# Vision

> Entrada de imágenes y comprensión visual en ClickHouse Agents

export const Image = ({img, alt, size = "lg"}) => {
  const normalizedSize = ["sm", "md", "lg"].includes(size) ? size : "lg";
  return <div className={`ch-image-${normalizedSize}`}>
      <Frame>
        <img src={img} alt={alt} />
      </Frame>
    </div>;
};

export const galaxyOnClick = eventName => () => {
  try {
    if (typeof window !== "undefined" && window.galaxy && eventName) {
      window.galaxy.track(eventName, {
        interaction: "click"
      });
    }
  } catch (e) {}
};

export const BetaBadge = ({link, galaxyTrack, galaxyEvent}) => {
  if (link) {
    return <a href={link} target="_blank" rel="noopener noreferrer" className="betaBadge" onClick={galaxyTrack && galaxyEvent ? galaxyOnClick(galaxyEvent) : undefined}>
                <Icon />
                <span>Beta</span>
            </a>;
  }
  return <div className="betaBadge">
            <Icon />
            <span>
                Funcionalidad beta. 
                <u>
                    <a href="/docs/beta-and-experimental-features#beta-features">
                        Más información.
                    </a>
                </u>
            </span>
        </div>;
};

Vision permite a los usuarios subir imágenes para que un agente las analice. El agente pasa la imagen a un modelo compatible con Vision, que la describe, la resume o responde preguntas sobre su contenido.

<div id="enable-it">
  ## Habilitar las capacidades de Vision
</div>

Vision solo funciona con modelos que admiten entrada de imágenes. Si el modelo seleccionado no admite entrada de imágenes, el control de carga en el editor de mensajes se desactiva. Cambia a un modelo compatible con Vision para volver a habilitarlo.

<div id="use-it">
  ## Usa las capacidades de Vision
</div>

Haz clic en el icono del clip en la esquina inferior izquierda del editor de mensajes y elige **Upload to Provider** para adjuntar una imagen: una captura de pantalla, una foto, un gráfico o un diagrama. Después, haz cualquier pregunta que requiera leer la imagen: *"¿Qué tiene de malo este plan de consulta?"*, *"Transcribe el texto de esta captura de pantalla"* o *"Compara este dashboard con el de la semana pasada."*

<Image img="https://mintcdn.com/private-7c7dfe99-postgresql-tls-support/ie2pnLZPTjmhniJm/images/cloud/agent-builder/vision/vision.webp?fit=max&auto=format&n=ie2pnLZPTjmhniJm&q=85&s=048cd17136f5fc92573cc7d166a78a9c" alt="Editor de mensajes con el menú del clip abierto que muestra las opciones Upload to Provider, Upload as Text y Upload to Code Environment" size="lg" width="3838" height="1936" data-path="images/cloud/agent-builder/vision/vision.webp" />

El agente trata la imagen como parte del contexto del mensaje, así que las preguntas de seguimiento dentro del mismo turno pueden hacer referencia a lo que vio sin tener que volver a subirla.

<div id="combine-with-other-tools">
  ## Combina Vision con otras herramientas
</div>

Vision se complementa bien con el [code interpreter](/es/products/cloud/features/ai-ml/agents/builder/code-interpreter) para analizar imágenes; por ejemplo, el agente extrae números de una captura de pantalla y luego ejecuta Python para calcular totales, y con [web search](/es/products/cloud/features/ai-ml/agents/builder/web-search) cuando una imagen hace referencia a algo que el modelo necesita buscar.
