Entrada y salida multimodal y vista previa de archivos
Descripción general
Work admite interacciones multimodales enriquecidas: los usuarios pueden enviar contenido de diversos tipos al Agente, como imágenes, documentos y audio; las respuestas del Agente pueden incluir salidas en múltiples formatos, como código, documentos y gráficos, todos ellos compatibles con la vista previa en línea y la visualización a pantalla completa.
Entrada multimodal
Tipos de entrada admitidos
| Tipo de bloque de contenido | Descripción | Ejemplo |
|---|---|---|
text |
Texto sin formato | Mensaje de usuario, fragmento de código |
image |
Imagen | PNG, JPEG, GIF, WebP (codificación base64) |
document |
Documento | Documento PDF (codificación base64) |
audio |
Audio | Archivo de audio |
file_ref |
Referencia de archivo | Referencia a ruta de archivo local |
Métodos de carga
- Carga por arrastre — arrastra el archivo directamente al área de entrada
- Carga por clic — haz clic en el botón de adjuntar del área de entrada y selecciona el archivo
- Pegar — pega una imagen desde el portapapeles

Adaptación del formato del modelo
El sistema convierte automáticamente el formato de entrada según el proveedor de LLM que se esté utilizando:
| Proveedor | Imagen | Documento | Audio |
|---|---|---|---|
| Anthropic | Bloque image base64 nativo | Bloque document base64 nativo | No admitido |
| OpenAI | image_url (data URI) | Degradado a descripción de texto | Bloque audio nativo |
| DeepSeek | No admitido | No admitido | No admitido |
El sistema detecta automáticamente las capacidades multimodales del modelo actual (vision / document / audio) mediante la función resolveCapabilities; los tipos no admitidos se notifican al usuario o se procesan de forma degradada.
Salida multimodal y vista previa
9 tipos de vista previa
Los archivos generados por el Agente se identifican automáticamente por tipo y se renderizan con el componente de vista previa correspondiente:
| Tipo de archivo | Componente de vista previa | Botones de función |
|---|---|---|
| PdfPreviewWindow | Zoom (ampliar/reducir/ajustar al ancho), paso de páginas, visualización del número de página | |
| PPT | PptPreviewWindow | Navegación de diapositivas (anterior/siguiente), zoom |
| Excel / Word | OfficePreviewWindow | Zoom, paso de páginas |
| Código | CodePreviewWindow | Resaltado de sintaxis (multilenguaje), copiar al portapapeles |
| Markdown | MarkdownPreviewWindow | Vista previa de renderizado Markdown |
| HTML | HtmlPreviewWindow | Renderizado en iframe incrustado |
| Imagen | MediaPreviewWindow | Zoom, arrastre y desplazamiento |
| Vídeo | MediaPreviewWindow | Reproducir/pausar, barra de progreso, control de volumen |
| Audio | MediaPreviewWindow | Reproducir/pausar, barra de progreso |
Tarjeta de vista previa en línea
Los archivos generados por el Agente aparecen primero en el flujo de conversación en forma de tarjeta de vista previa en línea (InlinePreviewCard):

| Elemento | Descripción |
|---|---|
| Barra de título | Nombre del archivo, insignia de tipo, botones de acción |
| Contenido en miniatura | Vista previa del contenido del archivo (estado plegado, degradado inferior + indicación "Mostrar más") |
| Efecto al pasar el cursor | Borde resaltado + elevación de sombra |
Botones de acción (icono + información sobre herramientas):
| Botón | Función |
|---|---|
| Expandir | Ventana de vista previa a pantalla completa |
| Copiar | Copiar el contenido al portapapeles |
| Explorador de archivos | Mostrar en el explorador de archivos del sistema (solo APP) |
| Abrir externamente | Abrir con la aplicación predeterminada (archivo local) o en el navegador (URL) |
Ventana de vista previa a pantalla completa
Haz clic en el botón "Expandir" para entrar en la ventana de vista previa a pantalla completa:

Barra de herramientas de vista previa (PreviewToolbar):
- Control de zoom: ampliar / reducir / ajustar al ancho
- Navegación de páginas: página anterior / página siguiente (documentos de varias páginas)
- Estado del número de página: página actual / número total de páginas
Atajos de teclado:
| Atajo | Función |
|---|---|
+ o = |
Ampliar |
- |
Reducir |
0 |
Restablecer zoom |
Esc |
Cerrar la ventana de vista previa |
Modos de disposición de la vista previa
| Modo | Plataforma | Descripción |
|---|---|---|
| Overlay (superposición) | Predeterminado en APP | Ventana de superposición con posición fija |
| Docked (anclado) | Web | Incrustado en el panel derecho de WorkPage |
Capacidades compartidas entre Web y APP
Los componentes centrales de la vista previa multimodal se implementan en la capa claw-shared, y Web y APP comparten el mismo conjunto de código:
DocumentPreviewModal— contenedor de la ventana de vista previaInlinePreviewCard— tarjeta de vista previa en líneaPreviewToolbar— barra de herramientas de vista previapreviewUtils.ts— herramienta de identificación de tipo de archivo y carga
Ambas plataformas abstraen la forma de lectura de archivos mediante la interfaz FileAccess:
- Plataforma APP: lectura mediante la API de archivos locales de Tauri
- Plataforma Web: carga mediante URL HTTP o data URL
Guía de operaciones
Cómo enviar imágenes/documentos al Agente
- Carga por arrastre: arrastra el archivo desde el escritorio o el explorador de archivos directamente al área de entrada de Work
- Carga por clic: haz clic en el botón de adjuntar 📎 situado a la izquierda del área de entrada y selecciona el archivo
- Pegar imagen: copia la imagen y luego pégala en el área de entrada con Ctrl+V / Cmd+V
- Los archivos adjuntos aparecen en la barra de vista previa situada encima del área de entrada
- Escribe una descripción de texto de lo que quieres que haga el Agente (por ejemplo, "analiza esta imagen") y pulsa Enter para enviar
Límite de tamaño de archivo: la herramienta Read File admite archivos de hasta 5 MB. Para archivos más grandes, se recomienda subirlos primero a un almacenamiento en la nube y proporcionar el enlace.
Cómo usar la vista previa de archivos
- Cuando la salida del Agente incluye archivos, aparece una tarjeta de vista previa en línea en el flujo de conversación
- Pasa el cursor sobre la tarjeta para ver más información
- Haz clic en el botón Expandir para entrar en la vista previa a pantalla completa
- En la vista previa a pantalla completa, usa la barra de herramientas para operar (zoom, paso de páginas, etc.)
- Pulsa Esc o haz clic en el botón de cerrar para salir de la vista previa
Preguntas frecuentes
¿Por qué el Agente no analiza la imagen después de enviarla?
- Es posible que el modelo actual no admita la capacidad vision. Comprueba en la configuración de modelos si el modelo está marcado con soporte de vision. Los modelos de la serie DeepSeek no admiten la entrada de imágenes.
- Se recomienda cambiar a Claude Sonnet 4 o GPT-4o.
¿Por qué al enviar un PDF solo se devuelve "No admitido"?
- La capacidad document actualmente solo es compatible de forma nativa con los modelos de la serie Anthropic (Claude). Al usar modelos de OpenAI, el PDF se procesa de forma degradada.
- Solución alternativa: haz que el Agente utilice la herramienta Read File para leer la ruta del archivo PDF.
El archivo se muestra de forma anómala en la ventana de vista previa
- Confirma que el formato del archivo sea correcto (por ejemplo, un archivo .xlsx no puede tener la extensión .csv)
- Los archivos muy grandes pueden cargarse lentamente; espera a que finalice la carga
- Algunos archivos de Office con formatos especiales pueden requerir abrirse en una aplicación externa
Documentos relacionados
- Descripción general de la conversación de Work — disposición de la interfaz y puntos de acceso
- Interacción de conversación — flujo de mensajes y gestión de sesiones
- Gestión de herramientas — capacidad de salida de archivos de las herramientas
