Multimodale Ein- und Ausgabe und Dateivorschau
Überblick
Work unterstützt vielfältige multimodale Interaktionen: Benutzer können verschiedene Inhaltstypen wie Bilder, Dokumente und Audio an den Agent senden; die Antworten des Agents können Ausgaben in verschiedenen Formaten wie Code, Dokumente und Diagramme enthalten, die alle Inline-Vorschau und Vollbildansicht unterstützen.
Multimodale Eingabe
Unterstützte Eingabetypen
| Inhaltsblock-Typ | Beschreibung | Beispiel |
|---|---|---|
text |
Reiner Text | Benutzernachricht, Codeausschnitt |
image |
Bild | PNG, JPEG, GIF, WebP (base64-kodiert) |
document |
Dokument | PDF-Dokument (base64-kodiert) |
audio |
Audio | Audiodatei |
file_ref |
Dateiverweis | Verweis auf lokalen Dateipfad |
Upload-Methoden
- Drag-and-Drop-Upload — Datei direkt in den Eingabebereich ziehen
- Klick-Upload — auf die Anhangschaltfläche im Eingabebereich klicken und Datei auswählen
- Einfügen — Bild aus der Zwischenablage einfügen

Anpassung an das Modellformat
Das System konvertiert das Eingabeformat automatisch entsprechend dem aktuell verwendeten LLM-Anbieter:
| Anbieter | Bild | Dokument | Audio |
|---|---|---|---|
| Anthropic | nativer base64-image-Block | nativer base64-document-Block | nicht unterstützt |
| OpenAI | image_url (data URI) | Herabstufung auf Textbeschreibung | nativer audio-Block |
| DeepSeek | nicht unterstützt | nicht unterstützt | nicht unterstützt |
Das System erkennt über die Funktion resolveCapabilities automatisch die multimodalen Fähigkeiten des aktuellen Modells (vision / document / audio). Nicht unterstützte Typen werden dem Benutzer angezeigt oder herabgestuft verarbeitet.
Multimodale Ausgabe und Vorschau
9 Vorschautypen
Die vom Agent ausgegebenen Dateien werden automatisch nach Typ erkannt und als entsprechende Vorschaukomponente gerendert:
| Dateityp | Vorschaukomponente | Funktionsschaltflächen |
|---|---|---|
| PdfPreviewWindow | Zoom (Vergrößern/Verkleinern/An Breite anpassen), Seitenwechsel, Seitenzahlanzeige | |
| PPT | PptPreviewWindow | Foliennavigation (Vorherige/Nächste Seite), Zoom |
| Excel / Word | OfficePreviewWindow | Zoom, Seitenwechsel |
| Code | CodePreviewWindow | Syntaxhervorhebung (mehrsprachig), In Zwischenablage kopieren |
| Markdown | MarkdownPreviewWindow | Markdown-Rendervorschau |
| HTML | HtmlPreviewWindow | Eingebettetes iframe-Rendering |
| Bild | MediaPreviewWindow | Zoom, Ziehen und Verschieben |
| Video | MediaPreviewWindow | Wiedergabe/Pause, Fortschrittsleiste, Lautstärkeregelung |
| Audio | MediaPreviewWindow | Wiedergabe/Pause, Fortschrittsleiste |
Inline-Vorschaukarte
Die vom Agent ausgegebenen Dateien erscheinen zunächst in Form einer Inline-Vorschaukarte (InlinePreviewCard) im Konversationsverlauf:

| Element | Beschreibung |
|---|---|
| Titelleiste | Dateiname, Typ-Badge, Aktionsschaltflächen |
| Miniaturinhalt | Vorschau des Dateiinhalts (eingeklappter Zustand, Verlauf am unteren Rand + Hinweis „Mehr anzeigen") |
| Hover-Effekt | Hervorgehobener Rahmen + verstärkter Schatten |
Aktionsschaltflächen (Symbol + Tooltip):
| Schaltfläche | Funktion |
|---|---|
| Aufklappen | Vollbild-Vorschaufenster |
| Kopieren | Inhalt in die Zwischenablage kopieren |
| Datei-Manager | Im System-Datei-Manager anzeigen (nur APP) |
| Extern öffnen | Mit Standardanwendung öffnen (lokale Datei) oder im Browser öffnen (URL) |
Vollbild-Vorschaufenster
Klicken Sie auf die Schaltfläche „Aufklappen", um das Vollbild-Vorschaufenster zu öffnen:

Vorschau-Werkzeugleiste (PreviewToolbar):
- Zoomsteuerung: Vergrößern / Verkleinern / An Breite anpassen
- Seitennavigation: Vorherige Seite / Nächste Seite (mehrseitige Dokumente)
- Seitenzahlstatus: Aktuelle Seite / Gesamtseitenzahl
Tastenkürzel:
| Tastenkürzel | Funktion |
|---|---|
+ oder = |
Vergrößern |
- |
Verkleinern |
0 |
Zoom zurücksetzen |
Esc |
Vorschaufenster schließen |
Vorschau-Layoutmodi
| Modus | Plattform | Beschreibung |
|---|---|---|
| Overlay (Überlagerung) | Standard auf APP | Fest positioniertes Overlay-Fenster |
| Docked (angedockt) | Web | In das rechte Panel der WorkPage eingebettet |
Gemeinsame Fähigkeiten von Web und APP
Die Kernkomponenten der multimodalen Vorschau sind in der claw-shared-Schicht implementiert; Web und APP teilen sich denselben Code:
DocumentPreviewModal— Container des VorschaufenstersInlinePreviewCard— Inline-VorschaukartePreviewToolbar— Vorschau-WerkzeugleistepreviewUtils.ts— Werkzeuge zur Dateityperkennung und zum Laden
Beide Plattformen abstrahieren die Art des Dateizugriffs über die FileAccess-Schnittstelle:
- APP: Lesen über die lokale Tauri-Datei-API
- Web: Laden über HTTP-URL oder data-URL
Bedienungsanleitung
So senden Sie Bilder/Dokumente an den Agent
- Drag-and-Drop-Upload: Ziehen Sie die Datei direkt vom Desktop oder Datei-Manager in den Work-Eingabebereich
- Klick-Upload: Klicken Sie auf die 📎-Anhangschaltfläche links im Eingabebereich und wählen Sie eine Datei aus
- Bild einfügen: Kopieren Sie ein Bild und fügen Sie es im Eingabebereich mit Strg+V / Cmd+V ein
- Der Anhang erscheint in der Vorschauleiste oberhalb des Eingabebereichs
- Geben Sie eine Textbeschreibung ein, was der Agent tun soll (z. B. „Analysiere dieses Bild"), und drücken Sie zum Senden die Eingabetaste
Dateigrößenbeschränkung: Das Read-File-Werkzeug unterstützt Dateien bis maximal 5 MB. Für größere Dateien empfiehlt es sich, diese zunächst in einen Cloud-Speicher hochzuladen und dann den Link bereitzustellen.
So verwenden Sie die Dateivorschau
- Wenn die Ausgabe des Agents eine Datei enthält, erscheint im Konversationsverlauf eine Inline-Vorschaukarte
- Bewegen Sie den Mauszeiger über die Karte, um weitere Informationen anzuzeigen
- Klicken Sie auf die Schaltfläche Aufklappen, um die Vollbildvorschau zu öffnen
- Verwenden Sie in der Vollbildvorschau die Werkzeugleiste (Zoom, Seitenwechsel usw.)
- Drücken Sie Esc oder klicken Sie auf die Schließen-Schaltfläche, um die Vorschau zu verlassen
Häufig gestellte Fragen
Warum analysiert der Agent das Bild nach dem Senden nicht?
- Das aktuelle Modell unterstützt möglicherweise keine Vision-Fähigkeit. Prüfen Sie in der Modellkonfiguration, ob das Modell als Vision-fähig markiert ist. Modelle der DeepSeek-Reihe unterstützen keine Bildeingabe.
- Es wird empfohlen, zu Claude Sonnet 4 oder GPT-4o zu wechseln.
Warum wird nach dem Senden einer PDF nur „nicht unterstützt" zurückgegeben?
- Die document-Fähigkeit wird derzeit nur von Modellen der Anthropic-Reihe (Claude) nativ unterstützt. Bei Verwendung von OpenAI-Modellen wird die PDF herabgestuft verarbeitet.
- Alternative: Lassen Sie den Agent das Read-File-Werkzeug verwenden, um den PDF-Dateipfad zu lesen.
Datei wird im Vorschaufenster fehlerhaft angezeigt
- Stellen Sie sicher, dass das Dateiformat korrekt ist (z. B. darf eine .xlsx-Datei nicht die Endung .csv haben)
- Sehr große Dateien werden möglicherweise langsam geladen; bitte warten Sie, bis der Ladevorgang abgeschlossen ist
- Einige Office-Dateien in Spezialformaten müssen möglicherweise in einer externen Anwendung geöffnet werden
Verwandte Dokumente
- Work-Konversationsüberblick — Oberflächenlayout und Einstiegspunkte
- Konversationsinteraktion — Nachrichtenfluss und Sitzungsverwaltung
- Werkzeugverwaltung — Dateiausgabefähigkeit von Werkzeugen
