logo
Entwicklung
Suchen
Multimodale Ein- und Ausgabe und Dateivorschau

Multimodale Ein- und Ausgabe und Dateivorschau

Überblick

Work unterstützt vielfältige multimodale Interaktionen: Benutzer können verschiedene Inhaltstypen wie Bilder, Dokumente und Audio an den Agent senden; die Antworten des Agents können Ausgaben in verschiedenen Formaten wie Code, Dokumente und Diagramme enthalten, die alle Inline-Vorschau und Vollbildansicht unterstützen.


Multimodale Eingabe

Unterstützte Eingabetypen

Inhaltsblock-Typ Beschreibung Beispiel
text Reiner Text Benutzernachricht, Codeausschnitt
image Bild PNG, JPEG, GIF, WebP (base64-kodiert)
document Dokument PDF-Dokument (base64-kodiert)
audio Audio Audiodatei
file_ref Dateiverweis Verweis auf lokalen Dateipfad

Upload-Methoden

  1. Drag-and-Drop-Upload — Datei direkt in den Eingabebereich ziehen
  2. Klick-Upload — auf die Anhangschaltfläche im Eingabebereich klicken und Datei auswählen
  3. Einfügen — Bild aus der Zwischenablage einfügen

Multimodale Eingabe-CN

Anpassung an das Modellformat

Das System konvertiert das Eingabeformat automatisch entsprechend dem aktuell verwendeten LLM-Anbieter:

Anbieter Bild Dokument Audio
Anthropic nativer base64-image-Block nativer base64-document-Block nicht unterstützt
OpenAI image_url (data URI) Herabstufung auf Textbeschreibung nativer audio-Block
DeepSeek nicht unterstützt nicht unterstützt nicht unterstützt

Das System erkennt über die Funktion resolveCapabilities automatisch die multimodalen Fähigkeiten des aktuellen Modells (vision / document / audio). Nicht unterstützte Typen werden dem Benutzer angezeigt oder herabgestuft verarbeitet.


Multimodale Ausgabe und Vorschau

9 Vorschautypen

Die vom Agent ausgegebenen Dateien werden automatisch nach Typ erkannt und als entsprechende Vorschaukomponente gerendert:

Dateityp Vorschaukomponente Funktionsschaltflächen
PDF PdfPreviewWindow Zoom (Vergrößern/Verkleinern/An Breite anpassen), Seitenwechsel, Seitenzahlanzeige
PPT PptPreviewWindow Foliennavigation (Vorherige/Nächste Seite), Zoom
Excel / Word OfficePreviewWindow Zoom, Seitenwechsel
Code CodePreviewWindow Syntaxhervorhebung (mehrsprachig), In Zwischenablage kopieren
Markdown MarkdownPreviewWindow Markdown-Rendervorschau
HTML HtmlPreviewWindow Eingebettetes iframe-Rendering
Bild MediaPreviewWindow Zoom, Ziehen und Verschieben
Video MediaPreviewWindow Wiedergabe/Pause, Fortschrittsleiste, Lautstärkeregelung
Audio MediaPreviewWindow Wiedergabe/Pause, Fortschrittsleiste

Inline-Vorschaukarte

Die vom Agent ausgegebenen Dateien erscheinen zunächst in Form einer Inline-Vorschaukarte (InlinePreviewCard) im Konversationsverlauf:

Inline-Vorschaukarte-CN

Element Beschreibung
Titelleiste Dateiname, Typ-Badge, Aktionsschaltflächen
Miniaturinhalt Vorschau des Dateiinhalts (eingeklappter Zustand, Verlauf am unteren Rand + Hinweis „Mehr anzeigen")
Hover-Effekt Hervorgehobener Rahmen + verstärkter Schatten

Aktionsschaltflächen (Symbol + Tooltip):

Schaltfläche Funktion
Aufklappen Vollbild-Vorschaufenster
Kopieren Inhalt in die Zwischenablage kopieren
Datei-Manager Im System-Datei-Manager anzeigen (nur APP)
Extern öffnen Mit Standardanwendung öffnen (lokale Datei) oder im Browser öffnen (URL)

Vollbild-Vorschaufenster

Klicken Sie auf die Schaltfläche „Aufklappen", um das Vollbild-Vorschaufenster zu öffnen:

Vollbild-Vorschaufenster-CN

Vorschau-Werkzeugleiste (PreviewToolbar):

  • Zoomsteuerung: Vergrößern / Verkleinern / An Breite anpassen
  • Seitennavigation: Vorherige Seite / Nächste Seite (mehrseitige Dokumente)
  • Seitenzahlstatus: Aktuelle Seite / Gesamtseitenzahl

Tastenkürzel:

Tastenkürzel Funktion
+ oder = Vergrößern
- Verkleinern
0 Zoom zurücksetzen
Esc Vorschaufenster schließen

Vorschau-Layoutmodi

Modus Plattform Beschreibung
Overlay (Überlagerung) Standard auf APP Fest positioniertes Overlay-Fenster
Docked (angedockt) Web In das rechte Panel der WorkPage eingebettet

Gemeinsame Fähigkeiten von Web und APP

Die Kernkomponenten der multimodalen Vorschau sind in der claw-shared-Schicht implementiert; Web und APP teilen sich denselben Code:

  • DocumentPreviewModal — Container des Vorschaufensters
  • InlinePreviewCard — Inline-Vorschaukarte
  • PreviewToolbar — Vorschau-Werkzeugleiste
  • previewUtils.ts — Werkzeuge zur Dateityperkennung und zum Laden

Beide Plattformen abstrahieren die Art des Dateizugriffs über die FileAccess-Schnittstelle:

  • APP: Lesen über die lokale Tauri-Datei-API
  • Web: Laden über HTTP-URL oder data-URL


Bedienungsanleitung

So senden Sie Bilder/Dokumente an den Agent

  1. Drag-and-Drop-Upload: Ziehen Sie die Datei direkt vom Desktop oder Datei-Manager in den Work-Eingabebereich
  2. Klick-Upload: Klicken Sie auf die 📎-Anhangschaltfläche links im Eingabebereich und wählen Sie eine Datei aus
  3. Bild einfügen: Kopieren Sie ein Bild und fügen Sie es im Eingabebereich mit Strg+V / Cmd+V ein
  4. Der Anhang erscheint in der Vorschauleiste oberhalb des Eingabebereichs
  5. Geben Sie eine Textbeschreibung ein, was der Agent tun soll (z. B. „Analysiere dieses Bild"), und drücken Sie zum Senden die Eingabetaste

Dateigrößenbeschränkung: Das Read-File-Werkzeug unterstützt Dateien bis maximal 5 MB. Für größere Dateien empfiehlt es sich, diese zunächst in einen Cloud-Speicher hochzuladen und dann den Link bereitzustellen.

So verwenden Sie die Dateivorschau

  1. Wenn die Ausgabe des Agents eine Datei enthält, erscheint im Konversationsverlauf eine Inline-Vorschaukarte
  2. Bewegen Sie den Mauszeiger über die Karte, um weitere Informationen anzuzeigen
  3. Klicken Sie auf die Schaltfläche Aufklappen, um die Vollbildvorschau zu öffnen
  4. Verwenden Sie in der Vollbildvorschau die Werkzeugleiste (Zoom, Seitenwechsel usw.)
  5. Drücken Sie Esc oder klicken Sie auf die Schließen-Schaltfläche, um die Vorschau zu verlassen

Häufig gestellte Fragen

Warum analysiert der Agent das Bild nach dem Senden nicht?

  • Das aktuelle Modell unterstützt möglicherweise keine Vision-Fähigkeit. Prüfen Sie in der Modellkonfiguration, ob das Modell als Vision-fähig markiert ist. Modelle der DeepSeek-Reihe unterstützen keine Bildeingabe.
  • Es wird empfohlen, zu Claude Sonnet 4 oder GPT-4o zu wechseln.

Warum wird nach dem Senden einer PDF nur „nicht unterstützt" zurückgegeben?

  • Die document-Fähigkeit wird derzeit nur von Modellen der Anthropic-Reihe (Claude) nativ unterstützt. Bei Verwendung von OpenAI-Modellen wird die PDF herabgestuft verarbeitet.
  • Alternative: Lassen Sie den Agent das Read-File-Werkzeug verwenden, um den PDF-Dateipfad zu lesen.

Datei wird im Vorschaufenster fehlerhaft angezeigt

  • Stellen Sie sicher, dass das Dateiformat korrekt ist (z. B. darf eine .xlsx-Datei nicht die Endung .csv haben)
  • Sehr große Dateien werden möglicherweise langsam geladen; bitte warten Sie, bis der Ladevorgang abgeschlossen ist
  • Einige Office-Dateien in Spezialformaten müssen möglicherweise in einer externen Anwendung geöffnet werden

Verwandte Dokumente