aboutsummaryrefslogtreecommitdiffstats
path: root/scripts/capturar-pantalla.sh
diff options
context:
space:
mode:
authorelvis <elvis@claros.ar>2026-09-08 10:14:15 -0300
committerelvis <elvis@claros.ar>2026-09-08 10:14:15 -0300
commitfb5f3bd47a87d3a93a88175af174a3a89f7a4bfe (patch)
treeaa9d17eeacd66343cc94bb8cf440715c1f5f9b18 /scripts/capturar-pantalla.sh
parent71764752f28d31028b9c2ca486c0fc1bcea1cf95 (diff)
downloadasist-p-fb5f3bd47a87d3a93a88175af174a3a89f7a4bfe.tar.gz
asist-p-fb5f3bd47a87d3a93a88175af174a3a89f7a4bfe.zip
Screen vision
Cuarta herramienta: captura la pantalla y responde sobre lo que hay en ella. Aprovecha el mismo proyector multimodal que ya usaba la cámara. Como las dos hacen lo mismo —conseguir un JPEG, preguntarle al modelo, devolver texto— y sólo cambian en de dónde salen los píxeles, se unifican tras VisionTool y un trait FrameSource. La captura vive en scripts/capturar- pantalla.sh, que detecta grim, spectacle, maim, ImageMagick o scrot y reduce con ffmpeg: añadir un compositor es editar el guion, no recompilar. El ajuste que decide todo es la resolución, y no coincide con la de la cámara porque el problema no es el mismo: una escena se entiende, un texto hay que leerlo. Medido con tipografía de interfaz de 13 px y preguntando por datos concretos, a 1280 px acierta 3 de 3 en 7,6 s; a 960, 2 de 3; a 640, 1 de 3. Y a 640 px no falla diciendo que no lee: dijo que el error era «no se pudo abrir el archivo involution» y que la reunión era «a las 10:00», cuando ponía /dev/video0 y 15:30. Para un asistente de voz, decir una hora equivocada con aplomo es peor que tardar cuatro segundos más, así que 1280 px por defecto aunque cueste el triple que la cámara. Al prompt se le añade además que no complete lo que no se distinga, y funciona: en una prueba real contestó que el texto de la barra de direcciones era ilegible en vez de inventárselo. Con cuatro herramientas declaradas el riesgo era confundir pantalla con cámara. No pasa: 18 de 20, con cero confusiones entre ambas. Corregido de paso un fallo del lanzador de procesos que la captura destapó. Esperaba con try_wait en bucle sin vaciar las tuberías, así que un hijo que escribiera más de los 64 KB del búfer se quedaba bloqueado y moría por plazo vencido aunque estuviera trabajando. Los tres usos anteriores cabían de sobra —una fecha, un JSON, un fotograma de 9 KB—; la primera captura, de 174 KB, no. Ahora se vacían en hilos aparte, con una prueba por tubería. Ese lanzador es además nuevo: había tres copias del mismo patrón —plazo máximo, sin shell de por medio, distinguir fallo de cuelgue— en la shell, la búsqueda y la cámara. Ahora está una sola vez en asist_core::proc. Claude-Session: https://claude.ai/code/session_01KSfMfDsRwNAaXcCA6V5RTe
Diffstat (limited to 'scripts/capturar-pantalla.sh')
-rwxr-xr-xscripts/capturar-pantalla.sh52
1 files changed, 52 insertions, 0 deletions
diff --git a/scripts/capturar-pantalla.sh b/scripts/capturar-pantalla.sh
new file mode 100755
index 0000000..6d865a0
--- /dev/null
+++ b/scripts/capturar-pantalla.sh
@@ -0,0 +1,52 @@
+#!/usr/bin/env bash
+# Captura la pantalla y escribe un JPEG por la salida estándar.
+#
+# scripts/capturar-pantalla.sh [ancho] [salida]
+#
+# ancho Ancho al que reducir la captura. Por defecto 1280, que es el
+# mínimo medido para que el modelo lea texto de interfaz sin
+# inventárselo (ver docs/RENDIMIENTO.md).
+# salida Monitor concreto. Vacío = todo lo que haya.
+#
+# Está fuera del binario para que añadir un entorno gráfico nuevo sea editar
+# este guion y no recompilar. La detección va de más específico a más general.
+set -euo pipefail
+
+ANCHO="${1:-1280}"
+SALIDA="${2:-}"
+
+falta() { echo "no hay con qué capturar la pantalla: $1" >&2; exit 1; }
+
+# El escalado se hace aquí y no en el binario: reducir antes de mandar la
+# imagen al modelo es lo que baja el coste de 23 s a 7 s, y ffmpeg ya hace
+# falta para la cámara.
+reducir() {
+ if command -v ffmpeg >/dev/null 2>&1; then
+ ffmpeg -hide_banner -loglevel error -i - \
+ -vf "scale=${ANCHO}:-2:flags=lanczos" -q:v 3 -f image2 -c:v mjpeg -
+ else
+ cat # sin ffmpeg se manda a tamaño completo: lento, pero funciona
+ fi
+}
+
+if [ -n "${WAYLAND_DISPLAY:-}" ] && command -v grim >/dev/null 2>&1; then
+ # wlroots: Hyprland, Sway, river… grim escribe a stdout con «-».
+ if [ -n "$SALIDA" ]; then
+ grim -t png -o "$SALIDA" - | reducir
+ else
+ grim -t png - | reducir
+ fi
+elif [ -n "${WAYLAND_DISPLAY:-}" ] && command -v spectacle >/dev/null 2>&1; then
+ TMP=$(mktemp --suffix=.png); trap 'rm -f "$TMP"' EXIT
+ spectacle -b -n -f -o "$TMP" >/dev/null 2>&1
+ reducir < "$TMP"
+elif [ -n "${DISPLAY:-}" ] && command -v maim >/dev/null 2>&1; then
+ maim --format=png /dev/stdout | reducir
+elif [ -n "${DISPLAY:-}" ] && command -v import >/dev/null 2>&1; then
+ # ImageMagick, presente en casi cualquier X11.
+ import -silent -window root png:- | reducir
+elif [ -n "${DISPLAY:-}" ] && command -v scrot >/dev/null 2>&1; then
+ scrot -o /dev/stdout | reducir
+else
+ falta "instala grim (Wayland) o maim/imagemagick (X11)"
+fi