From fb5f3bd47a87d3a93a88175af174a3a89f7a4bfe Mon Sep 17 00:00:00 2001 From: elvis Date: Tue, 8 Sep 2026 10:14:15 -0300 Subject: Screen vision MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit Cuarta herramienta: captura la pantalla y responde sobre lo que hay en ella. Aprovecha el mismo proyector multimodal que ya usaba la cámara. Como las dos hacen lo mismo —conseguir un JPEG, preguntarle al modelo, devolver texto— y sólo cambian en de dónde salen los píxeles, se unifican tras VisionTool y un trait FrameSource. La captura vive en scripts/capturar- pantalla.sh, que detecta grim, spectacle, maim, ImageMagick o scrot y reduce con ffmpeg: añadir un compositor es editar el guion, no recompilar. El ajuste que decide todo es la resolución, y no coincide con la de la cámara porque el problema no es el mismo: una escena se entiende, un texto hay que leerlo. Medido con tipografía de interfaz de 13 px y preguntando por datos concretos, a 1280 px acierta 3 de 3 en 7,6 s; a 960, 2 de 3; a 640, 1 de 3. Y a 640 px no falla diciendo que no lee: dijo que el error era «no se pudo abrir el archivo involution» y que la reunión era «a las 10:00», cuando ponía /dev/video0 y 15:30. Para un asistente de voz, decir una hora equivocada con aplomo es peor que tardar cuatro segundos más, así que 1280 px por defecto aunque cueste el triple que la cámara. Al prompt se le añade además que no complete lo que no se distinga, y funciona: en una prueba real contestó que el texto de la barra de direcciones era ilegible en vez de inventárselo. Con cuatro herramientas declaradas el riesgo era confundir pantalla con cámara. No pasa: 18 de 20, con cero confusiones entre ambas. Corregido de paso un fallo del lanzador de procesos que la captura destapó. Esperaba con try_wait en bucle sin vaciar las tuberías, así que un hijo que escribiera más de los 64 KB del búfer se quedaba bloqueado y moría por plazo vencido aunque estuviera trabajando. Los tres usos anteriores cabían de sobra —una fecha, un JSON, un fotograma de 9 KB—; la primera captura, de 174 KB, no. Ahora se vacían en hilos aparte, con una prueba por tubería. Ese lanzador es además nuevo: había tres copias del mismo patrón —plazo máximo, sin shell de por medio, distinguir fallo de cuelgue— en la shell, la búsqueda y la cámara. Ahora está una sola vez en asist_core::proc. Claude-Session: https://claude.ai/code/session_01KSfMfDsRwNAaXcCA6V5RTe --- config/asistente.toml | 24 ++++++++++++++++++++++++ 1 file changed, 24 insertions(+) (limited to 'config') diff --git a/config/asistente.toml b/config/asistente.toml index a219142..a4f7e5e 100644 --- a/config/asistente.toml +++ b/config/asistente.toml @@ -172,6 +172,30 @@ timeout_secs = 15 # Ponle una carpeta sólo para depurar qué está viendo el modelo. save_dir = "" +# Mirar la pantalla. Es la misma visión que la cámara, pero con un ajuste +# distinto porque el problema es distinto: una pantalla es TEXTO. +# +# Medido con tipografía de interfaz de 13 px, preguntando por datos concretos: +# 1280 px 7,6 s acierta 3 de 3 +# 960 px 4,5 s acierta 2 de 3 +# 640 px 2,4 s acierta 1 de 3 +# +# Y cuando falla no dice que no lo lee: se lo inventa. A 640 px contestó que el +# error era «no se pudo abrir el archivo involution» y que la reunión era «a +# las 10:00»; ninguna de las dos cosas estaba en la imagen. Por eso 1280 aunque +# cueste el triple que la cámara. +[screen] +enabled = true +# Detecta el entorno gráfico (grim en Wayland, maim/imagemagick en X11), captura +# y reduce a {ancho}. Editar el guion es más fácil que recompilar. +command = ["../scripts/capturar-pantalla.sh", "{ancho}", "{salida}"] +width = 1280 +output = "" # monitor concreto; vacío = todo +timeout_secs = 20 +# Vacío = no se guarda ninguna captura. Aquí pesa más que en la cámara: en una +# captura de pantalla caben contraseñas, mensajes privados y correo abierto. +save_dir = "" + [supervisor] manage = true # lanzar los servidores; --no-manage los supone arriba startup_timeout_secs = 180 -- cgit v1.2.3