aboutsummaryrefslogtreecommitdiffstats
path: root/crates/asist-app/src/pipeline.rs
diff options
context:
space:
mode:
authorelvis <elvis@claros.ar>2026-09-06 22:05:14 -0300
committerelvis <elvis@claros.ar>2026-09-06 22:05:14 -0300
commit71764752f28d31028b9c2ca486c0fc1bcea1cf95 (patch)
treeffd463969826157819f5a3319e1895c3f51deb22 /crates/asist-app/src/pipeline.rs
parentf8f98e83481e7376a235fb305a095552433f79ab (diff)
downloadasist-p-71764752f28d31028b9c2ca486c0fc1bcea1cf95.tar.gz
asist-p-71764752f28d31028b9c2ca486c0fc1bcea1cf95.zip
Web search and camera vision
Dos capacidades nuevas en un crate aparte, asist-tools, registradas desde asist-app: son el ejemplo de que el punto de extensión documentado funciona sin tocar el orquestador. Buscar admite tres buscadores intercambiables. Tavily devuelve una respuesta ya redactada, que es lo que se puede leer en voz alta sin gastar otra vuelta del modelo en resumir (0,54 s para «capital de Australia»); ddgs no necesita clave y devuelve fragmentos que el modelo sintetiza (2,24 s). El tercero es un backend de comando genérico: ejecuta un programa y lee JSON de su salida, así que añadir otro buscador —o un puente a un servidor MCP— es escribir un guion. Sobre DuckDuckGo, comprobado y no supuesto: curl contra html.duckduckgo.com devuelve HTTP 202 con una página anti-bot y ni un resultado, y la API sin clave api.duckduckgo.com devuelve vacío para casi todo lo que no sea una entidad de enciclopedia. La librería ddgs —la misma que hay bajo duckduckgo-mcp— sí funciona porque rota buscadores y cabeceras, y es la que usa scripts/buscar-ddgs.sh. Mirar aprovecha que el servidor ya carga el proyector multimodal: el mismo modelo que conversa describe lo que capta la cámara. La pregunta del usuario viaja hasta ahí, porque «¿de qué color es mi camiseta?» y «¿cuánta gente hay?» necesitan la misma imagen y descripciones distintas. La imagen no entra en el historial —cientos de tokens por turno para algo ya descrito— ni toca el disco. Tres cosas más que salieron de medir, en docs/RENDIMIENTO.md: - La resolución de captura manda en la latencia: 7,8 s a 1280x720 frente a 2,9 s a 640x480, con la misma descripción útil. 640x480 pasa a ser el valor por defecto. - Una herramienta ejecutándose en silencio deja el turno seis segundos mudo y parece un cuelgue. Tool::acknowledgement pronuncia una frase antes de ejecutar y baja el primer audio de ~8,4 s a 4,1 s. - Con la instrucción de voz a secas en la pasada de redacción, el modelo anunciaba lo que acababa de hacer en vez de contar lo que averiguó, ignorando el resultado que tenía delante. general.tool_result_prompt lo corrige; ahí sí se puede añadir estilo sin riesgo, porque la llamada ya ocurrió. Con tres herramientas declaradas el modelo elige bien entre ellas (15 de 16 medido), pero le cuesta abstenerse y busca cosas que ya sabe. Intentar corregirlo con instrucciones empeora los aciertos sin reducir los falsos positivos, coherente con la fragilidad ya documentada. Corregido además un fallo que dejaba mudo al asistente tras la primera respuesta: el anillo de reproducción no bajaba nunca su bandera de actividad, así que el segmentador mantenía el micrófono cerrado creyendo que seguía hablando. El segmentador se guía ahora por la cola, que no puede desfasarse, y hay pruebas del anillo con un mando sin dispositivo detrás. Claude-Session: https://claude.ai/code/session_01FNxz5cSdQSscJH9H7b8uGU
Diffstat (limited to 'crates/asist-app/src/pipeline.rs')
-rw-r--r--crates/asist-app/src/pipeline.rs85
1 files changed, 52 insertions, 33 deletions
diff --git a/crates/asist-app/src/pipeline.rs b/crates/asist-app/src/pipeline.rs
index 9e9037e..69fc66a 100644
--- a/crates/asist-app/src/pipeline.rs
+++ b/crates/asist-app/src/pipeline.rs
@@ -67,7 +67,7 @@ impl Pipeline {
config: &Config,
session: Session,
recognizer: Recognizer,
- llm: LlmClient,
+ llm: Arc<LlmClient>,
tts: TtsClient,
tools: ToolRegistry,
playback: PlaybackHandle,
@@ -175,7 +175,11 @@ fn run_segmenter(
}
// El micrófono se cierra mientras suena el altavoz. Con barge-in
// activo no se cierra, sólo sube el listón de volumen.
- segmenter.set_gate(if session.is_speaking() || playback.is_active() {
+ //
+ // La segunda condición mira la cola y no una bandera a propósito: la
+ // cola no puede quedarse desfasada, y una bandera que se olvide de
+ // bajar deja el micrófono cerrado para el resto de la sesión.
+ segmenter.set_gate(if session.is_speaking() || playback.queued_secs() > 0.0 {
Gate::Speaking
} else {
Gate::Open
@@ -253,7 +257,7 @@ fn run_segmenter(
fn run_brain(
config: &Config,
session: Session,
- llm: LlmClient,
+ llm: Arc<LlmClient>,
tools: ToolRegistry,
results: Receiver<AsrResult>,
speak: Sender<SpeakJob>,
@@ -337,6 +341,12 @@ struct Prompts {
/// Para la pasada en que el modelo decide si llamar a una herramienta.
deciding: String,
/// Para redactar la respuesta hablada, ya con los resultados en la mano.
+ ///
+ /// Lleva pegada la orden de usar lo que la herramienta devolvió. Sin ella
+ /// el modelo se limita a anunciar lo que acaba de hacer —«he tomado una
+ /// foto, ahora puedo responderte sobre el objeto o color»— y se deja el
+ /// dato que tenía delante. Aquí sí se puede añadir estilo sin riesgo: la
+ /// llamada ya ocurrió, así que no hay nada que estropear.
speaking: String,
/// `false` cuando no hay herramientas: entonces ambas son la misma.
two_phase: bool,
@@ -352,7 +362,11 @@ impl Prompts {
} else {
speaking.clone()
},
- speaking,
+ speaking: if two_phase {
+ format!("{speaking}\n\n{}", config.general.tool_result_prompt.trim())
+ } else {
+ speaking.clone()
+ },
two_phase,
}
}
@@ -377,6 +391,27 @@ fn answer(
let tools = (!tools.is_empty() && config.tools.enabled).then_some(tools);
let mut splitter = SentenceSplitter::new();
let mut spoken = String::new();
+ // Índice propio, y no el del troceador, porque al flujo de frases se le
+ // cuelan los acuses de las herramientas. El índice 0 marca el primer
+ // sonido del turno, que es de donde se mide la latencia percibida.
+ let mut emitted = 0usize;
+
+ // Manda una frase al sintetizador. Devuelve `false` si el canal se cerró.
+ let say = |index: &mut usize, text: String| -> bool {
+ let _ = events.send(Event::Sentence {
+ turn,
+ index: *index,
+ text: text.clone(),
+ });
+ let job = SpeakJob {
+ turn,
+ index: *index,
+ text,
+ turn_started,
+ };
+ *index += 1;
+ speak.send(job).is_ok()
+ };
for round in 0..=config.llm.max_tool_rounds {
let llm_started = Instant::now();
@@ -403,21 +438,7 @@ fn answer(
// Aquí está el solape: cada frase cerrada sale hacia el
// sintetizador sin esperar al resto de la respuesta.
for sentence in splitter.push(text) {
- let index = splitter.emitted() - 1;
- let _ = events.send(Event::Sentence {
- turn,
- index,
- text: sentence.clone(),
- });
- if speak
- .send(SpeakJob {
- turn,
- index,
- text: sentence,
- turn_started,
- })
- .is_err()
- {
+ if !say(&mut emitted, sentence) {
return false;
}
}
@@ -449,20 +470,9 @@ fn answer(
if outcome.tool_calls.is_empty() {
if let Some(rest) = splitter.flush() {
- let index = splitter.emitted() - 1;
- let _ = events.send(Event::Sentence {
- turn,
- index,
- text: rest.clone(),
- });
- let _ = speak.send(SpeakJob {
- turn,
- index,
- text: rest,
- turn_started,
- });
+ say(&mut emitted, rest);
}
- timer.sentences = splitter.emitted();
+ timer.sentences = emitted;
chat.push(Message::assistant(outcome.text.clone()));
// El turno siguiente vuelve a empezar decidiendo.
if prompts.two_phase {
@@ -500,6 +510,14 @@ fn answer(
name: call.name.clone(),
arguments: call.arguments.clone(),
});
+ // Se dice antes de ejecutar, no después: la gracia es tapar la
+ // espera, y una búsqueda con las dos pasadas del modelo detrás son
+ // seis segundos que sin esto pasan en silencio absoluto.
+ if config.tools.spoken_ack {
+ if let Some(ack) = tools.get(&call.name).and_then(|t| t.acknowledgement()) {
+ say(&mut emitted, ack.to_string());
+ }
+ }
let result = tools.dispatch(call);
let _ = events.send(Event::ToolFinished {
turn,
@@ -553,8 +571,9 @@ fn run_speech(
let Some(job) = job else {
// Sin trabajo: si ya no queda audio, el turno ha terminado de sonar.
if let Some(turn) = speaking_turn {
- if !playback.is_active() || playback.queued_secs() <= 0.0 {
+ if playback.queued_secs() <= 0.0 {
session.set_speaking(false);
+ playback.mark_idle();
speaking_turn = None;
let _ = events.send(Event::AudioFinished { turn });
}