Zum Inhalt springen

Anleitung zum Starten

GitHub

Sie können unser AI-gestütztes Setup verwenden, um das Plugin zu installieren. Fügen Sie die Capgo-Fähigkeiten zu Ihrem AI-Tool hinzu, indem Sie folgenden Befehl ausführen:

Terminal-Fenster
npx skills add https://github.com/Cap-go/capgo-skills --skill capacitor-plugins

Verwenden Sie dann die folgende Anfrage:

Use the `capacitor-plugins` skill from `Cap-go/capgo-skills` to install the `@capgo/capacitor-speech-recognition` plugin in my project.

Wenn Sie die manuelle Einrichtung bevorzugen, installieren Sie das Plugin, indem Sie die folgenden Befehle ausführen und die unten angegebenen Plattform-spezifischen Anweisungen befolgen:

Terminalfenster
bun add @capgo/capacitor-speech-recognition
bunx cap sync
import { SpeechRecognition } from '@capgo/capacitor-speech-recognition';

Überprüft, ob die native Spracherkennungsdienstleistung auf dem aktuellen Gerät verfügbar ist.

import { SpeechRecognition } from '@capgo/capacitor-speech-recognition';
await SpeechRecognition.available();

Überprüft, ob die Plattform die neueren on-Device-Erkennungspfade für die ausgewählte Region verfügbar macht.

Dies ist die Fähigkeitsprüfung, die Sie vor der Aktivierung verwenden sollten. useOnDeviceRecognition. A true Ein Ergebnis bedeutet, dass das aktuelle Gerät, die Betriebssystemversion und die Region den neuen on-Device-Pfad für diese Plattform verwenden können.

Gibt zurück false wenn das Gerät nur den Legacy-Recognizer-Pfad unterstützt.

Plattform SDK Dokumentation: iOS: Sprache Android: Sprechverarbeitung

import { SpeechRecognition } from '@capgo/capacitor-speech-recognition';
await SpeechRecognition.isOnDeviceRecognitionAvailable();

Beginnt mit der Aufnahme von Audio und der Transkription von Sprache.

Wenn partialResults ist true, wird die zurückgegebene Promise sofort aufgelöst und die Updates werden bis zum Ende der Sitzung durch den partialResults Listener gestreamt.

Der Standardpfad hält die legacy-Recognizer-Verhaltensweise für die Rückwärtskompatibilität aufrecht. Passen Sie dies nur nach der Überprüfung an. useOnDeviceRecognition: true Zwischenablage kopieren

import { SpeechRecognition } from '@capgo/capacitor-speech-recognition';
await SpeechRecognition.start();

Hört auf und zerlegt native Ressourcen.

import { SpeechRecognition } from '@capgo/capacitor-speech-recognition';
await SpeechRecognition.stop();

Zwingt den aktuellen Sitzung zu beenden.

Bei Android wird zunächst ein normaler Stop versucht und dann fällt man auf destroy/recreate zurück nach timeout. Bei iOS wird der aktuelle Sitzung sofort gestoppt.

Wenn ein Teiltranskript im Cache ist, wird es über den partialResults Hörer mit forced: true.

import { SpeechRecognition } from '@capgo/capacitor-speech-recognition';
await SpeechRecognition.forceStop();

Erhält den letzten im Cache gespeicherten Teiltranskriptionsresultat.

import { SpeechRecognition } from '@capgo/capacitor-speech-recognition';
await SpeechRecognition.getLastPartialResult();

Aktualisiert den aktuellen Zustand der Sprach-zu-Sprache-Taste.

Verwenden Sie dies zusammen mit continuousPTT oder mit einer benutzerdefinierten Halte-zu-Sprechen-Fluss.

import { SpeechRecognition } from '@capgo/capacitor-speech-recognition';
await SpeechRecognition.setPTTState({} as PTTStateOptions);

Ermittelt die von dem zugrunde liegenden Recognizer unterstützten Ländercodes.

Android-Geräte ab Version 13 offenbaren diese Liste nicht mehr; in diesem Fall ist sie leer. languages Zur Zwischenablage kopieren

import { SpeechRecognition } from '@capgo/capacitor-speech-recognition';
await SpeechRecognition.getSupportedLanguages();

Abschnitt mit dem Titel “setPTTState”

import { SpeechRecognition } from '@capgo/capacitor-speech-recognition';
await SpeechRecognition.isListening();

Ermittelt den aktuellen Zustand der Berechtigungen.

import { SpeechRecognition } from '@capgo/capacitor-speech-recognition';
await SpeechRecognition.checkPermissions();

Bittet um die Berechtigungen für das Mikrofon und die Sprachverarbeitung.

import { SpeechRecognition } from '@capgo/capacitor-speech-recognition';
await SpeechRecognition.requestPermissions();
export interface SpeechRecognitionAvailability {
available: boolean;
}

Konfigurieren Sie, wie der Recognizer verhält, wenn er aufgerufen wird.

export interface SpeechRecognitionStartOptions {
/**
* Locale identifier such as `en-US`. When omitted the device language is used.
*/
language?: string;
/**
* Maximum number of final matches returned by native APIs. Defaults to `5`.
*/
maxResults?: number;
/**
* Prompt message shown inside the Android system dialog (ignored on iOS).
*/
prompt?: string;
/**
* When `true`, Android shows the OS speech dialog instead of running inline recognition.
* Defaults to `false`.
*/
popup?: boolean;
/**
* Emits partial transcription updates through the `partialResults` listener while audio is captured.
*/
partialResults?: boolean;
/**
* Enables native punctuation handling where supported (iOS 16+).
*/
addPunctuation?: boolean;
/**
* Opt in to the platform's newer on-device recognition path when available.
*
* On iOS 26+, this uses Apple's `SpeechAnalyzer` / `SpeechTranscriber` pipeline.
* On recent Android versions, this uses the on-device `SpeechRecognizer` path.
*
* It is intentionally opt-in so existing apps keep the legacy flow unless they choose
* to roll out the new behavior.
*
* Use {@link SpeechRecognitionPlugin.isOnDeviceRecognitionAvailable} before enabling it in production.
*
* Platform SDK docs:
* iOS: [Speech](https://developer.apple.com/documentation/speech),
* [SpeechAnalyzer](https://developer.apple.com/documentation/speech/speechanalyzer),
* [SpeechTranscriber](https://developer.apple.com/documentation/speech/speechtranscriber)
* Android: [SpeechRecognizer](https://developer.android.com/reference/android/speech/SpeechRecognizer)
*
* Defaults to `false`.
*/
useOnDeviceRecognition?: boolean;
/**
* Allow a number of milliseconds of silence before splitting the recognition session into segments.
* Required to be greater than zero and currently supported on Android only.
*/
allowForSilence?: number;
/**
* EXPERIMENTAL: Keep a PTT session alive across silence by restarting recognition while the button stays held.
*
* This restart behavior is implemented for Android inline recognition and iOS native recognition.
*/
continuousPTT?: boolean;
}
export interface SpeechRecognitionMatches {
matches?: string[];
}

Optionen für .

export interface ForceStopOptions {
/**
* Android only: timeout in milliseconds before forcing stop via destroy/recreate.
*
* On iOS, the current session is stopped immediately and this value is ignored.
*
* Defaults to `1500`.
*/
timeout?: number;
}

Ergebnis von .

export interface LastPartialResult {
/**
* Whether a partial result is currently cached.
*/
available: boolean;
/**
* The most recent transcript text known to the native recognizer.
*/
text: string;
/**
* All current match alternatives when available.
*/
matches?: string[];
}

Optionen für .

export interface PTTStateOptions {
/**
* Whether the PTT button is currently held.
*/
held: boolean;
}
export interface SpeechRecognitionLanguages {
languages: string[];
}
export interface SpeechRecognitionListening {
listening: boolean;
}

Berechtigungsmappe, die von checkPermissions und requestPermissions.

export interface SpeechRecognitionPermissionStatus {
speechRecognition: PermissionState;
}

Ausgelöst, sobald ein segmentiertes Ergebnis erzeugt wird (nur Android).

export interface SpeechRecognitionSegmentResultEvent {
matches: string[];
}

Wird ausgelöst, sobald eine teilweise Transkription erstellt wird.

export interface SpeechRecognitionPartialResultEvent {
/**
* Current recognition matches when the native recognizer reports them.
*
* This can be omitted for forced or accumulated-only payloads.
*/
matches?: string[];
/**
* Accumulated transcription from earlier continuous PTT cycles.
*/
accumulated?: string;
/**
* Final accumulated text including the current result.
*/
accumulatedText?: string;
/**
* `true` when the plugin is restarting recognition inside a continuous PTT session.
*/
isRestarting?: boolean;
/**
* `true` when the payload was emitted by `forceStop()`.
*/
forced?: boolean;
}

Wird ausgelöst, wenn sich der Zustand des Abhörens ändert.

export interface SpeechRecognitionListeningEvent {
/**
* Finite state of the recognition session.
*/
state?: ListeningFiniteState;
/**
* Unique identifier for the current listening session.
*/
sessionId?: number;
/**
* Why this state transition occurred.
*/
reason?: ListeningReason;
/**
* Error code when the transition is caused by an error.
*/
errorCode?: string;
/**
* Backward-compatible binary state used by earlier releases.
*/
status?: 'started' | 'stopped';
}

Diese Seite wird von dem Plugin generiert. src/definitions.tsRe-run die Synchronisierung, wenn die öffentliche API upstream geändert wird.

Wenn Sie diese Funktion verwenden Einstieg um das Dashboard und die API-Funktionen zu planen, verbinden Sie es mit Mit @capgo/capacitor-Sprachverarbeitung für die native Fähigkeit in Mit @capgo/capacitor-Sprachverarbeitung Übersicht über API für die Implementierungsdetails in Übersicht über API Einführung für die Implementierungsdetails in Einführung Schlüssel von API für die Implementierungsdetails in Schlüssel von API Geräte für die Implementierungsdetails in Geräten.