Forumnyheter:

På grund av kraftiga återkommande överbelastningsattacker har jag tvingats införa automatiska blockeringar av besök som laddar många sidor under kort tid. Förhoppningsvis ska inga oskyldiga besökare drabbas av detta, men om du får felmeddelanden eller märker att sajten är död i en timme, så skicka e-post till , så får jag skruva ner inställningarna.

Huvudmeny

material som ska få undertext

Startat av Jonas9881, 2 februari 2024 kl. 12:35:07

Föregående ämne - Nästa ämne

0 Medlemmar och 3 gäster tittar på detta ämne.

Ovanliga dubbningar

Citat från: Jonas9881 skrivet  2 februari 2024 kl. 12:35:07Nu skapar jag en egen tråd för ett ämne som jag tycker är viktigt.

Det finns tusental av program som inte är textade, och speciellt äldre program som är från bland annat VHS, som inte har fått en egen undertext.

Så nu erbjudar jag mig på obestämd tid att texta program som inte har undertext.

Kommer göra en lista på vad som är klart och vad som är påbörjat och så kan ni ge mig program som ni vill ha textade, så kommer jag lägga till det i listan.

Lägger även till årtal om det skulle vara fler än 1 program med samma titel. Och vet inte vilket avsnitt Sova i tält från Jasper pingvin är för avsnitt, därav så skrev jag titeln till serien.

Edit: Kommer underlätta om jag får en källa till materialet jag ska texta, för det kan hända att jag själv inte har det ni söker så vill gärna att ni anger en källa till filmen/serien som jag sedan kan ladda ner.
Hur har det gått med det här? Håller du fortfarande på med textning?

Om du eller någon annan har möjlighet skulle jag gärna se svensk text till orginaldubbningen av Snövit och de sju dvärgarna (1938), när jag inom kort kommer lägga upp filmen på nytt efter att den plockades ned.

Jag har provat med Whisper och KB-Whisper, men tyvärr blev resultatet inte särskilt bra med en så gammal dubbning - den kan utgås ifrån och går givetvis betydligt snabbare än att göra från scratch, men måste bearbetas väldigt kraftigt. :(

På sikt vore även orginaldubbningen av Bambi önskvärt, när jag kommit så långt.

@Oscar Isaksson : Råkar du ha dom svenska sångtexterna till sångerna i orginaldubbningen av Snövit och de sju dvärgarna? Jag har själv försökt att höra vad dom sjunger, men gått bet på flertalet ställen.

Citat från: Anders M Olsson skrivet 22 november 2025 kl. 11:01:15Jag har gjort vissa framsteg. Det finns ett exempelscript till Faster-whisper på KBs sida:

#### faster-whisper model ####
from faster_whisper import WhisperModel

model_id = "KBLab/kb-whisper-large"
model = WhisperModel(
    model_id,
    device="cuda",
    compute_type="float16",
    download_root="cache", # cache directory
    # condition_on_previous_text = False # Can reduce hallucinations if we don't use prompts
)

# Transcribe audio.wav (convert to 16khz mono wav first via ffmpeg)
segments, info = model.transcribe("audio.wav", condition_on_previous_text=False)
print("Detected language '%s' with probability %f" % (info.language, info.language_probability))

for segment in segments:
    print("[%.2fs -> %.2fs] %s" % (segment.start, segment.end, segment.text))

Det kan man kopiera och spara som ett python-script, t.ex. som fw-sv.py. Helst skapar man en egen mapp för ändamålet eftersom det kommer att skapas underkataloger för modellerna första gången man kör scriptet.

Man måste installera Faster-whisper med kommandot
pip install faster-whisper
Kanske fungerar det för dig, men jag lyckades inte få scriptet att fungera med cuda (matematik i grafikkortet), så jag ändrade två rader till
device="cpu",
compute_type="int8",
Att räkna i cpu:n blir förmodligen lite långsammare, men bättre att det går långsamt än inte alls.

Sen kan man köra scriptet med kommandot
python fw-sv.py
Ljudet som ska transkriberas måste dessförinnan ha sparats som en 16 kHz wav-fil i mono döpt till audio.wav.

Resultatet blir kanske lite svårt att använda utan konvertering p.g.a. hur start och stopptiderna för replikerna anges.
[0.00s -> 2.00s]  Jag behöver hjälp!
[2.00s -> 5.00s]  Mabel, jag håller precis en kurs.
[5.00s -> 7.00s]  En kurs som du är anmäld till.
[7.00s -> 8.00s]  Tjabba, Mabel!
[8.00s -> 10.00s]  Följ med här.
[10.00s -> 14.00s]  De traditionella metoderna för att förstå djuren fungerade bara inte.

Man vill kanske hellre ha resultatet i en .srt-fil. Jag hittade ett exempel på nätet som jag har bakat in i scriptet som då blev så här:

#### faster-whisper model ####
from faster_whisper import WhisperModel
import pysubs2

model_id = "KBLab/kb-whisper-large"
model = WhisperModel(
    model_id,
    device="cpu",
    compute_type="int8",
    download_root="cache", # cache directory
    # condition_on_previous_text = False # Can reduce hallucinations if we don't use prompts
)

# Transcribe audio.wav (convert to 16khz mono wav first via ffmpeg)
segments, info = model.transcribe("audio.wav", condition_on_previous_text=False, language="sv")
print("Detected language '%s' with probability %f" % (info.language, info.language_probability))

# to use pysubs2, the argument must be a segment list-of-dicts
results= []
for s in segments:
    segment_dict = {'start':s.start,'end':s.end,'text':s.text}
    results.append(segment_dict)

subs = pysubs2.load_from_whisper(results)
#save srt file
subs.save('audio.srt')
#save ass file
#subs.save('audio.ass')

Jag lade även till language="sv" för att tvinga programmet att jobba med svenska ifall språkidentifieringen skulle misslyckas.

Detta kräver modulen pysubs2 som kan installeras med
pip install pysubs2
Resultatet sparas i audio.srt.

Det är förstås inte så elegant att ha filnamnen hårdkodade i scriptet, så det får bli föremål för vidare utveckling...
Det här var minsann inte så enkelt, i synnerhet för en som inte är så tekniskt vass, men till sist har jag lyckats följa dina instruktioner och fått KB-Whisper att fungera.

Klart bättre än Whisper, men dessvärre långt ifrån perfekt när det kommer till gamla 1930- och 1940-talsdubbningar.