商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 编程开发 > 使用C#实现文本转语音(TTS)及多音频合并

使用C#实现文本转语音(TTS)及多音频合并

  发布于2026-07-12 阅读(0)

扫一扫,手机访问

一、文字转语音核心实现(System.Speech)

在C#中实现文本转语音,最直接的方式就是使用System.Speech命名空间下的SpeechSynthesizer。下面这个类封装了核心功能——它先初始化一个语音合成器,指定输出为null(防止默认发声),然后配置音频格式为16kHz采样率、16位、单声道。生成语音时,将文字转为音频流,最后写为WA V文件。需要注意的几个参数:语速范围-10到10,音量0到100,这里选择了女声。如果后续想调整音色,也可以通过SelectVoiceByHints切换。

using System.Speech.Synthesis;
using System.Speech.AudioFormat;
public class VoiceSynthesizer
{
    private readonly SpeechSynthesizer _synthesizer;
    private readonly SpeechAudioFormatInfo _audioFormat;
    public VoiceSynthesizer()
    {
        _synthesizer = new SpeechSynthesizer();
        _synthesizer.SetOutputToNull(); // 禁用默认输出
        _audioFormat = new SpeechAudioFormatInfo(
            16000, // 采样率
            AudioBitsPerSample.Sixteen,
            AudioChannel.Mono);
    }
    /// 
    /// 生成语音文件
    /// 
    public string GenerateSpeech(string text, string outputPath)
    {
        using var stream = new MemoryStream();
        _synthesizer.SetOutputToWa veStream(stream);
        // 设置语音参数
        _synthesizer.Rate = 0;      // 语速(-10到10)
        _synthesizer.Volume = 100;  // 音量(0-100)
        _synthesizer.SelectVoiceByHints(VoiceGender.Female); // 选择语音
        _synthesizer.Speak(text);
        _synthesizer.SetOutputToNull();
        File.WriteAllBytes(outputPath, stream.ToArray());
        return outputPath;
    }
}

二、多音频合并实现(NAudio库)

语音片段生成后,往往需要把它们拼接起来。NAudio库提供了简洁的合并方案。下面这个AudioMerger类支持两种方式:一种是简单的顺序拼接(直接复制音频数据),另一种是带淡入淡出的混合。注意,淡入淡出是通过MixingSampleProvider和扩展方法实现的——先获取每个文件的采样提供器,然后叠加并应用淡入淡出效果。如果你只是做简单拼接,用MergeAudioFiles就够了;如果希望听觉上更平滑,可以调用FadeMerge,并调整fadeInMs和fadeOutMs参数。

using NAudio.Wa ve;

public class AudioMerger
{
    /// 
    /// 合并多个WA V文件
    /// 
    public void MergeAudioFiles(List inputFiles, string outputFile)
    {
        using var output = new Wa veFileWriter(outputFile, new Wa veFormat(16000, 1));
        
        foreach (var file in inputFiles)
        {
            using var input = new Wa veFileReader(file);
            input.CopyTo(output);
        }
    }

    /// 
    /// 带淡入淡出的音频合并
    /// 
    public void FadeMerge(List files, string output, int fadeInMs = 500, int fadeOutMs = 500)
    {
        var mixer = new MixingSampleProvider(new[] { GetAudioProvider(files[0]) });
        
        for (int i = 1; i < files.Count; i++)
        {
            mixer.Add(input);
        }

        // 添加淡入淡出效果
        mixer = mixer.AppendFadeIn(fadeInMs).AppendFadeOut(fadeOutMs);
        
        Wa veFileWriter.CreateWa veFile(output, mixer);
    }

    private ISampleProvider GetAudioProvider(string path)
    {
        var reader = new AudioFileReader(path);
        return reader.ToSampleProvider();
    }
}

三、完整工作流程示例

把上面的两个类组合起来,就得到了一个完整的TTS工作流。ProcessBatch方法接收文本列表,先逐个生成临时WA V文件,然后用MergeAudioFiles合并,最后清理临时文件。这里用到了try-finally确保不留下垃圾文件。如果你需要异步处理或更多控制,可以在此基础上扩展。

public class TtsWorkflow
{
    private readonly VoiceSynthesizer _tts;
    private readonly AudioMerger _merger;

    public TtsWorkflow()
    {
        _tts = new VoiceSynthesizer();
        _merger = new AudioMerger();
    }

    public void ProcessBatch(List texts, string outputDir)
    {
        var tempFiles = new List();

        try
        {
            // 分段生成语音
            foreach (var text in texts)
            {
                var tempFile = Path.Combine(outputDir, $"temp_{Guid.NewGuid()}.wa v");
                _tts.GenerateSpeech(text, tempFile);
                tempFiles.Add(tempFile);
            }

            // 合并音频
            _merger.MergeAudioFiles(tempFiles, Path.Combine(outputDir, "output.wa v"));
        }
        finally
        {
            // 清理临时文件
            foreach (var file in tempFiles)
            {
                File.Delete(file);
            }
        }
    }
}

四、关键功能扩展

在实际项目中,你可能需要更精细的控制,比如根据内容切换语速、性别,或者支持SSML标记。下面几个扩展点可以按需集成。

1. 语音参数配置

// 设置语音属性
public void ConfigureVoice(VoiceGender gender, VoiceAge age, int rate = 0, int volume = 100)
{
    _synthesizer.SelectVoiceByHints(gender, age);
    _synthesizer.Rate = rate;
    _synthesizer.Volume = volume;
}

2. 异步处理优化

public async Task GenerateSpeechAsync(string text, string outputPath)
{
    return await Task.Run(() => GenerateSpeech(text, outputPath));
}

3. SSML标记支持

public string GenerateSsmlSpeech(string ssml)
{
    var promptBuilder = new PromptBuilder();
    promptBuilder.LoadSsml(ssml);
    using var stream = new MemoryStream();
    _synthesizer.SetOutputToWa veStream(stream);
    _synthesizer.Speak(promptBuilder);
    return File.ReadAllBytes(stream.ToArray()).ToBase64();
}

五、性能优化

当处理大量文本时,性能就成了关键。可以考虑两个方向:一是语音缓存,避免重复合成相同文本;二是并行批处理,利用多核优势。下面代码分别展示了这两种思路。

1. 语音缓存机制

使用C#实现文本转语音(TTS)及多音频合并

private static readonly Dictionary _speechCache = new();

public string GetCachedSpeech(string text)
{
    if (!_speechCache.TryGetValue(text, out var data))
    {
        data = GenerateSpeech(text, Path.GetTempFileName());
        _speechCache[text] = data;
    }
    return Convert.ToBase64String(data);
}

2. 批量处理优化

public void BatchProcess(List segments)
{
    Parallel.ForEach(segments, segment => 
    {
        var tempFile = _tts.GenerateSpeech(segment.Text, Path.GetTempFileName());
        lock (_merger)
        {
            _merger.AppendToOutput(tempFile);
        }
    });
}

六、异常处理与日志

生产环境下的稳定性很重要。这里提供了一个异常处理类,针对不同错误类型做了区分:如果是语音引擎未初始化,就重新初始化;如果是文件写入失败(比如磁盘满),则重试操作;其他未知错误记录栈信息。日志写到了error.log文件中,方便排查。

public class TtsExceptionHandler
{
    public void HandleException(Exception ex)
    {
        if (ex is InvalidOperationException)
        {
            Log($"语音引擎未初始化: {ex.InnerException?.Message}");
            InitializeEngine();
        }
        else if (ex is IOException)
        {
            Log($"文件写入失败: {ex.Message}");
            RetryOperation(() => File.WriteAllText(outputPath, content));
        }
        else
        {
            Log($"未知错误: {ex.StackTrace}");
        }
    }

    private void Log(string message)
    {
        File.AppendAllText("error.log", $"{DateTime.Now}: {message}\n");
    }
}

七、部署与依赖管理

构建这个方案需要的NuGet包有两个:System.Speech和NAudio。版本可参考下面配置。运行环境限定在Windows(需要语音引擎),.NET版本建议6.0或更高。如果处理长文本,内存建议至少2GB——当然,实际占用取决于文本长度和并行度。

1. NuGet依赖


2. 运行环境要求

  • Windows 10/11(需安装语音引擎)
  • .NET 6.0或更高版本
  • 至少2GB可用内存(处理长文本时)

八、应用场景示例

这套方案可以直接拿来为有声读物或实时播报提供支持。比如,把一本书的章节逐行读入,生成一个完整的音频文件;或者用默认音频设备实时播报当前温度。下面两个例子展示了具体用法。

1. 有声读物生成

var texts = File.ReadAllLines("book.txt")
                .Select(line => line.Trim())
                .Where(line => !string.IsNullOrEmpty(line))
                .ToList();

var processor = new TtsWorkflow();
processor.ProcessBatch(texts, "audiobook_output");

2. 实时语音播报

var synthesizer = new VoiceSynthesizer();
synthesizer.SetOutputToDefaultAudioDevice();
synthesizer.SpeakAsync("当前温度:25℃");

九、高级功能实现

如果想让合成语音更具表现力,可以尝试情感语音合成——通过SSML的prosody标签控制语速和音调。下面代码定义了一个VoiceEmotion枚举,并在SetEmotion中动态调整。另外,多语言支持也很实用,通过GetInstalledVoices筛选指定文化(例如zh-CN)的语音引擎即可切换。

1. 情感语音合成

public void SetEmotion(VoiceEmotion emotion)
{
    var prompt = new PromptBuilder();
    prompt.AppendSsmlMarkup($"");
    prompt.AppendText("需要强调的文本");
    prompt.AppendSsmlMarkup("");
    _synthesizer.Speak(prompt);
}

public enum VoiceEmotion
{
    Neutral,
    Happy,
    Angry,
    Sad
}

2. 多语言支持

public void SwitchLanguage(string cultureCode)
{
    var voices = _synthesizer.GetInstalledVoices();
    var targetVoice = voices.FirstOrDefault(v => 
        v.VoiceInfo.Culture.Name.Equals(cultureCode, StringComparison.OrdinalIgnoreCase));
    
    if (targetVoice != null)
    {
        _synthesizer.SelectVoice(targetVoice.VoiceInfo.Name);
    }
}

十、性能测试数据

最后附上一组实际测试数据,供性能评估参考。测试环境为普通Windows机器,.NET 6.0。从数据看,多线程对短文本加速效果明显(2.3s→0.8s),而10个文件的合并由于磁盘IO瓶颈,耗时差异不大。内存占用在可接受范围内。

场景单线程耗时多线程耗时内存占用(MB)
100句短文本合成2.3s0.8s15
1小时长文本合成45s18s80
10文件合并--5
本文转载于:https://www.jb51.net/program/362883mca.htm 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注