开车上高速,十辆车里有八九辆都是「嘀」一声之后抬杆通过。全国装了 ETC 的车超过 3 亿辆,渗透率超过 80%,光设备就是一个 600 亿规模的市场。该装的基本装完了,剩下的只有有限增量和存量替换,硬件价格从最早的几百块一路杀到几十块,利润空间被榨得差不多。ETC 设备还能怎么突破,成了厂商绕不开的问题。

行业侧的压力是上面这些。落到设备本身,问题更直接。传统扣费播报要提前预录几百条语音文件,再一条条去匹配触发条件。金额本身就是变量,27.08 元和 103.50 元得分开录,路段名、限速值、天气类型同样如此。变量一多,语音库的规模就失控,存储要钱,匹配逻辑要人写,后期想改一句文案还得重新烧录一轮。产品定义想往前挪一步,成本先跳起来。
ETC 停车场和加油站扣费是同样的处境。场景一扩展,预录方案的组合数量就跟着翻倍,而设备的存储和外围电路并不会跟着变便宜。

2024 年 12 月,交通运输部发布《公路电子不停车收费车路协同拓展应用技术规范》(JTG/T 6520-2024),自 2025 年 3 月 1 日起施行。这份公路工程推荐性行业标准把 ETC 技术体系迭代为 ETC 2.0,应用场景从高速收费拓展到车路协同,系统由拓展应用平台、路侧智能站、路侧单元、车载单元和智能信息终端组成。规范里明确,车载单元作为信息接收端,要通过声音、图文、视频这些方式向用户做提醒服务。
说白了,新规下的车载单元不能只「嘀」一声,得把路侧单元下发的信息说清楚。以前那个只会响一声的小黑盒子,放在新标准里已经不够用。
市场端的反应也印证了这一点。新标准实施后,不少头部品牌迅速把「智能语音播报」写进核心卖点。电商平台上「给 ETC 装上 AI 语音,到底有多离谱」「没有语音的 ETC 正在被淘汰」这类说法越来越常见,商品评论区里被点名最多的好评,恰恰是扣费金额实时播出来,每一笔消费清清楚楚。

需求、标准、用户认可三样都齐了,厂商要算的是另一笔账。能不能在不增加太多硬件成本、不拉长开发周期的前提下,把文字信息变成语音播报出来。
唯创知音的 TTS 文字合成语音方案走的就是这条路。主控通过串口把文字发给 WT3000TX,芯片当场合成,直接读出来。支持任意中文文本与英文字母的合成,中文和英文字母混读同样没问题。
放到高速收费站的场景里看更直观。主控识别到 ETC 设备扣款成功后,直接把「本次通行费 27.08 元」这段文字发过去,芯片现场合成播报,不需要提前预录音,也省掉了存储管理和匹配逻辑。
车路协同、ETC 停车场、加油站扣费是同一个原理。车载单元收到路侧设备发来的路面事故预警、限速、气象、扣费这些信息后,把文字交给 WT3000TX 合成语音播出来。
芯片拿到文本会先做一遍分析,常见的数字、号码、时间、日期、度量衡符号这些格式,能按内置的文本匹配规则正确识别和处理。金额、限速值这类内容不会读错,这对扣费播报是个关键点。

ETC 设备上要播的是动态文字。主控把文字发给 WT3000TX,芯片自动把文字转换成语音波形,通过扬声器播出来,不需要提前烧录任何音频文件。发什么文字,它就现合成现播什么。
文字解析采用 GB 2312 编码方式,日常使用的汉字都能识别,不需要另外挂字库芯片。每次合成的文本量最多可达 2K 字节,换算下来大约 1000 个中文字符。路况预警、天气播报这类长句信息,一次性就能处理完,不用分段拼接。
WT3000TX 内部集成了高性能 32 位处理器,最高频率可达 240 兆赫兹,配合一套 TTS 语音合成算法引擎和内置语音存储空间,芯片自己就能完成从文字到语音的完整转换。不连网络,不上传云端,云端语音合成服务费全省了,也不受隧道、地库、高速上信号波动的影响。
主控和 WT3000TX 之间走标准 UART 串口,默认波特率 9600,上电即通,不需要额外配置。整个通信都在设备本地完成,不经过任何中间设备,没有网络延迟,也不用配对、握手、服务器中转这些环节。主控把要播的文字通过串口发过来,芯片直接就播,从收到文字到出声在 0.1 秒内完成。
芯片还带 BUSY 状态指示,播放时为低电平,不播放时为高电平。主控想知道上一句播完没有,读一个引脚或者发一条状态查询指令就行,做播报队列和现场调试都省事。
WT3000TX 提供 6 个发音人可选,语速和语调各 11 级可调(取值 0 到 10,默认 5),音量 31 级可调,播报内容随时能改。这些参数用文本控制标记就能设置,把标记和要播的文字一起发过去即可,标记本身不会被读出来。改法分两种。
本地升级适合研发调试和产线烧录。用唯创的上位机工具(唯创 TTS 转换软件)把新的播报文字、选好的发音人和语速准备好,写进串口下载器,下载器接 VCC、GND、TX、RX 四根线连到模块的烧录口,按下下载器上的 START 键,内容就自动写入芯片。
OTA 远程升级适合售后和运营阶段。芯片内置 OTA 升级指令,更新包存放在 SD 卡里,设备收到后在本地自动完成更新。整个过程不需要车主动手,设备也不用返厂。
支持 MP3、WAV 两种主流音频格式,码率范围 8kbps 到 320kbps,兼顾语音文件大小和音质的平衡。芯片内部模拟 DAC 的信噪比典型值 95 分贝,动态范围典型值 92 分贝,声音还原度高。高速行驶时发动机的低频轰鸣、车窗半开的风噪、车内音乐声混在一起,播报依然清晰可辨。
WT3000TX 有成品模块 WT3000T-M01 出厂,模块内部带功放,SPK+ 和 SPK- 直接接喇叭,不需要额外搭功放电路,体积只有一张邮票大小。
模块走 UART 串口通信,和 Arduino 对接只要四根线。电源接 2.6 到 5 伏,GND 接地,模块 TX 接开发板 RX,模块 RX 接开发板 TX。按唯创提供的接线方式,模块 TX 接 Arduino UNO 的 3 号 IO(配置为 RX),模块 RX 接 4 号 IO(配置为 TX),喇叭接到 PH2.00x2 的 SPK 接口上。把唯创的 Arduino 库文件夹放进 Arduino 的 libraries 目录,在客户端里依次打开 文件、示例、WTSerial、ExampleForWT3000T,编译下载就能听到声音。
厂商拿到手的是一个即插即用的模块。想播「通行费 27.08 元」,就发「通行费 27.08 元」;想播「前方 2 公里处发生事故」,就发「前方 2 公里处发生事故」。不需要写底层驱动,不需要翻数据手册,代码量压缩到几行文本级指令,精力可以放在项目逻辑本身。
对喜欢玩 Arduino 的创客和教培机构来说,同样不用处理复杂的通信协议,按图接线就能跑通。做个会说话的 ETC 模拟器、收费站模型,或者搭一套智能交通教学装置,学生通过语音播报直观理解 ETC 工作原理和车路协同的概念,课堂上排查故障的时间也能省下一大截。
| 项目 | 参数 |
|---|---|
| 处理器 | 高性能 32 位处理器,最高频率可达 240 兆赫兹 |
| 合成文本量 | 每次最多可达 2K 字节,单命令帧上限 2016 字节 |
| 文本编码 | GB 2312 编码方式 |
| 通信接口 | UART,默认波特率 9600,3.3 伏 TTL 电平 |
| 发音人 | 6 个可选(文本控制标记 [m?],取值 3、51、52、53、54、55) |
| 语速 / 语调 | 各 11 级可调,取值 0 到 10,默认 5 |
| 音量 | 31 级可调 |
| 音频格式 | MP3、WAV,码率范围 8kbps 到 320kbps |
| DAC 信噪比 | 典型值 95 分贝,动态范围典型值 92 分贝 |
| 模块供电 | 2.6 到 5 伏(WT3000T-M01 第 1 脚 5V) |
| 深度休眠功耗 | 小于 20 微安 |
| 工作温度 | 负 40 摄氏度到正 85 摄氏度 |
| 芯片封装 | QFN32,4 毫米乘 4 毫米(WT3000T8-32N) |
从高速收费到停车场扣费,从路况预警到气象播报,ETC 设备的语音能力正在从加分项变成必选项。要把这个必选项做成稳定可靠的产品,离不开扎实的全链条技术支持。唯创知音从样品领取、Arduino 原型验证、功能逻辑验证,到最终产品落地,全程提供一对一或多对一的技术支持与服务。深耕语音技术近 30 年,服务超过 3 万家企业,始终坚持为客户工程师提供快捷的语音与智能物联网应用方案,帮助缩短产品开发周期。