ERPC 大幅升级 Solana 网络基础设施,全面更新 Rust 高性能代理平台并部署至所有区域的共享 RPC、gRPC 与 Shredstream,实现零停机更新

ERPC 大幅升级 Solana 网络基础设施,全面更新 Rust 高性能代理平台并部署至所有区域的共享 RPC、gRPC 与 Shredstream,实现零停机更新

ERPC 大幅升级 Solana 网络基础设施,全面更新 Rust 高性能代理平台并部署至所有区域的共享 RPC、gRPC 与 Shredstream,实现零停机更新
由 ELSOUL LABO B.V.(总部:荷兰阿姆斯特丹,CEO:Fumitake Kawasaki)与 Validators DAO 运营的 ERPC,完成了对其 Solana 网络基础设施的重大升级。
此次升级已应用于 ERPC 提供的所有区域和所有共享端点(Solana RPC、Geyser gRPC 和 Shredstream)。我们把连接初始化、TLS 处理、缓存控制、HTTP/1.1 和 HTTP/2 传输、长连接行为,以及可观测性和故障排查指标等往往直接影响实际运营结果的基础设施行为,作为一个整体系统加以更新。
在维持日常响应性的基础上,我们还重新组织了底层网络行为,使其在容易导致结果退化的场景中——如峰值负载波动、持续运营下的不稳定性,以及断连和重连触发的级联——更不容易产生偏差或不稳定。因此,该环境现在更有利于在实际 Solana 运营中同时维持性能和稳定性。
此外,我们已过渡到可以在完全零停机的情况下应用网络配置变更和平台升级的运营架构。定价、规格、认证或速率限制均无变化,现有 ERPC 客户无需任何额外设置或运营变更即可享受升级带来的收益。

背景

在实际的 Solana 运营中,平均响应时间和正常时段延迟是关键的基线要求。同时,存在一些底层网络基础设施行为本身决定结果的场景——如负载集中时、长连接运行期间,以及断连与重连期间。
共享端点尤其需要同时适应短时间窗口内的交易提交突发和通过 WebSocket 及 gRPC 的持续连接。在这些条件下,基础设施层面的行为——连接初始化、TLS 握手、传输行为、缓存处理和从空闲状态恢复——直接影响用户体验和执行结果。
即便以平均响应速度为明确基线,峰值或持续运行期间的实际结果仍可能由其他因素决定。因此,实际运维既要保证日常可用性,也要维持故障易发场景中的连续性。
ERPC 设计并运营自己的 Rust 高性能代理平台作为 Solana 通信的基础,维持在所有区域应用相同方法的架构,同时持续演进平台。此次升级将运营中观测到的问题作为统一系统重新审视——从连接初始化到长时间运行——并相应地重新组织整个网络基础。

ERPC 客户有何变化

通过此次更新,ERPC 客户首先会看到连接建立初期更加稳定。建立连接并完成 TLS 处理时,状态不匹配和无谓重试都会减少,使交易和数据流更容易从一开始就可靠进入处理。
其次,我们重构了峰值负载期间容易引发波动的基础设施行为。通过及早过滤无用连接,并同步改进 HTTP/1.1 与 HTTP/2 传输、超时一致性、连接池健康度、资源竞争时的缓存行为,以及可观测性与故障排查指标,即使负载集中,处理也更不容易失衡。
对于长连接的 WebSocket 和 gRPC 流以及持续监控工作负载,连接连续性得到了改善。断连/重连/重新同步事件的频率——以及这些事件级联影响结果的可能性——已降低,使围绕持续运行来设计运维变得更加容易。
缓存控制和传输行为的改进,也减少了拥堵期间重复拉取和无效处理。带宽与处理余量能够更稳定地保持可用,扩展后的指标和可观测能力则有助于缩短根因定位与恢复时间。
此外,通过实现零停机的配置变更和平台升级,我们建立了能够以高频率提升性能、稳定性和整体平台质量的运营条件。不暂停平台即可持续改进,进一步保障了客户业务的连续性。

改进详情

此次升级并不以特定功能名称或版本号作为发布主线。相反,它把往往主导实际 Solana 结果的场景拆分到以下层面——连接初始化、TLS、L4/HTTP 边界、H1/H2 传输、缓存、可观测性、故障行为和长期运营先决条件——并更新平台,使这些层能够彼此一致地协同工作。
下面,我们从对客户体验和运营结果的贡献角度解释所纳入的改进。

连接初始化和 TLS 处理的改进

我们扩展了连接建立期间处理的 TLS 上下文,并更新了结构,使所需状态能够得到妥善保留和应用。这减少了连接建立初期的状态不匹配和无谓重试。
我们还重构了 TLS 处理,包括证书验证和主机名验证,在满足安全要求的同时,减少握手失败或处理不一致所造成的起始阶段损耗,避免其进一步影响结果。这不仅仅是安全增强;它有助于稳定从连接开始到进入 Solana 工作负载处理的行为。
我们进一步加强了提升 TLS 相关行为可观测性和可排查性的机制。在初始化主导结果的场景中,复现问题、识别原因和快速落实修复的能力成为维护体验质量的核心能力。

通过早期过滤不必要连接来保持余量

我们引入了早期过滤 TCP 连接的机制,减少异常或无用连接对正常流量造成的压力。在共享端点中,连接请求可能因外部因素或暂时性偏差而激增。
早期过滤可减少正常连接在建立阶段停滞的情况,并让峰值负载期间的处理余量更容易保持可用。因此,即使负载集中,处理也更不容易失衡,延迟分布会更加稳定。

通过重新组织 L4/HTTP 边界来明确连接模型

网络基础设施不止于 HTTP。连接建立和连续性取决于 L4 条件,该层的波动会传播到更高层协议体验。
在此次更新中,我们抽象了 L4 流处理并重新组织了结构,以更清晰的方式管理连接模型。这使平台在连接持续增长、客户端实现各异、长时间运行导致状态转换的场景中更容易维持一致行为。
重试行为也被重新组织,以减少短期波动级联到用户体验的模式。实际稳定性更多取决于防止故障级联,而非消除孤立故障。

HTTP/1.1 和 HTTP/2 传输及长时间运行行为的改进

我们增加了可跨 HTTP/1.1 和 HTTP/2 一致跟踪传输数据量的监测指标。这让传输管道中的停滞或瓶颈更容易被识别,也提高了故障排查和修复的速度。
我们还重构了 HTTP/2 body-write 超时行为,以减少集中负载或长时间数据流期间的异常停顿和挂起。在长时间运行中,重要的不是理想状态下的峰值性能,而是在状态转换期间防止行为崩溃的能力。
空闲超时行为和连接池处理也已审查,消除了在持续运行过程中容易累积的不稳定因素。在 HTTP/1.1 方面,我们重新组织了对持有不完整请求的连接进行安全关闭的方式,减少了资源使用和行为方面的波动源。

缓存控制和运营质量的改进

我们增强了追踪资产为何未被缓存的能力,提升了缓存行为的可解释性。在实践中,主导因素不是缓存是否存在,而是在什么条件下被应用以及在什么条件下失效。
我们重构了锁行为、过期内容处理和重新验证模式,避免峰值负载下的资源竞争引发体验劣化级联。我们还完善了缓存对象增多时的淘汰控制,并优化部分内容处理(包括 Range 请求),进一步减少真实工作负载中的重复拉取和延迟。
这些改进减少了缓存行为出现异常偏差的情况,使客户不太可能需要围绕基础设施层面的不确定性来设计运营。

故障行为、日志和可观测性的改进

故障行为和日志已重新组织,使问题发生时更容易理解发生了什么。下游错误级联到缓存或传输行为、进而恶化体验的情况已经减少,也更容易界定故障影响范围。
可观测性和故障排查的改进不是为了宣称“零事故”,而是为了在事故发生时缩短恢复时间。这降低了峰值负载和持续运营场景中的风险。

依赖项更新和安全修复作为长期运营先决条件

我们纳入了依赖项更新和安全修复,以维持长期平台运营的先决条件。这包括与最低支持 Rust 版本(MSRV)和 CI 对齐相关的更新,加强了持续演进平台所需的基础。
能够安全地持续更新,本身就是长期质量的要求。

向零停机运营的过渡

此前,网络配置变更或平台升级期间可能出现短暂停机。通过此次更新,我们已过渡到可以在完全零停机下应用这些操作的架构。
共享端点既有长期连接,也持续存在对时序敏感的操作。即使短暂停机,也可能触发断连、重连和重新同步的级联,其成本还会进一步影响结果。零停机更新降低了这类级联的发生概率,避免长时间运行的业务被打断。
同时,ERPC 现已具备把观测到的问题快速转化为改进的运维能力。更高的迭代频率使我们能够在生产运营中持续消除波动和边缘场景中的异常行为。

按服务的影响

Solana RPC(HTTP / WebSocket)

连接初始化、TLS、缓存控制和传输行为的改进影响数据读取和交易提交两方面。在维持日常可用性的同时,减少了在峰值负载期间使结果产生偏差的因素,加强了在拥堵期间保持余量的条件。

Geyser gRPC

长时间数据流的连接连续性得到改善。HTTP/2 传输、超时一致性、连接池健康度和扩展的传输测量协同工作,降低了重连与重新同步的成本传导至最终结果的可能性。

Shredstream(Direct Shreds)

通过面向持续交付改进连接管理和初始化,系统更有能力在拥堵期间避免数据缺失或延迟,也更容易维持检测与后续处理的连续稳定。

打通研发与生产运维

包括 ERPC 在内的分布式系统平台已被认定为荷兰政府 WBSO 计划下的研发项目,并形成了把运维中观测到的问题纳入研究课题、再通过验证与迭代加以改进的机制。
此次网络基础更新正是这类迭代之一,已应用到所有区域,并转化为实际的性能与稳定性提升。让运维与研发保持联动,是把生产中观测到的问题持续带入下一次更新、而非止步于一次性改进的前提。
在 ERPC 内部,实际使用模式、负载波动和故障模式被纳入反复的验证和改进周期中,逐步提高网络基础的质量。此次更新是在研发与生产运营的整合框架内执行的。

客户信息

此次更新已应用于所有区域和所有共享端点。现有 ERPC 客户无需更改配置或运营。定价、规格、认证或速率限制均无变化。
由于共享端点必须同时承受短暂的峰值和长连接,架构已相应重构,使处理在这些混合工作负载下更不容易失衡。即使在运营期间发生配置变更或平台更新,变更也会以零停机方式应用,因此客户无需预先为连接中断或重新同步制定应对方案。
有关架构、特定工作负载优化或运营反馈的问题,请通过 Validators DAO 官方 Discord 联系。
通过把生产中的观测和反馈持续转化为改进,ERPC 已逐步提升了其基础质量。我们将在零停机的前提下继续推进改进,提供能够维持实际 Solana 运营结果的网络基础设施。
Validators DAO 官方 Discord:https://discord.gg/C7ZQSrCkYR ERPC 官方网站:https://erpc.global/zh