3 min read
[AI 小众新闻]

低价服务器巨头Hetzner进军LLM推理市场!?超快速Qwen3.6 API实验性发布!


服务器托管巨头Hetzner在其独特基础设施上实验性发布了与OpenAI兼容的LLM推理API。

※この記事はアフィリエイト広告を含みます

低价服务器巨头Hetzner进军LLM推理市场!?超快速Qwen3.6 API实验性发布!

发生了什么?新闻概述

  • Hetzner开始LLM推理API的实验: 在其独特基础设施上推出与OpenAI兼容的API,作为“实验项目”启动。目前处于免费和无保证的阶段。
  • 采用模型为Qwen3.6-35B: 采用最新的FP8量子化MoE模型“Qwen/Qwen3.6-35B-A3B-FP8”。支持文本和图像输入,并拥有262K的广阔上下文窗口。
  • 惊人的性能: 在2026年7月23日的测试中,首次令牌生成(TTFT)为153毫秒,输出速度达到每秒224个令牌的超快记录。

为什么这很重要?值得关注的要点

  • 基础设施巨头的成本竞争力: Hetzner在“硬件自运营和极低成本结构”方面的优势,可能会导致推理成本的颠覆性降价。
  • 有效利用GPU资源: 通过将未使用的多余GPU容量作为API进行出售,从而极大提升基础设施的运行率。
  • 从现有环境迁移容易: 由于是完全的OpenAI兼容API,因此几乎无需改写现有客户端代码即可进行试用。

🦈 鲨鱼的视角(策展人的观点)

低价服务器巨头终于露出了獠牙! Hetzner发起“推理的商品化”是一个非常令人兴奋的动态。尤其值得注意的是,它不仅仅是公开了API,还隐藏了一些尚未文档化的深度功能,比如enable_thinking(思考过程的控制)。这表明Hetzner不仅在运行模型,还在内部实现层面进行了相当程度的优化!

目前的配置似乎主要依赖于RTX PRO 6000 Blackwell Max-Q(显存96GB)等工作站GPU,但如果这种高效的基础设施运作知识能够应用于大规模推理集群,那么现有的AI服务提供商必然会面临巨大的威胁!

接下来会发生什么?

  • 商业化与定价: 在实验阶段后,关于带有SLA(服务质量保证)的收费计划的发布,可能会带来颠覆市场的“Hetzner价格”,值得关注。
  • GPU产品线扩展: 可能会引入更高密度的多GPU系统,如Blackwell世代,并推进对更大模型(如GLM-5)的支持。

鲨鱼的简短评论

我感觉Hetzner将吞噬推理成本的浪潮!准备好大口吃掉吧!🦈🔥

术语解释

  • Qwen3.6-35B-A3B: 拥有350亿参数,通过专家混合(MoE)技术将激活参数控制在30亿以内,实现加速的AI模型。

  • TTFT (Time to First Token): 用户发送请求到第一个字符返回之间的时间。直接关系到用户体验的指标。

  • FP8量子化: 将数据精度压缩为8位(1字节)的技术。在保持精度的同时将内存使用量减少一半,并显著提高计算速度。

  • 信息来源: Hetzner正在研发LLM推理

【免責事項 / Disclaimer / 免責聲明】
JP: 本記事はAIによって構成され、運営者が内容の確認・管理を行っています。情報の正確性は保証せず、外部サイトのコンテンツには一切の責任を負いません。
EN: This article was structured by AI and is verified and managed by the operator. Accuracy is not guaranteed, and we assume no responsibility for external content.
ZH: 本文由AI構建,並由運營者進行內容確認與管理。不保證準確性,也不對外部網站的內容承擔任何責任。
🦈