关注最新报道、解读和相关科技故事。
JetBrains 推出了 Junie Local,可使用 Qwen3.6-27B 模型在 Mac 设备上本地运行 Junie 编程代理,无需将代码或提示发送到云端。运行要求包括搭载 M5 处理器和 64 GB 内存的 Mac,下载量约为 20 GB。
JetBrains 介绍了其对 Junie 和推理引擎所做的调整,以便在搭载 M5 芯片的 MacBook 上本地运行 Qwen3.6-27B。该实验表明,本地编程代理的性能不仅取决于令牌生成速度,还同样取决于上下文管理和 prefill 阶段。
数据中心正转向由 CPU、GPU、NPU、专用加速器和光互连组成的异构集群,而不是让单个 GPU 承担所有任务。这一转变使软件、网络管理和能源成为降低 token 成本、提高硬件利用率的关键因素。
初创公司Etched在Jane Street测试该公司交付的首套完整人工智能系统并购买该系统、将其部署在自有数据中心后,融资7亿美元,估值达到210亿美元。这笔融资反映了市场对该公司相关设计的押注,即加速人工智能模型推理并降低其成本。
Expedera 的 Sharad Chol 分析了边缘设备从传统视觉网络转向 LLM 和 VLM 模型后,瓶颈性质如何从计算能力转变为内存流量。他介绍了基于数据包的处理在减少外部数据传输、改善汽车和嵌入式设备中模型运行方面的作用。