Lần này, vòng tròn model mã nguồn mở đúng là có mùi “máy lắp ráp ở phố máy tính” rồi đấy


Baseten không phải huấn luyện lại một mô hình đa phương thức hoàn chỉnh, mà là gắn bộ mã hóa thị giác MoonViT của Kimi K2.6 vào GLM-5.2 vốn trước đó chỉ xử lý văn bản. Thân GLM 744B không hề thay đổi, tháp thị giác cũng được đóng băng toàn bộ; thứ thực sự được huấn luyện chỉ là PatchMerger ở giữa với khoảng 49,5 triệu tham số
Kết quả trên MMMU-Pro đạt khoảng 55%, và phía chính thức nói là gần với Claude 4,5 Haiku. Nói cách khác, sau này để bổ sung cho mô hình mã nguồn mở các năng lực như thị giác, giọng nói hoặc thứ khác, có thể thật sự không cần mỗi lần đều đốt tiền huấn luyện từ đầu; chọn linh kiện sẵn rồi ghép lại là được
Nhưng khoan hãy chỉ nhìn “49,5 triệu tham số là rẻ”. Bộ trọng số này khoảng 466GB; với ngữ cảnh đầy đủ 1 triệu, cần 8 con B200, còn chạy ở 256K cũng cần 4 con. Rào cản nghiên cứu thì đúng là đã giảm, nhưng hóa đơn triển khai thì chẳng hề dễ chịu
Vì vậy, tôi nghĩ chuyện này đối với các công ty mô hình chưa chắc đã toàn là tin tốt. Năng lực ngày càng dễ bị ghép lại, và thứ có khả năng tiếp tục “thu tiền thuê nhà” thật sự có thể vẫn là $NVDA, các nền tảng suy luận và nhà cung cấp lưu trữ trên đám mây. Sau này mọi người không chỉ tải model về, mà có khi còn phải học cách lắp ráp model🤣
#Ourbit 不只 Crypto,全球熱門資產一站交易。
NVDA-0,83%
Xem bản gốc
Trang này có thể chứa nội dung của bên thứ ba, được cung cấp chỉ nhằm mục đích thông tin (không phải là tuyên bố/bảo đảm) và không được coi là sự chứng thực cho quan điểm của Gate hoặc là lời khuyên về tài chính hoặc chuyên môn. Xem Tuyên bố từ chối trách nhiệm để biết chi tiết.
  • Phần thưởng
  • Bình luận
  • Đăng lại
  • Retweed
Bình luận
Thêm một bình luận
Thêm một bình luận
Không có bình luận
  • Đã ghim