模型的相关内容 - 漫话开发者

2024-02-02 talkingdev

Llava 1.6发布，OCR、推理和世界知识得到改进

Llava是一种视觉语言模型，最新版本为1.6，经过改进后，其OCR、推理和世界知识等方面有了很大提升，甚至在某些任务上可以与Gemini相媲美。Llava团队计划发布数据、代码和模型，以便更多人能够使用。

2024-02-02 talkingdev

1月份微软研究论坛上，Dipendra Misra提出了一种名为“Layer-Selective Rank Reduction（LASER）”的技术，通过用一个较小的近似矩阵替换权重矩阵，提高了大型语言模型（LLM）的准确性。

2024-02-02 talkingdev

AI社区因HuggingFace和4chan分享的一个名为“miqu-1-70b”的泄漏大型语言模型而感到兴奋。该模型表现出能与OpenAI的GPT-4相媲美的性能，并与Mistral的Mixtral 8x7b有关。Mistral的CEO确认这是一位热情的客户泄露的，这...

2024-02-02 talkingdev

谷歌似乎要完全放弃“Bard”品牌，并全面转向“Gemini”。本周早些时候，Bard的所有电话体验都更名为“Gemini”。现在，移动设备和Web上的应用程序都显示“Bard现在是Gemini”。Bard由Gemini Pro提供支持，这是谷歌最新的AI...

2024-02-01 talkingdev

SliceGPT引入了一种新的后训练稀疏化方案，以减少大型语言模型的资源需求。通过将权重矩阵替换为较小的矩阵并减少嵌入维度，它可以在主要模型（如LLAMA2-70B和OPT 66B）中删除高达25%的模型参数，同时保留高达99%的...

2024-02-01 talkingdev

Enchanted 是一个开源的 iOS 应用，它允许你在移动设备上运行语言模型。该应用能够快速地识别语音和文本并进行分类，是一个非常有用的工具。这个项目的代码已经在 GitHub 上公开，并且允许开发者自由调整和使用。

2024-02-01 talkingdev

使用较低精度的模型训练速度更快、更便宜，但不稳定。最近有很多关于量化训练的研究。这个代码库建立在这些基础上，提供易于阅读和可修改的代码，实现浮点8训练。

2024-02-01 talkingdev

在训练语言模型时，一个挑战是为任务找到足够多样化的数据集。更难的是，将这些数据可视化。这个很酷的工具使用快速聚类和主题建模，使得可以探索数据，以改善过滤和整体质量。