Miközben világszerte egyre hevesebben folyik a vita arról, hogy az AI-fejlesztők jogosan használhatnak-e fel szerzői jog által védett online tartalmakat modelljeik tanítására, egy friss kutatás példát mutat egy alternatív, átláthatóbb - bár időigényesebb - útra. Több mint két tucat kutató, köztük az Eleuther AI nonprofit intézet szakemberei, nyolc terabájtnyi szöveges adathalmazt állítottak össze kizárólag közkincs vagy nyílt licenc alatt álló forrásokból. Az így tanított, 7 milliárd paraméteres nyelvi modelljük teljesítménye összevethető lett a Meta 2023-b...